IronOCR中的意外空白
提取的文字有時會在字元間包含額外的空白,即便原文件看起來潔淨。 通常的罪魁禍首是字元寬度和間距的變化,通常與輸入字體有關,而僅靠影像濾鏡很少能清除這種問題。

以下方法已被證實可以有效避免額外空白。
解決方案
1. 切換到OCR友好的字體
在可能的情況下,以Roboto字體渲染或提供文件。 這是一種乾淨、現代的字體,閱讀可靠,因此引擎產生的錯誤空白比使用Arial等字體時少。
2. 使用ReadDocumentAdvanced()
用ReadDocumentAdvanced()來讀取文件,代替標準的讀取方法。 這能讓您在OCR過程中擁有更多控制權,並能更好地處理複雜的文字佈局。
3. 設定OcrLanguage.EnglishBest
將引擎指向OcrLanguage.EnglishBest模型。 這個進階語言模型比標準英語選項更準確,且能減少讀錯的空白。
4. 訓練自訂字體
當輸入的PDF使用不尋常或非標準的字體時,預設設定可能會出問題並插入空白。 訓練自訂字體能教會引擎識別該特定字體,從而大大提高識別能力。 請參閱OCR自訂字體訓練指南以獲取完整流程。
應用這些設定後,提取的文字不再有多餘的空白:


