IronOCR中的意外空白
Curtis Chau
Updated: 2026年6月29日
提取的文字有時會在字元間包含額外的空白,即便原文件看起來潔淨。 通常的罪魁禍首是字元寬度和間距的變化,通常與輸入字體有關,而僅靠影像濾鏡很少能清除這種問題。

以下方法已被證實可以有效避免額外空白。
解決方案
1. 切換到OCR友好的字體
在可能的情況下,以Roboto字體渲染或提供文件。 這是一種乾淨、現代的字體,閱讀可靠,因此引擎產生的錯誤空白比使用Arial等字體時少。
2. 使用ReadDocumentAdvanced()
用ReadDocumentAdvanced()來讀取文件,代替標準的讀取方法。 這能讓您在OCR過程中擁有更多控制權,並能更好地處理複雜的文字佈局。
3. 設定OcrLanguage.EnglishBest
將引擎指向OcrLanguage.EnglishBest模型。 這個進階語言模型比標準英語選項更準確,且能減少讀錯的空白。
4. 訓練自訂字體
當輸入的PDF使用不尋常或非標準的字體時,預設設定可能會出問題並插入空白。 訓練自訂字體能教會引擎識別該特定字體,從而大大提高識別能力。 請參閱OCR自訂字體訓練指南以獲取完整流程。
應用這些設定後,提取的文字不再有多餘的空白:

提示: 首先嘗試使用OCR友好字體和EnglishBest模型;它們能在無需訓練自訂字體的情況下修正大多數的空白問題。

技術作家
Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。
...
閱讀更多