IronOCR中的意外空白
This article was translated from English: Does it need improvement?
Translated
View the article in English
提取的文字有時會在字元間包含額外的空白,即便原文件看起來潔淨。 通常的罪魁禍首是字元寬度和間距的變化,通常與輸入字體有關,而僅靠影像濾鏡很少能清除這種問題。

以下方法已被證實可以有效避免額外空白。
解決方案
1. 切換到OCR友好的字體
在可能的情況下,以Roboto字體渲染或提供文件。 這是一種乾淨、現代的字體,閱讀可靠,因此引擎產生的錯誤空白比使用Arial等字體時少。
2. 使用ReadDocumentAdvanced()
用ReadDocumentAdvanced()來讀取文件,代替標準的讀取方法。 這能讓您在OCR過程中擁有更多控制權,並能更好地處理複雜的文字佈局。
3. 設定OcrLanguage.EnglishBest
將引擎指向OcrLanguage.EnglishBest模型。 這個進階語言模型比標準英語選項更準確,且能減少讀錯的空白。
4. 訓練自訂字體
當輸入的PDF使用不尋常或非標準的字體時,預設設定可能會出問題並插入空白。 訓練自訂字體能教會引擎識別該特定字體,從而大大提高識別能力。 請參閱OCR自訂字體訓練指南以獲取完整流程。
應用這些設定後,提取的文字不再有多餘的空白:

提示首先嘗試使用OCR友好字體和EnglishBest模型;它們能在無需訓練自訂字體的情況下修正大多數的空白問題。
準備開始了嗎?
Nuget 下載 6,136,090 | 版本: 2026.7 剛剛發布

