IronOCR中的意外空白

This article was translated from English: Does it need improvement?
Translated
View the article in English

提取的文字有時會在字元間包含額外的空白,即便原文件看起來潔淨。 通常的罪魁禍首是字元寬度和間距的變化,通常與輸入字體有關,而僅靠影像濾鏡很少能清除這種問題。

Visual Studio 文字視覺化工具中的 OCR 結果,參考編號內在「7」與「1」之間出現非預期的空格

以下方法已被證實可以有效避免額外空白。

解決方案

1. 切換到OCR友好的字體

在可能的情況下,以Roboto字體渲染或提供文件。 這是一種乾淨、現代的字體,閱讀可靠,因此引擎產生的錯誤空白比使用Arial等字體時少。

2. 使用ReadDocumentAdvanced()

ReadDocumentAdvanced()來讀取文件,代替標準的讀取方法。 這能讓您在OCR過程中擁有更多控制權,並能更好地處理複雜的文字佈局。

3. 設定OcrLanguage.EnglishBest

將引擎指向OcrLanguage.EnglishBest模型。 這個進階語言模型比標準英語選項更準確,且能減少讀錯的空白。

4. 訓練自訂字體

當輸入的PDF使用不尋常或非標準的字體時,預設設定可能會出問題並插入空白。 訓練自訂字體能教會引擎識別該特定字體,從而大大提高識別能力。 請參閱OCR自訂字體訓練指南以獲取完整流程。

應用這些設定後,提取的文字不再有多餘的空白:

應用修正後的OCR結果,空白已修正

提示首先嘗試使用OCR友好字體和EnglishBest模型;它們能在無需訓練自訂字體的情況下修正大多數的空白問題。

Curtis Chau
技術作家

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。

除了開發,Curtis對物聯網(IoT)有濃厚的興趣,探索創新的方法來整合硬體和軟體。在空閒時間,他喜歡玩遊戲和建立Discord機器人,結合他對技術的熱愛與創造力。

準備開始了嗎?
Nuget 下載 6,136,090 | 版本: 2026.7 剛剛發布
Still Scrolling Icon

還在滾動?

想要快速證明? PM > Install-Package IronOcr
執行範例 觀看您的圖像轉變為可搜尋文字。