IronOCRにおける予期しない空白
抽出されたテキストには、ソースドキュメントがきれいに見えても、文字間に余分なスペースが含まれていることがあります。 一般的な原因は、入力フォントに関連する文字の幅と間隔のばらつきであり、画像フィルタだけではそれをクリアすることはほとんどありません。

余分なスペースを避けるために効果的であることが実証されているアプローチは以下の通りです。
解決策
1. OCRにフレンドリーなフォントに切り替える
可能であれば、ドキュメントをRobotoでレンダリングまたは供給してください。 それはクリーンでモダンな書体で、エンジンがArialのようなフォントよりも偽のスペースを少なく生成します。
2. ReadDocumentAdvanced()を使用
標準の読み取りメソッドの代わりにReadDocumentAdvanced()でドキュメントを読み取ります。 より高い制御を提供し、複雑なテキストレイアウトをより良く処理します。
3. OcrLanguage.EnglishBestを設定する
エンジンをOcrLanguage.EnglishBestモデルに向けます。 この進化した言語モデルは通常の英語オプションよりも正確で、誤読されたスペースを減少させます。
4. カスタムフォントをトレーニングする
入力PDFが非標準フォントを使用している場合、デフォルト設定では問題を引き起こし、スペースを挿入します。 カスタムフォントのトレーニングはその特定の字体をエンジンに認識させ、認識を大幅にシャープにします。 OCRカスタムフォントトレーニングガイドを参照して全フローを確認してください。
これらの設定を適用すると、抽出されたテキストは無駄なスペーシングなしに戻ってきます:


