IronOCRにおける予期しない空白

This article was translated from English: Does it need improvement?
Translated
View the article in English

抽出されたテキストには、ソースドキュメントがきれいに見えても、文字間に余分なスペースが含まれていることがあります。 一般的な原因は、入力フォントに関連する文字の幅と間隔のばらつきであり、画像フィルタだけではそれをクリアすることはほとんどありません。

Visual Studio テキストビジュアライザーでの OCR 結果。参照番号内の「7」と「1」の間に予期しないスペースが入っている

余分なスペースを避けるために効果的であることが実証されているアプローチは以下の通りです。

解決策

1. OCRにフレンドリーなフォントに切り替える

可能であれば、ドキュメントをRobotoでレンダリングまたは供給してください。 それはクリーンでモダンな書体で、エンジンがArialのようなフォントよりも偽のスペースを少なく生成します。

2. ReadDocumentAdvanced()を使用

標準の読み取りメソッドの代わりにReadDocumentAdvanced()でドキュメントを読み取ります。 より高い制御を提供し、複雑なテキストレイアウトをより良く処理します。

3. OcrLanguage.EnglishBestを設定する

エンジンをOcrLanguage.EnglishBestモデルに向けます。 この進化した言語モデルは通常の英語オプションよりも正確で、誤読されたスペースを減少させます。

4. カスタムフォントをトレーニングする

入力PDFが非標準フォントを使用している場合、デフォルト設定では問題を引き起こし、スペースを挿入します。 カスタムフォントのトレーニングはその特定の字体をエンジンに認識させ、認識を大幅にシャープにします。 OCRカスタムフォントトレーニングガイドを参照して全フローを確認してください。

これらの設定を適用すると、抽出されたテキストは無駄なスペーシングなしに戻ってきます:

修正を適用後のOCR結果、スペーシングが修正されています

ヒント最初にOCRに優しいフォントとEnglishBestモデルを試してみてください。これらは大半のスペースケースをカスタムフォントをトレーニングせずに修正します。

Curtis Chau
テクニカルライター

Curtis Chauは、カールトン大学でコンピュータサイエンスの学士号を取得し、Node.js、TypeScript、JavaScript、およびReactに精通したフロントエンド開発を専門としています。直感的で美しいユーザーインターフェースを作成することに情熱を持ち、Curtisは現代のフレームワークを用いた開発や、構造の良い視覚的に魅力的なマニュアルの作成を楽しんでいます。

開発以外にも、CurtisはIoT(Internet of Things)への強い関心を持ち、ハードウェアとソフトウェアの統合方法を模索しています。余暇には、ゲームをしたりDiscordボットを作成したりして、技術に対する愛情と創造性を組み合わせています。

準備はできましたか?
Nuget ダウンロード 6,136,090 | バージョン: 2026.7 リリースされたばかり
Still Scrolling Icon

まだスクロールしていますか?

すぐに証拠が欲しいですか? PM > Install-Package IronOcr
サンプルを実行 あなたの画像が検索可能なテキストになるのをご覧ください。