フッターコンテンツにスキップ
他のコンポーネントと比較する

Windows 10に最適なOCRソフトウェア:開発者向け比較

TesseractOCR NuGetパッケージ(コミュニティ開発者Oachkatzlschwoaf氏によって公開)は、Tesseractエンジンの実際の機能のごく一部しか公開しておらず、その欠落部分は均等に分布しているわけではない。 ページレベルの検索結果、信頼度スコア、および多言語サポートがAPIに組み込まれています。 構造化された単語レベルのデータ、検索可能なPDF出力、および信頼性の高いエラー通知は、そうではありません。 その結果、簡単な80%の処理はこなすものの、本番環境のアプリケーションが依存する20%の処理はひっそりと放棄してしまうラッパーができあがった。 出荷後にこの限界に気づいたチームは、難しい選択を迫られる。不足部分を補うためにさらに3つのライブラリを追加するか、ラッパーを完全に置き換えるかだ。

TesseractOCRについて理解する

TesseractOCRは、Tesseract OCRエンジンのコミュニティにより保守されている.NETラッパーであり、TesseractOCRパッケージとしてNuGetで配布されています (github.com/Oachkatzlschwoaf/TesseractOCR)。 これはApache 2.0ライセンスの下で提供され、費用はかからず、Tesseractのネイティブバイナリに対する生のP/Invokeよりもクリーンな管理インターフェースを提供します。 最大の目標はシンプルさです。Tesseractエンジンの作成や画像からのテキスト抽出といった一連の作業を、ほんの数行のコードにまで簡略化することを目指しています。

その単純化は、限られた範囲内でのみ有効である。 このラッパーは、Tesseractのコアワークフロー(tessdataパスでエンジンを初期化、page.Textを読む)を、開発者がTesseractのC APIを理解することなく管理オブジェクトに変換します。 クリーンで既に前処理済みの画像を用いた概念実証作業であれば、これで十分です。

TesseractOCRの主なアーキテクチャ特性:

  • NuGetパッケージ: TesseractOCR (Apache 2.0, 無料) -エンジンの基盤: Tesseractネイティブバイナリをラップします。 Tesseractのバージョンは、バンドルされているネイティブランタイムに依存します。
  • tessdataが必要: 言語データファイルは別途ダウンロードし、Engineコンストラクタに実行時に渡されるフォルダに配置する必要があります -ネイティブバイナリの依存関係:プラットフォーム固有のTesseractネイティブライブラリが存在し、ターゲットOSおよびアーキテクチャと一致している必要があります。
  • APIサーフェス: 基本的なテキスト抽出 (page.Text)、信頼度スコアリング (+で区切られた言語文字列を介した多言語初期化をカバー -出力形式:プレーンテキスト文字列のみ — 検索可能なPDF出力、hOCRエクスポート、ラッパーAPIを介した構造化された単語/行/段落データの公開はありません
  • エラーハンドリングモデル: 基本となるTesseractエンジンの失敗は不整合に現れます — 例外なしで空の文字列を返す場合もあれば、特定の条件下でのみTesseractExceptionを投げる場合もあり、ネイティブバイナリの不一致は通常、管理可能な例外を投げるのではなく、プロセスをクラッシュさせる原因となります

APIの完全性の上限

ラッパーが公開する情報と、実際のOCRアプリケーションが必要とする情報との間のギャップは、すぐに明らかになる。 このラッパーは、完全に抽出された文字列を返すpage.GetMeanConfidence()メソッドを提供します。 これはテキスト抽出と総合的な信頼度に関するものです。

それが提供しないものも同様に重要である。 個々の単語とその境界ボックスを表示する構造化された結果オブジェクトは存在しません。 行レベルまたは段落レベルでの走査はできません。 検索可能なPDF出力はありません。 別のライブラリを使ってPDFを画像に変換せずに、PDFをOCR処理する仕組みはありません。 ラッパーのAPIサーフェスは、コミュニティのメンテナーが公開することを選択した内容によって固定されており、それは完全なインターフェースではなく、簡略化されたインターフェースです。

// TesseractOCR: basic usage — the API starts and ends here for most scenarios
using TesseractOCR;

public class TesseractOcrExample
{
    public string ExtractText(string imagePath)
    {
        // tessdata folder must exist and contain eng.traineddata
        using var engine = new Engine(@"./tessdata", Language.English);
        using var img = Pix.Image.LoadFromFile(imagePath);
        using var page = engine.Process(img);

        return page.Text; // plain string, no structure
    }
}
// TesseractOCR: basic usage — the API starts and ends here for most scenarios
using TesseractOCR;

public class TesseractOcrExample
{
    public string ExtractText(string imagePath)
    {
        // tessdata folder must exist and contain eng.traineddata
        using var engine = new Engine(@"./tessdata", Language.English);
        using var img = Pix.Image.LoadFromFile(imagePath);
        using var page = engine.Process(img);

        return page.Text; // plain string, no structure
    }
}
Imports TesseractOCR

Public Class TesseractOcrExample
    Public Function ExtractText(imagePath As String) As String
        ' tessdata folder must exist and contain eng.traineddata
        Using engine = New Engine("./tessdata", Language.English)
            Using img = Pix.Image.LoadFromFile(imagePath)
                Using page = engine.Process(img)
                    Return page.Text ' plain string, no structure
                End Using
            End Using
        End Using
    End Function
End Class
$vbLabelText   $csharpLabel

Engineコンストラクタは、ファイルシステムパスを最初の引数として取ります。 そのパスは、開発マシン、CIサーバー、ステージング環境、本番環境など、あらゆるデプロイ環境において実行時に解決可能でなければなりません。 間違えると実行時エラーが発生します。 このラッパーはパスの抽象化やバンドルされたtessdataを提供しません。

IronOCRを理解する

IronOCRは、 Iron Software社が提供する商用.NET OCRライブラリで、最適化されたTesseract 5エンジンをベースに、自動前処理、ネイティブPDF処理、構造化結果モデルを備えています。 このライブラリは、すべてのネイティブ依存関係をバンドルした単一のNuGetパッケージ (IronOcr) として配布されています — tessdataフォルダなし、プラットフォーム固有のバイナリ構成なし、別個のPDFライブラリなし。

設計理念は、OCRはインフラレベルで解決済みの問題であるべきだというものである。 開発者は自分が読みたいものを宣言する。 IronOCRは、画像品質、フォーマット変換、およびエンジン構成を処理します。 結果オブジェクトは、文書、ページ、段落、行、単語といったあらゆる粒度レベルでテキストを表示し、境界ボックスの座標と単語ごとの信頼度スコアを付加します。

IronOCRの主な特徴:

  • NuGetパッケージ: IronOcr (すべてのネイティブ依存関係をバンドル; 一つのdotnet add packageコマンド) -エンジン:最適化されたTesseract 5に、認識前に統合されたカスタム前処理パイプラインを搭載 -前処理:開発者の介入なしに、自動的に傾き補正、ノイズ除去、コントラスト強調、二値化、解像度正規化が適用されます。 明示的なフィルタリングも可能
  • PDF サポート:ネイティブ — 画像ベースの PDF やスキャンされた PDF を直接読み込み、外部ライブラリは不要です。 認識結果から検索可能なPDFを作成する
  • 出力フォーマット: プレーンテキスト、検索可能PDF、hOCR (単語位置を持つHTML)、ページ/段落/行/単語の階層を持つ構造化OcrResult
  • 言語: 125以上の言語は別個のNuGetパッケージとして利用可能 (例: IronOcr.Languages.French)、ファイルシステム管理は不要 -エラー処理:特定のメッセージを含む管理例外。 no silent empty-string returns on failure -ねじの安全性:内蔵型 複数のIronTesseractインスタンスが安全に並列で実行されます
  • 価格: $999 Lite / $1,499 Plus / $2,999 Professional / $5,999 Unlimited (永続的、1回限り)

機能比較

フィーチャー TesseractOCR IronOCR
ライセンス アパッチ2.0(無料) 商用 ($5,999 永続的)
NuGet のセットアップ TesseractOCR + 手動tessdata + ネイティブバイナリ IronOcrのみ
PDF OCR サポートされていません(外部ライブラリが必要です) ネイティブ、組み込み
検索可能なPDF出力 サポートされていません 組み込み (SaveAsSearchablePdf)
構造化された結果データ 不可 ページ、段落、行、単語 + 座標
自動前処理 不可 内蔵機能(傾き補正、ノイズ除去、コントラスト補正、二値化)
エラー処理 一貫性がない(空文字列、例外、クラッシュ) 一貫性のある管理例外
多言語 tessdataの手動ダウンロードと文字列連結 NuGet言語パック + AddSecondaryLanguage()
OCR中のバーコード読み取り サポートされていません 組み込み (ReadBarCodes = true)
hOCRエクスポート サポートされていません SaveAsHocrFile()

詳細な機能比較

フィーチャー TesseractOCR IronOCR
セットアップと展開
NuGetパッケージのインストール TesseractOCR (その後手動ステップ) IronOcr (完了)
tessdata management 必須 — 手動ダウンロードとパス設定 言語NuGetパッケージにバンドルされています
ネイティブバイナリ展開 必須 — プラットフォーム固有、OS/アーキテクチャと一致する必要があります NuGetパッケージに同梱されています
Dockerデプロイメント ネイティブライブラリ用のDockerfile設定が必要です 標準のlibgdiplusインストールで動作します
入力フォーマット
JPEG / PNG / BMP画像 はい はい
TIFF / マルチページTIFF 制限的 はい (専用のLoadTiffサポート)
PDF(画像ベース) いいえ、外部変換は不要です。 はい、ネイティブです
PDFファイル(パスワード保護あり) なし はい
バイト配列/ストリーム入力 限定 — ファイルパスプライマリ はい、複数の入力オーバーロードがあります。
出力フォーマット
プレーンテキスト はい はい
検索可能なPDF なし はい
hOCR(HTML + 位置指定) なし はい
構造化された単語/行データ なし はい、境界ボックスと信頼度で
OCR機能
自動傾き補正 いいえ、手動による前処理が必要です はい
自動ノイズ除去 なし はい
自動コントラスト強調 なし はい
二値化 なし はい
解像度正規化(DPI) なし はい (EnhanceResolution)
地域ベースのOCR 公開されているAPIはありません はい (CropRectangle)
バーコード読み取り なし はい
正確性と信頼性
総合信頼度スコア はい (GetMeanConfidence() — float) はい (ドキュメントレベルのConfidenceプロパティ)
単語ごとの信頼度 なし はい (各OcrWordで)
エラー処理
一貫性のある例外モデル いいえ、故障モードによって異なります。 はい、例外処理を全体にわたって管理します
沈黙の空文字列が返されます はい、エンジンエラーで発生する可能性があります いいえ、失敗は
言語
言語数 手動でダウンロードしたtessdataに依存します NuGetパッケージ経由で125以上
文書ごとに複数の言語 はい (文字列: "eng+fra") はい (AddSecondaryLanguage())
プラットフォームサポート
ウィンドウズ はい はい
Linux ネイティブライブラリの設定が必要です はい
macOS ネイティブライブラリの設定が必要です はい
Docker 設定が必要です はい
AWS / Azure 設定が必要です はい(専用の導入ガイド)

APIサーフェスの完全性

TesseractOCRが提供する機能と、実際のアプリケーションが必要とする機能との間のギャップは、このラッパーと完全なOCR SDKとの間の最も顕著な実用上の違いである。

TesseractOCRアプローチ

信頼度取得機能を備えた基本的なOCR操作のためのラッパーの公開APIは次のようになります。

// TesseractOCR: full extent of the core API
using TesseractOCR;

public class TesseractWrapperService
{
    private const string TessDataPath = @"./tessdata";

    // Text extraction — the primary use case
    public string BasicOcr(string imagePath)
    {
        using var engine = new TesseractEngine(TessDataPath, "eng", EngineMode.Default);
        using var img = Pix.LoadFromFile(imagePath);
        using var page = engine.Process(img);

        return page.GetText();
    }

    // Confidence score — aggregate only, no word-level data
    public (string Text, float Confidence) OcrWithConfidence(string imagePath)
    {
        using var engine = new TesseractEngine(TessDataPath, "eng", EngineMode.Default);
        using var img = Pix.LoadFromFile(imagePath);
        using var page = engine.Process(img);

        return (page.GetText(), page.GetMeanConfidence());
    }

    // 多言語 — requires manually downloaded traineddata files
    public string MultiLanguageOcr(string imagePath)
    {
        // fra.traineddata and deu.traineddata must exist in ./tessdata/
        using var engine = new TesseractEngine(TessDataPath, "eng+fra+deu", EngineMode.Default);
        using var img = Pix.LoadFromFile(imagePath);
        using var page = engine.Process(img);

        return page.GetText();
    }
}
// TesseractOCR: full extent of the core API
using TesseractOCR;

public class TesseractWrapperService
{
    private const string TessDataPath = @"./tessdata";

    // Text extraction — the primary use case
    public string BasicOcr(string imagePath)
    {
        using var engine = new TesseractEngine(TessDataPath, "eng", EngineMode.Default);
        using var img = Pix.LoadFromFile(imagePath);
        using var page = engine.Process(img);

        return page.GetText();
    }

    // Confidence score — aggregate only, no word-level data
    public (string Text, float Confidence) OcrWithConfidence(string imagePath)
    {
        using var engine = new TesseractEngine(TessDataPath, "eng", EngineMode.Default);
        using var img = Pix.LoadFromFile(imagePath);
        using var page = engine.Process(img);

        return (page.GetText(), page.GetMeanConfidence());
    }

    // 多言語 — requires manually downloaded traineddata files
    public string MultiLanguageOcr(string imagePath)
    {
        // fra.traineddata and deu.traineddata must exist in ./tessdata/
        using var engine = new TesseractEngine(TessDataPath, "eng+fra+deu", EngineMode.Default);
        using var img = Pix.LoadFromFile(imagePath);
        using var page = engine.Process(img);

        return page.GetText();
    }
}
Imports TesseractOCR

Public Class TesseractWrapperService
    Private Const TessDataPath As String = "./tessdata"

    ' Text extraction — the primary use case
    Public Function BasicOcr(imagePath As String) As String
        Using engine As New TesseractEngine(TessDataPath, "eng", EngineMode.Default)
            Using img As Pix = Pix.LoadFromFile(imagePath)
                Using page As Page = engine.Process(img)
                    Return page.GetText()
                End Using
            End Using
        End Using
    End Function

    ' Confidence score — aggregate only, no word-level data
    Public Function OcrWithConfidence(imagePath As String) As (Text As String, Confidence As Single)
        Using engine As New TesseractEngine(TessDataPath, "eng", EngineMode.Default)
            Using img As Pix = Pix.LoadFromFile(imagePath)
                Using page As Page = engine.Process(img)
                    Return (page.GetText(), page.GetMeanConfidence())
                End Using
            End Using
        End Using
    End Function

    ' 多言語 — requires manually downloaded traineddata files
    Public Function MultiLanguageOcr(imagePath As String) As String
        ' fra.traineddata and deu.traineddata must exist in ./tessdata/
        Using engine As New TesseractEngine(TessDataPath, "eng+fra+deu", EngineMode.Default)
            Using img As Pix = Pix.LoadFromFile(imagePath)
                Using page As Page = engine.Process(img)
                    Return page.GetText()
                End Using
            End Using
        End Using
    End Function
End Class
$vbLabelText   $csharpLabel

これが天井です。 ラッパーは、テキストと集計された信頼度情報を提供します。 個々の単語の位置にアクセスするためのAPIはありません。 検索可能なPDFを生成するためのAPIは存在しません。 PDFファイルをOCR処理するためのAPIは存在しません。そのためには、まず各ページを画像にラスタライズし、その後各画像を個別にエンジンに通すための別のライブラリが必要です。

アプリケーションがUI上で一致する用語を強調表示する必要がある場合、単語の境界ボックスデータは存在しません。 コンプライアンス要件としてスキャンした請求書を検索可能なPDFとして保存する必要がある場合、出力パイプラインは存在しません。これらの機能を実現するには、他のライブラリとの連携コードを大幅に記述するか、ラッパーを置き換える必要があります。

IronOCRのアプローチ

IronOCRは、最初の呼び出しから完全な結果モデルを公開します。 テキストと信頼度を組み合わせた同じシナリオと、それを超える構造化データ:

using IronOcr;

public class IronOcrService
{
    // Text — one line
    public string BasicOcr(string imagePath)
    {
        return new IronTesseract().Read(imagePath).Text;
    }

    // Confidence — built into the result object
    public (string Text, double Confidence) OcrWithConfidence(string imagePath)
    {
        var result = new IronTesseract().Read(imagePath);
        return (result.Text, result.Confidence);
    }

    // Structured data — words with bounding boxes and per-word confidence
    public void StructuredExtraction(string imagePath)
    {
        var result = new IronTesseract().Read(imagePath);

        foreach (var page in result.Pages)
        {
            foreach (var line in result.Lines)
            {
                Console.WriteLine($"Line: {line.Text}");
            }
            foreach (var word in result.Words)
            {
                // Coordinates and confidence available per word
                Console.WriteLine($"'{word.Text}' at ({word.X},{word.Y}) — {word.Confidence}%");
            }
        }
    }

    // 多言語 — NuGet packages, no filesystem management
    public string MultiLanguageOcr(string imagePath)
    {
        var ocr = new IronTesseract();
        ocr.Language = OcrLanguage.English;
        ocr.AddSecondaryLanguage(OcrLanguage.French);
        ocr.AddSecondaryLanguage(OcrLanguage.German);
        return ocr.Read(imagePath).Text;
    }
}
using IronOcr;

public class IronOcrService
{
    // Text — one line
    public string BasicOcr(string imagePath)
    {
        return new IronTesseract().Read(imagePath).Text;
    }

    // Confidence — built into the result object
    public (string Text, double Confidence) OcrWithConfidence(string imagePath)
    {
        var result = new IronTesseract().Read(imagePath);
        return (result.Text, result.Confidence);
    }

    // Structured data — words with bounding boxes and per-word confidence
    public void StructuredExtraction(string imagePath)
    {
        var result = new IronTesseract().Read(imagePath);

        foreach (var page in result.Pages)
        {
            foreach (var line in result.Lines)
            {
                Console.WriteLine($"Line: {line.Text}");
            }
            foreach (var word in result.Words)
            {
                // Coordinates and confidence available per word
                Console.WriteLine($"'{word.Text}' at ({word.X},{word.Y}) — {word.Confidence}%");
            }
        }
    }

    // 多言語 — NuGet packages, no filesystem management
    public string MultiLanguageOcr(string imagePath)
    {
        var ocr = new IronTesseract();
        ocr.Language = OcrLanguage.English;
        ocr.AddSecondaryLanguage(OcrLanguage.French);
        ocr.AddSecondaryLanguage(OcrLanguage.German);
        return ocr.Read(imagePath).Text;
    }
}
Imports IronOcr

Public Class IronOcrService
    ' Text — one line
    Public Function BasicOcr(imagePath As String) As String
        Return New IronTesseract().Read(imagePath).Text
    End Function

    ' Confidence — built into the result object
    Public Function OcrWithConfidence(imagePath As String) As (Text As String, Confidence As Double)
        Dim result = New IronTesseract().Read(imagePath)
        Return (result.Text, result.Confidence)
    End Function

    ' Structured data — words with bounding boxes and per-word confidence
    Public Sub StructuredExtraction(imagePath As String)
        Dim result = New IronTesseract().Read(imagePath)

        For Each page In result.Pages
            For Each line In result.Lines
                Console.WriteLine($"Line: {line.Text}")
            Next
            For Each word In result.Words
                ' Coordinates and confidence available per word
                Console.WriteLine($"'{word.Text}' at ({word.X},{word.Y}) — {word.Confidence}%")
            Next
        Next
    End Sub

    ' 多言語 — NuGet packages, no filesystem management
    Public Function MultiLanguageOcr(imagePath As String) As String
        Dim ocr = New IronTesseract()
        ocr.Language = OcrLanguage.English
        ocr.AddSecondaryLanguage(OcrLanguage.French)
        ocr.AddSecondaryLanguage(OcrLanguage.German)
        Return ocr.Read(imagePath).Text
    End Function
End Class
$vbLabelText   $csharpLabel

構造化結果APIは、ページ、段落、行、単語を単一のオブジェクトとして返します。 各単語には、その境界を示す矩形と信頼度パーセンテージが付与されています。 追加するライブラリは2つ目ではなく、中間的な変換手順も、統合作業も不要です。

文書分析のために単語レベルの座標が必要なチーム(墨消しツール、請求書抽出ツール、コンプライアンスパイプラインなど、各フィールドがページ上のどこにあるかを知る必要があるもの)にとって、この違いは決定的な要因となる。

エラー処理の信頼性

静かに進行する失敗は、最もコストのかかる失敗である。 例外をスローする代わりに空の文字列を返すシステムは、クリーンな画像でのテスト中は正常に動作しているように見えますが、本番環境では画像品質が低下したり、ネイティブな依存関係が欠落したりすると、データを静かに破棄します。

TesseractOCRアプローチ

TesseractOCRのエラー動作は、障害モードによって異なります。 .cs ソースファイル自体は、例外処理の契約を定義していません。 READMEとラッパーの設計図より:

  • Engineコンストラクタに渡されるパスで見つからない場合、ランタイムエラーが発生しますが、正確な例外タイプとメッセージは基礎となるTesseractネイティブバイナリの動作によって異なり、管理された契約ではありません
  • Tesseractが処理できない画像ファイル — 破損したファイル、サポートされていないフォーマット、ゼロバイトの画像 — は例外を発生させずに空の文字列としてpage.Textを返すことがあります
  • プラットフォームのバイナリミスマッチ (OSに対する誤ったTesseractバージョン) は通常、意味のあるOCR例外ではなく、DllNotFoundExceptionまたはアクセス違反として現れる
  • これらの条件をネイティブエンジンに渡す前にインターセプトするラッパーレベルの検証レイヤーは存在しません。
// TesseractOCR: what failure looks like in practice
// Simplified — actual error behavior depends on Tesseract native binary version

public string OcrWithNoGuarantees(string imagePath)
{
    using var engine = new TesseractEngine(@"./tessdata", "eng", EngineMode.Default);
    using var img = Pix.LoadFromFile(imagePath);
    using var page = engine.Process(img);

    // On a degraded image or internal engine error:
    // page.GetText() may return "" with no exception
    // Caller has no way to distinguish "no text found" from "engine failed"
    return page.GetText();
}
// TesseractOCR: what failure looks like in practice
// Simplified — actual error behavior depends on Tesseract native binary version

public string OcrWithNoGuarantees(string imagePath)
{
    using var engine = new TesseractEngine(@"./tessdata", "eng", EngineMode.Default);
    using var img = Pix.LoadFromFile(imagePath);
    using var page = engine.Process(img);

    // On a degraded image or internal engine error:
    // page.GetText() may return "" with no exception
    // Caller has no way to distinguish "no text found" from "engine failed"
    return page.GetText();
}
Imports Tesseract

Public Function OcrWithNoGuarantees(imagePath As String) As String
    Using engine As New TesseractEngine("./tessdata", "eng", EngineMode.Default)
        Using img As Pix = Pix.LoadFromFile(imagePath)
            Using page As Page = engine.Process(img)
                ' On a degraded image or internal engine error:
                ' page.GetText() may return "" with no exception
                ' Caller has no way to distinguish "no text found" from "engine failed"
                Return page.GetText()
            End Using
        End Using
    End Using
End Function
$vbLabelText   $csharpLabel

その結果、ログパイプラインは、テキストなしの成功結果のように見える空の文字列を認識する。 文字数を追跡する品質監視システムでは、この不具合は検出されない。 データは静かに失われる。

IronOCRのアプローチ

IronOCRは、全体を通して一貫した管理例外モデルを採用しています。 入力検証はエンジン呼び出し前に行われ、エンジンのエラーは空の結果ではなく、捕捉可能な型付き例外として発生します。

using IronOcr;

public class ReliableOcrService
{
    public string OcrWithErrorHandling(string imagePath)
    {
        try
        {
            var result = new IronTesseract().Read(imagePath);

            // Confidence below threshold is detectable — not a silent empty string
            if (result.Confidence < 20)
            {
                // Low confidence is signaled, not silently dropped
                throw new InvalidOperationException(
                    $"OCR confidence too low: {result.Confidence}%. Check image quality.");
            }

            return result.Text;
        }
        catch (IronOcrException ex)
        {
            // Engine-level failures are typed and catchable
            throw new ApplicationException($"OCR engine failure: {ex.Message}", ex);
        }
    }

    // Preprocessing before recognition reduces failure rates for poor-quality inputs
    public string OcrWithPreprocessing(string imagePath)
    {
        using var input = new OcrInput();
        input.LoadImage(imagePath);
        input.Deskew();
        input.DeNoise();
        input.Contrast();

        return new IronTesseract().Read(input).Text;
    }
}
using IronOcr;

public class ReliableOcrService
{
    public string OcrWithErrorHandling(string imagePath)
    {
        try
        {
            var result = new IronTesseract().Read(imagePath);

            // Confidence below threshold is detectable — not a silent empty string
            if (result.Confidence < 20)
            {
                // Low confidence is signaled, not silently dropped
                throw new InvalidOperationException(
                    $"OCR confidence too low: {result.Confidence}%. Check image quality.");
            }

            return result.Text;
        }
        catch (IronOcrException ex)
        {
            // Engine-level failures are typed and catchable
            throw new ApplicationException($"OCR engine failure: {ex.Message}", ex);
        }
    }

    // Preprocessing before recognition reduces failure rates for poor-quality inputs
    public string OcrWithPreprocessing(string imagePath)
    {
        using var input = new OcrInput();
        input.LoadImage(imagePath);
        input.Deskew();
        input.DeNoise();
        input.Contrast();

        return new IronTesseract().Read(input).Text;
    }
}
Imports IronOcr

Public Class ReliableOcrService
    Public Function OcrWithErrorHandling(imagePath As String) As String
        Try
            Dim result = New IronTesseract().Read(imagePath)

            ' Confidence below threshold is detectable — not a silent empty string
            If result.Confidence < 20 Then
                ' Low confidence is signaled, not silently dropped
                Throw New InvalidOperationException($"OCR confidence too low: {result.Confidence}%. Check image quality.")
            End If

            Return result.Text
        Catch ex As IronOcrException
            ' Engine-level failures are typed and catchable
            Throw New ApplicationException($"OCR engine failure: {ex.Message}", ex)
        End Try
    End Function

    ' Preprocessing before recognition reduces failure rates for poor-quality inputs
    Public Function OcrWithPreprocessing(imagePath As String) As String
        Using input As New OcrInput()
            input.LoadImage(imagePath)
            input.Deskew()
            input.DeNoise()
            input.Contrast()

            Return New IronTesseract().Read(input).Text
        End Using
    End Function
End Class
$vbLabelText   $csharpLabel

result.Confidenceプロパティは、呼び出し側のコードがアクションを取ることができる数値の品質信号を提供します。 信頼度が8%という結果は、何らかの問題が発生したことを意味します。画像品質が低い、言語パックが間違っている、あるいは文書の一部が判読不能であるなどが考えられます。 その兆候は存在し、明確である。

信頼度スコアリングAPI画像品質補正フィルターが連携することで、OCRパイプラインがサイレントではなく、監視可能かつ復旧可能なものとなる。

出力フォーマットのサポート

プレーンテキストは出力形式の一つです。 実運用アプリケーションでは、通常、より多くの機能が必要となります。スキャンされたアーカイブに対する全文検索には検索可能なPDFが必要であり、アクセシビリティパイプラインにはhOCRが必要であり、データ抽出パイプラインには座標付きの構造化された単語レベルの出力が必要です。

TesseractOCRアプローチ

TesseractOCRはpage.GetMeanConfidence()からfloatを生成します。 これが、ラッパーによって公開される完全な出力APIです。 ソースファイルのTesseractLimitationsクラスは、これを直接文書化しています:

// TesseractOCR: output capabilities — directly from source
public class TesseractLimitations
{
    public void ShowLimitations()
    {
        Console.WriteLine("Tesseract Wrapper Limitations:");
        Console.WriteLine("1. PDFはサポートされていません - need separate library");
        Console.WriteLine("2. なし preprocessing - must implement yourself");
        Console.WriteLine("3. なし barcode reading");
        Console.WriteLine("4. なし searchable PDF output");
        Console.WriteLine("5. tessdata management required");
        Console.WriteLine("6. Platform binaries must match");
    }
}
// TesseractOCR: output capabilities — directly from source
public class TesseractLimitations
{
    public void ShowLimitations()
    {
        Console.WriteLine("Tesseract Wrapper Limitations:");
        Console.WriteLine("1. PDFはサポートされていません - need separate library");
        Console.WriteLine("2. なし preprocessing - must implement yourself");
        Console.WriteLine("3. なし barcode reading");
        Console.WriteLine("4. なし searchable PDF output");
        Console.WriteLine("5. tessdata management required");
        Console.WriteLine("6. Platform binaries must match");
    }
}
Public Class TesseractLimitations
    Public Sub ShowLimitations()
        Console.WriteLine("Tesseract Wrapper Limitations:")
        Console.WriteLine("1. PDFはサポートされていません - need separate library")
        Console.WriteLine("2. なし preprocessing - must implement yourself")
        Console.WriteLine("3. なし barcode reading")
        Console.WriteLine("4. なし searchable PDF output")
        Console.WriteLine("5. tessdata management required")
        Console.WriteLine("6. Platform binaries must match")
    End Sub
End Class
$vbLabelText   $csharpLabel

TesseractOCRを使用してスキャン文書から検索可能なPDFを生成するには、別のPDFライブラリ (PDFSharp、iTextまたは同様のもの) が必要で、入力PDFを画像にラスタライズするためのコード (PdfiumViewerまたはGhostscript) を行い、それらの画像をラッパー経由で処理し、手動で各ページのテキストレイヤをオーバーレイする必要があります。 つまり、ラッパーと並行してテスト、保守、デプロイする必要のある統合コードが150~300行あるということです。

IronOCRのアプローチ

IronOCRは同じRead()呼び出しからテキスト、構造化データ、検索可能PDF、およびhOCRを生成します:

using IronOcr;

public class OutputFormatExamples
{
    public void AllOutputFormats(string inputPath)
    {
        var result = new IronTesseract().Read(inputPath);

        // Plain text
        string text = result.Text;

        // 検索可能なPDF — scanned document becomes full-text searchable
        result.SaveAsSearchablePdf("searchable-output.pdf");

        // hOCR — HTML with word positions for accessibility pipelines
        result.SaveAsHocrFile("output.hocr");

        // Structured word data — positions for data extraction
        foreach (var word in result.Words)
        {
            Console.WriteLine($"'{word.Text}' at ({word.X},{word.Y},{word.Width},{word.Height})");
        }
    }

    // Scanned PDF in, searchable PDF out — two lines total
    public void MakeSearchable(string scannedPdfPath, string outputPath)
    {
        var result = new IronTesseract().Read(scannedPdfPath);
        result.SaveAsSearchablePdf(outputPath);
    }
}
using IronOcr;

public class OutputFormatExamples
{
    public void AllOutputFormats(string inputPath)
    {
        var result = new IronTesseract().Read(inputPath);

        // Plain text
        string text = result.Text;

        // 検索可能なPDF — scanned document becomes full-text searchable
        result.SaveAsSearchablePdf("searchable-output.pdf");

        // hOCR — HTML with word positions for accessibility pipelines
        result.SaveAsHocrFile("output.hocr");

        // Structured word data — positions for data extraction
        foreach (var word in result.Words)
        {
            Console.WriteLine($"'{word.Text}' at ({word.X},{word.Y},{word.Width},{word.Height})");
        }
    }

    // Scanned PDF in, searchable PDF out — two lines total
    public void MakeSearchable(string scannedPdfPath, string outputPath)
    {
        var result = new IronTesseract().Read(scannedPdfPath);
        result.SaveAsSearchablePdf(outputPath);
    }
}
Imports IronOcr

Public Class OutputFormatExamples
    Public Sub AllOutputFormats(inputPath As String)
        Dim result = New IronTesseract().Read(inputPath)

        ' Plain text
        Dim text As String = result.Text

        ' 検索可能なPDF — scanned document becomes full-text searchable
        result.SaveAsSearchablePdf("searchable-output.pdf")

        ' hOCR — HTML with word positions for accessibility pipelines
        result.SaveAsHocrFile("output.hocr")

        ' Structured word data — positions for data extraction
        For Each word In result.Words
            Console.WriteLine($"'{word.Text}' at ({word.X},{word.Y},{word.Width},{word.Height})")
        Next
    End Sub

    ' Scanned PDF in, searchable PDF out — two lines total
    Public Sub MakeSearchable(scannedPdfPath As String, outputPath As String)
        Dim result = New IronTesseract().Read(scannedPdfPath)
        result.SaveAsSearchablePdf(outputPath)
    End Sub
End Class
$vbLabelText   $csharpLabel

検索可能なPDF出力機能は、文書管理ワークフローにおいて最も要望の多い機能です。 スキャンされた請求書アーカイブ、契約書リポジトリ、コンプライアンス文書ストアなど、あらゆるものがたった2行のコードで検索可能になります。 個別のPDFライブラリはなく、テキストレイヤーの組み立てもなく、ページ反復処理もありません。

hOCRによるエクスポートでは、単語座標が埋め込まれた標準HTMLが生成され、アクセシビリティツール、電子書籍リーダーシステム、および文書分析パイプラインがこれを直接利用できます。

APIマッピングリファレンス

TesseractOCR API IronOCR相当値
new Engine(tessDataPath, Language.English) new IronTesseract() (パスは不要)
new TesseractEngine(path, "eng", EngineMode.Default) new IronTesseract()
Pix.Image.LoadFromFile(imagePath) input.LoadImage(imagePath)
Pix.LoadFromFile(imagePath) input.LoadImage(imagePath)
engine.Process(img) ocr.Read(input)
page.Text result.Text
page.GetText() result.Text
page.GetMeanConfidence() result.Confidence
"eng+fra+deu"言語文字列 `ocr.Language = OCRLanguage.English; ocr.AddSecondaryLanguage(OcrLanguage.French)
PDFはサポートされていません input.LoadPdf(path)
検索可能なPDF出力はありません result.SaveAsSearchablePdf("output.pdf")
hOCR出力なし result.SaveAsHocrFile("output.hocr")
単語レベルのデータはありません result.Words (X, Y, Width, Height, Confidenceと共に)
ラインレベルのデータはありません result.Lines
前処理APIなし input.Deskew(); input.DeNoise(); input.Contrast();.
地域選択なし input.LoadImage(path, new CropRectangle(x, y, w, h))
バーコードが読み取れません ocr.Configuration.ReadBarCodes = true; 結果.バーコード

IronOCR APIの完全なリファレンスについては、 IronTesseract APIのドキュメントを参照してください。

チームがTesseractOCRからIronOCRへの移行を検討する場合

アプリケーションが構造化データを必要とする場合

請求書抽出パイプラインを構築しているチームは、TesseractOCRを同梱して運用を開始したが、6か月後に、フィールド値を抽出するには、各単語がページ上のどこにあるかを知る必要があることに気づいた。 金額欄は、仕入先ごとに異なる列位置にあります。明細テーブルの行数は可変です。 日付の形式は異なります。 これらの問題は、プレーンテキストだけでは解決できません。アプリケーションは、文書上の既知のランドマークに対するフィールドの位置を識別するために、単語の境界ボックスを必要とします。

TesseractOCR にはワードレベルのデータ API がありません。 チームは選択を迫られている。Tesseractの生データからhOCR出力を取得するために別のライブラリを統合し、hOCR XMLを独自に解析して、それをラッパーの出力と同期させるか、あるいはラッパーを構造化データをネイティブに公開するライブラリに置き換えるかだ。 IronOCRの読み取り結果APIは、テキストと同じ結果オブジェクト内に、座標を含む完全な単語階層を提供します。 hOCR解析を中心に構築するのに2週間かかった抽出ロジックは、直接的なプロパティ走査へと変更される。

サイレント障害がデータ損失を引き起こす場合

チームは自動化されたパイプラインを通じて、1日に数千枚のファックス品質のスキャン画像を処理します。TesseractOCRは、エンジンが文字を認識できなかった画像に対して空の文字列を返します。これは、空白ページと同じ戻り値です。 3か月後に行われた監査で、データが含まれているはずの記録のかなりの割合が空の状態で保存されていたことが明らかになった。 パイプラインには、"このページにはテキストがありません"と"エンジンがこのページを読み取れませんでした"を区別する方法がなかった。

TesseractOCRの修正では、返される文字列が空かどうかをチェックするロジックで各呼び出しをラップし、その後、別のライブラリを使用して画像品質を個別に検証し、空の結果が正当なものかどうかを判断する必要があります。 IronOCRの信頼度スコアはすべての結果に表示されます。信頼度が3%の結果は、空のレコードとしてデータベースに静かに書き込まれるのではなく、フラグが立てられ、ログに記録され、人間のレビューキューに送られます。

検索可能なPDFアーカイブが必要な場合

法律、医療、金融サービスにおけるコンプライアンスワークフローでは、スキャンした文書を検索可能なPDF形式で保存することが一般的に求められます。つまり、テキスト検索が可能で、キーワードによるインデックス作成が可能で、文書管理システムと互換性のある形式です。 TesseractOCRはプレーンテキストを生成します。 そのテキストを適切にレイヤー分けされた検索可能なPDFに変換するには、別途PDFライブラリ、手動によるページサイズ調整、フォントメトリクス、テキスト座標マッピング、およびレイヤーアセンブリが必要です。

IronOCRは、この処理を単一のメソッド呼び出しで行い、元のスキャンコンテンツに位置合わせされた目に見えないテキストレイヤーを含む、標準的なPDF/A互換ファイルを生成します。 TesseractOCRを使用して検索可能なPDFアセンブリコードの構築に数日費やしているチームは、労力がIronOCR Liteライセンスのコストを超えることがよくあります —そして彼らはそれに前処理、構造化データ、バーコード読み取りを得ています。

導入の複雑さが負担になる時

あるチームが開発したアプリケーションは、開発者のどのマシンでも正常に動作するが、Dockerコンテナ内では動作しない。 tessdataのパスが間違っています。 Tesseractのネイティブバイナリのバージョンが、コンテナのlibcのバージョンと一致しません。 言語ファイルは存在しますが、エンジンバージョンが異なるtessdata形式を想定しています。 これらは架空のシナリオではなく、あらゆるTesseractラッパーにおける標準的なデプロイメント上の問題点です。

TesseractOCRはこれらのいずれにも役立ちません。 ラッパーはtessdataのパスをネイティブエンジンに渡し、環境が正しく構成されていることを信頼します。 IronOCRは、 NuGetパッケージにすべての機能を同梱しています。 Dockerデプロイメントガイドでは、libgdiplus をコンテナイメージに追加する必要があります — Dockerfileに一行で、アプリケーションは開発マシンと同様に機能します。

一般的な移行の考慮事項

エンジン初期化パターンの置き換え

TesseractOCRは、呼び出しごとに、tessdataファイルシステムパスを使ってIronTesseractを使用します — 言語データはインストールされた言語NuGetパッケージから解決されます:

// TesseractOCR: tessdata path required at every engine instantiation
using var engine = new TesseractEngine(@"./tessdata", "eng", EngineMode.Default);

// IronOCR: no tessdata path — language resolved from NuGet package
var ocr = new IronTesseract();
ocr.Language = OcrLanguage.English;
// TesseractOCR: tessdata path required at every engine instantiation
using var engine = new TesseractEngine(@"./tessdata", "eng", EngineMode.Default);

// IronOCR: no tessdata path — language resolved from NuGet package
var ocr = new IronTesseract();
ocr.Language = OcrLanguage.English;
Imports Tesseract
Imports IronOcr

' TesseractOCR: tessdata path required at every engine instantiation
Using engine As New TesseractEngine("./tessdata", "eng", EngineMode.Default)
    ' Engine usage code goes here
End Using

' IronOCR: no tessdata path — language resolved from NuGet package
Dim ocr As New IronTesseract()
ocr.Language = OcrLanguage.English
$vbLabelText   $csharpLabel

このパターンを移行するチームは、リクエスト間でIronTesseractインスタンスを再利用することでパフォーマンスも向上させます。 どちらのライブラリでも、エンジンの初期化には起動時のオーバーヘッドが発生します。 IronOCRはスレッドセーフなので、DIコンテナにシングルトンとして登録された単一のインスタンスは、競合することなく同時リクエストを処理できます。

2つ目のライブラリを使用せずにPDFサポートを追加する

PDFを扱うすべてのTesseractOCRコードベースにはPDFラスタライズレイヤーがあります — 通常、PdfiumViewer、PDFSharp、または類似のライブラリ — 初期化時にラッパーに渡す前にPDFページを画像に変換します。 そのラスタライズ層は、依存関係、設定手順、そして中間画像変換による潜在的な画質低下を追加する。

IronOCRはレイヤーを完全に削除します。 PDF入力ガイドは、ocr.Read("document.pdf")がネイティブテキストPDFとスキャンされた画像ベースのPDFの両方に対応していることを示しています。 パスワード保護されたPDFはinput.LoadPdf(path, Password: "secret")を使用します。 ラスタライズライブラリおよびそれに関連するtessdataパス設定コードは削除できます。

信頼度に基づく品質ルーティングの処理

TesseractOCRのdoubleです。 スケールの変更は、1行のコード変更で済みます。Tesseractの値を100倍するか、しきい値の比較値を調整してください。 より重要なのは、IronOCRの信頼度スコアが単語ごとに利用可能であることです — word.Confidence — これにより、ドキュメント全体のフィルタリングだけではなく、ドキュメント内での詳細な品質ルーティングが可能になります。

// IronOCR: per-word confidence for field-level quality routing
var result = new IronTesseract().Read("invoice.jpg");

var lowConfidenceWords = result.Words
    .Where(w => w.Confidence < 60)
    .Select(w => w.Text)
    .ToList();

if (lowConfidenceWords.Any())
{
    // Flag document for human review — specific words are uncertain
    Console.WriteLine($"Low confidence fields: {string.Join(", ", lowConfidenceWords)}");
}
// IronOCR: per-word confidence for field-level quality routing
var result = new IronTesseract().Read("invoice.jpg");

var lowConfidenceWords = result.Words
    .Where(w => w.Confidence < 60)
    .Select(w => w.Text)
    .ToList();

if (lowConfidenceWords.Any())
{
    // Flag document for human review — specific words are uncertain
    Console.WriteLine($"Low confidence fields: {string.Join(", ", lowConfidenceWords)}");
}
Imports IronOcr

' IronOCR: per-word confidence for field-level quality routing
Dim result = New IronTesseract().Read("invoice.jpg")

Dim lowConfidenceWords = result.Words _
    .Where(Function(w) w.Confidence < 60) _
    .Select(Function(w) w.Text) _
    .ToList()

If lowConfidenceWords.Any() Then
    ' Flag document for human review — specific words are uncertain
    Console.WriteLine($"Low confidence fields: {String.Join(", ", lowConfidenceWords)}")
End If
$vbLabelText   $csharpLabel

言語パックの移行

TesseractOCRは、手動でダウンロードされた.traineddataファイルを含むtessdataディレクトリを使用します。 言語文字列 "eng+fra+deu" は、そのファイルを名前で参照します。 IronOCRは、NuGetパッケージ: ocr.AddSecondaryLanguage(OcrLanguage.French)を次に使用します。 多言語対応ガイドでは、 125種類以上の言語パックを含む、すべての言語パターンを網羅しています。

IronOCRの追加機能

上記セクションでは触れていないものの、IronOCRの実用アプリケーションにおける価値を高める機能:

  • リージョンベースのOCR: CropRectangleは、ドキュメントの特定の領域に認識を限定し、既知のレイアウト形式での処理時間を大幅に削減します。この領域のみに可変データが含まれています
  • 非同期OCR: ASP.NETアプリケーションのためのノンブロッキングOCR — await ocr.ReadAsync(input)は、スレッドプールをブロックせずに非同期コントローラーアクションにクリーンに統合されます -進捗状況の追跡複数ページのバッチジョブはコールバックを通じて進捗状況を報告し、処理中のアプリケーションで正確な進捗バーを表示できるようにします。 -コンピュータビジョン統合文書内の物体検出により、OCR適用前に関心領域が特定され、異種文書タイプの処理に役立ちます。 -特殊な文書処理 MICR小切手、パスポート、ナンバープレート、手書き文字など、標準のTesseractモードを超える特別な認識調整が必要な文書タイプに対応した専用サポート。

.NETの互換性と将来の準備

TesseractOCRはネイティブバイナリをラップしたマネージドライブラリとして動作するため、 .NETとの互換性は、マネージドレイヤーと、対象プラットフォームに適したネイティブTesseractバイナリの可用性の両方に依存します。 IronOCRは、.NET 6、 .NET 7、 .NET 8、 .NET 9に加え、 .NET Standard 2.0および.NET Framework 4.6.2以降をサポートしています。これらのプラットフォームはすべて、独自のネイティブランタイムをバンドルした単一のNuGetパッケージでカバーされています。ライブラリは定期的に更新され、 .NET 10(2026年11月リリース予定)との互換性も、これまでのメジャーリリースと同様のパターンで提供されます。 Linux、macOS、Windows、Docker、AWS Lambda、Azure App Serviceへのクロスプラットフォーム展開は、バージョンを照合する必要のある外部バイナリが存在しないため、環境固有の設定なしで機能します。

結論

TesseractOCRは、特定の狭い範囲の問題を解決します。それは、Tesseractエンジンのコアとなるテキスト抽出機能を、適切な操作性を備えたマネージド.NET APIに組み込むことです。 その狭い範囲、つまり、鮮明な画像、英語または事前にダウンロードされたtessdataを備えた少数の言語、プレーンテキスト出力といった用途であれば、問題なく動作し、費用もかかりません。

問題は、実際のOCR処理における要件が、ほとんどの場合、その狭い範囲内に収まらないということだ。 アプリケーションはPDF入力要件を取得します。 法令遵守義務により、検索可能なPDF出力が求められるようになった。 データ抽出ワークフローは、単語レベルの座標が必要であることを認識する。 tessdataのパスまたはネイティブバイナリのバージョンが一致しない最初の環境で、デプロイメントパイプラインが停止します。 エラー処理モデルから無言で空文字列が返されると、監査時にのみ明らかになるデータ損失が発生します。 これらのギャップそれぞれに対応するには、個別のライブラリ、統合コード、またはOCRレイヤーの構造の根本的な変更が必要となる。

IronOCRは、完全性のギャップに直接対処します。 このAPIは、構造化出力、検索可能なPDF生成、信頼性の高いエラー通知、自動前処理、ネイティブPDF入力といった機能を、外部依存関係のない単一のライブラリで網羅しています。 $999の開始価格は実際のお金ですが、TesseractOCRの薄いAPIサーフェスが必要とする前処理、PDF処理、エラーマネジメントコードの構築に通常費やされる20〜40時間も同様です。 ラッパーの機能の限界に達したチームにとって、その計算結果は通常、限界のないライブラリの方が有利になるという結論に至る。

新規プロジェクト向けにOCRインフラストラクチャを評価するチームにとって、無料版(一部機能不足)と有料版(完全版)のどちらを選択するかは、無料版に安易に飛びつき、本番環境下で機能不足に気づくよりも、不足部分に必要な統合作業を冷静に検討した上で、明確に決定する価値がある。 IronOCRのドキュメントチュートリアルライブラリには、ここで説明したすべての機能が動作例付きで網羅されているため、評価は理論的なものにとどまらず、より具体的なものとなる。

ご注意Ghostscript, PDFium, PDFSharp, Tesseract, iTextはそれぞれの所有者に登録商標されています。 このサイトはArtifex Software, Chromium Project, Google, empira Software GmbH, iText Groupとの提携、支援、またはスポンサーシップは受けていません。全ての製品名、ロゴ、ブランドはそれぞれの所有者に帰属します。 比較は情報提供のみを目的としており、執筆時点で公開されている情報を反映しています。

よくある質問

Tesseract OCR Wrapper for .NETとは?

Tesseract OCR Wrapper for .NETは、開発者や企業が画像やドキュメントからテキストを抽出するために使用するOCRソリューションです。.NETアプリケーション開発においてIronOCRと共に評価されるいくつかのOCRオプションの一つです。

IronOCRは.NET開発者向けTesseract OCR Wrapper for .NETと比較してどうですか?

IronOCRはNuGetネイティブ for .NET OCRライブラリで、.CoreエンジンとしてIronTesseractを使用しています。Tesseract OCR Wrapper for .NETと比べ、よりシンプルなデプロイメント(SDKインストーラーなし)、定額制の価格設定、COMインターオプやクラウド依存のないクリーンなC# APIを提供します。

IronOCR はTesseract OCR Wrapper for .NETよりセットアップが簡単ですか?

IronOCRは単一のNuGetパッケージでインストールされます。SDKインストーラー、ライセンスファイルのコピー、COMコンポーネントの登録、ランタイムバイナリの管理は必要ありません。OCRエンジン全体がパッケージにバンドルされています。

Tesseract OCR Wrapper for .NETとIronOCRにはどのような精度の違いがありますか?

IronOCRは、標準的なビジネス文書、請求書、領収書、スキャンしたフォームに対して高い認識精度を達成します。高度に劣化した文書や一般的でないスクリプトの場合、精度はソースの品質によって異なります。IronOCRは低品質入力の認識を向上させる画像前処理フィルターを含んでいます。

IronOCRはPDFテキスト抽出をサポートしていますか?

IronOCRは、ネイティブPDFとスキャンしたPDFイメージの両方から、一回の呼び出しでテキストを抽出します。また、複数ページのTIFFファイル、画像、ストリームもサポートします。スキャンしたPDFの場合、OCRはページごとに適用され、ページごとの結果オブジェクトを持ちます。

Tesseract OCR Wrapper .NET 向け ライセンスはIronOCRと比較してどうですか?

IronOCRは、定額制の永久ライセンスで、ページ毎やスキャン毎の課金はありません。大量のドキュメントを処理する組織は、ボリュームに関係なく同じライセンス費用を支払います。詳しくはIronOCRライセンスページをご覧ください。

IronOCR はどの言語をサポートしていますか?

IronOCRは個別のNuGet言語パックにより127言語をサポートしています。言語を追加するには'dotnet add package IronOcr.Languages.{Language}'コマンドを実行するだけです。手動でのファイル配置やパス設定は必要ありません。

.NETプロジェクトにIronOCRをインストールするにはどうすればよいですか?

NuGet経由でインストールします:パッケージマネージャーコンソールで'Install-Package IronOcr'、またはCLIで'dotnet add package IronOcr'。追加の言語パックも同様にインストールされます。ネイティブSDKインストーラーは必要ありません。

IronOCR はTesseract OCR Wrapperと違い、Dockerやコンテナでのデプロイメントに適していますか?

IronOCRはNuGetパッケージによってDockerコンテナで動作します。ライセンスキーは環境変数で設定します。OCRエンジン自体にはライセンスファイル、SDKパス、ボリュームマウントは必要ありません。

Tesseract OCR Wrapperと比較して、購入前にIronOCRを試すことはできますか?

IronOCRのトライアルモードでは、ドキュメントを処理し、出力に透かしをオーバーレイしたOCR結果を返します。ライセンスを購入する前に、ご自身の文書で精度を確認することができます。

IronOCRはテキスト抽出とバーコード読み取りをサポートしていますか?

IronOCRはテキスト抽出とOCRに重点を置いています。バーコード読み取りについては、Iron SoftwareはIronBarcodeをコンパニオンライブラリとして提供しています。どちらも個別に、あるいはIron Suiteのバンドルとして提供されています。

Tesseract OCR Wrapper for .NETからIronOCRへの移行は簡単ですか?

Tesseract OCR Wrapper for .NETからIronOCRへの移行は、通常初期化シーケンスをIronTesseractのインスタンス化に置き換え、COMライフサイクル管理を削除し、APIコールを更新します。ほとんどの移行はコードの複雑さを大幅に軽減します。

Kannaopat Udonpant
ソフトウェアエンジニア
ソフトウェアエンジニアになる前に、Kannapatは北海道大学で環境資源の博士号を修了しました。博士号を追求する間に、彼はバイオプロダクションエンジニアリング学科の一部である車両ロボティクスラボラトリーのメンバーになりました。2022年には、C#のスキルを活用してIron Softwareのエンジニアリングチームに参加し、IronPDFに注力しています。Kannapatは、IronPDFの多くのコードを執筆している開発者から直接学んでいるため、この仕事を大切にしています。同僚から学びながら、Iron Softwareでの働く社会的側面も楽しんでいます。コードやドキュメントを書いていない時は、KannapatはPS5でゲームをしたり、『The Last of Us』を再視聴したりしていることが多いです。

アイアンサポートチーム

私たちは週5日、24時間オンラインで対応しています。
チャット
メール
電話してね