IRONSOFTWAREHOME
IRONOCRの使い方

OCRレシートデータ抽出(ステップバイステップチュートリアル)

Kannaopat Udonpant
Kannapat Udonpant
Updated: 2026年4月21日

IronOCR を使用した領収書 OCR は、ビジネスや個人にとって画期的なものです。このプロセスによって、紙の領収書から重要な情報を抽出し、それをデジタルデータに変換することができます。 この記事では、IronOCR を使用して領収書を最大限に活用するためのステップバイステップの旅をお届けします。

OCRの簡単な紹介

光学文字認識、または OCR は、コンピューターが画像やスキャンした文書からテキストを読み取り理解することを可能にする技術です。 OCR により、印刷されたテキストを機械可読テキストに変換することで、紙の文書に含まれる情報を保存、処理、分析できるようになります。

2. IronOCRの紹介

IronOCR は、C# および .NET 開発者向けの OCR (光学文字認識) ライブラリです。 開発者は、画像からテキストを抽出したり、PDFやその他の文書形式からテキストを抽出したりすることができます。 IronOCR は、人気のある Tesseract OCR エンジン を基に構築されており、追加機能を提供しているため、さまざまなアプリケーションでの使用に最適です。領収書 OCR を含みます。

3. データ抽出にIronOCRを使用する利点

IronOCR を使用した OCR 領収書データ抽出の主な利点は次のとおりです。

-高精度: IronOCRは優れたOCR API精度を提供し、領収書やその他の文書からの信頼性の高いデータ抽出を保証します。

  • 多言語対応: IronOCR は 125 以上の言語をサポートしており、グローバル アプリケーションにも適しています。 -**使いやすさ:**このライブラリはシンプルで直感的なAPIを提供しているため、開発者はプロジェクトにOCR機能を簡単に実装できます。 -カスタマイズ可能: IronOCRは、OCR結果を微調整するためのさまざまなオプションを提供し、特定の用途に最適なデータ抽出を保証します。

4. IronOCRの仕組み

IronOCR は、高度な OCR アルゴリズムを使用して画像や文書からテキストを認識して抽出します。 JPEG、PNG、TIFF、PDF など、さまざまな形式を処理できます。 このライブラリは入力ファイルを読み取り、その中のテキストを認識し、抽出されたテキストを文字列として出力し、その後必要に応じて処理または保存できます。 IronOCR は、コンピュータ ビジョン も使用して最高の結果を達成します。

5. IronOCRを使用するための前提条件

領収書データ抽出のために IronOCR を使用し始めるには、まず IronOCR パッケージをインストールする必要があります。 これは、.NET 用のパッケージ マネージャーである NuGet を通じて簡単に行うことができます。 Visual Studio でプロジェクトを開き、次の手順に従います。

  1. ソリューション エクスプローラーでプロジェクトを右クリックし、"NuGet パッケージの管理"を選択します。

  2. NuGet パッケージ マネージャー ウィンドウで"IronOCR"を検索します。

  3. IronOcr パッケージを選択し、"インストール"をクリックします。

    OCR レシートデータ抽出(ステップバイステップチュートリアル)、図1: NuGetパッケージマネージャUIでIronOCRパッケージを検索 NuGetパッケージマネージャーUIでIronOcrパッケージを検索

6.領収書画像の準備

領収書からデータを抽出する前に、領収書画像が高品質であることを確認して、領収書 OCR API プロセスの精度を向上させる必要があります。 領収書の画像を撮影するためのヒントをいくつか紹介します。

  1. スキャンした文書を使用します。 領収書のスキャンには、高解像度のスキャナーを使用できます。

  2. 領収書が適切に照らされ、影がないことを確認してください。

  3. 領収書の折り目や折れ目をまっすぐにして、重要な情報が隠れないようにします。

  4. 領収書の文字が明瞭で、汚れていないことを確認して、領収書の処理を改善します。

    OCR レシートデータ抽出(ステップバイステップチュートリアル)、図2: 文字抽出のためのサンプルレシート画像 テキスト抽出用のサンプル領収書画像

7. レシート画像のOCR処理

IronOCR がインストールされ、領収書画像が準備できたら、OCR プロセスを実行する時が来ました。 .NET アプリケーションで次のコードスニペットを使用します。

using IronOcr;

// Initialize the IronTesseract class, which is responsible for OCR operations
var ocr = new IronTesseract();

// Use the OcrInput class to load the image of your receipt.
// Replace @"path/to/your/receipt/image.png" with the actual file path.
using (var ocrInput = new OcrInput(@"path/to/your/receipt/image.png"))
{
    // Read the content of the image and perform OCR recognition
    var result = ocr.Read(ocrInput);
    
    // Output the recognized text to the console
    Console.WriteLine(result.Text);
}

コードの説明

using IronOcr;

この行は、IronOCR ライブラリを .NET アプリケーションにインポートし、その機能にアクセスできるようにします。

var ocr = new IronTesseract();

この行は、IronOCRでのOCR操作を担当する主クラスであるIronTesseractクラスの新しいインスタンスを作成します。

using (var ocrInput = new OcrInput(@"path/to/your/receipt/image.png"))

ここでは、OCRプロセスの入力画像を表すOcrInputクラスの新しいインスタンスが作成されます。 "path/to/your/receipt/image.png" は、領収書画像の実際のファイルパスに置き換える必要があります。 このOcrInputインスタンスに割り当てられたリソースが適切に解放されることを保証します。

var result = ocr.Read(ocrInput);

この行はOcrInputオブジェクトをパラメータとして渡します。 Readメソッドは入力画像を処理し、OCR操作を実行して画像から文字を認識および抽出します。 これにより、領収書の認識プロセスが開始されます。

Console.WriteLine(result.Text);

最後に、この行は抽出されたテキストをコンソールに出力します。 resultオブジェクトは、OcrResultクラスのインスタンスであり、認識されたテキストとOCRプロセスに関する追加情報を含んでいます。 抽出されたテキストは、Textプロパティにアクセスすることによって表示できます。

OCR レシートデータ抽出(ステップバイステップチュートリアル)、図3: 抽出されたテキストの出力 抽出されたテキストの出力

OCR結果の微調整

IronOCR は、OCR の精度とパフォーマンスを向上させるためのいくつかのオプションを提供します。 これには、画像の事前処理、OCR エンジン設定の調整、領収書に適した言語の選択が含まれます。

画像前処理

次のように画像の事前処理技術を適用することで、OCR の結果を向上させることができます。

  1. 転向: 画像内の回転や傾きを修正します。
  2. ノイズ除去: 画像のノイズを除去してテキストの可読性を向上させます。

これらの技術を適用する方法の例を次に示します。

using IronOcr;

// Initialize the IronTesseract class
var ocr = new IronTesseract();

// Load the image of your receipt and apply preprocessing techniques
using (var input = new OcrInput(@"path/to/your/receipt/image.png"))
{
    input.DeNoise(); // Remove noise from the image
    input.DeSkew();  // Correct any skewing in the image

    // Perform OCR and extract the recognized text
    var result = ocr.Read(input);
    Console.WriteLine(result.Text);
}

言語の選択

IronOCR は 125 以上の言語をサポートしており、領収書に適した言語を選択することで、OCR の結果が大幅に向上します。 言語を指定するには、次の行をコードに追加します。

ocr.Configuration.Language = OcrLanguage.English;

OCR結果からのデータ抽出

OCR プロセスが完了したら、テキストから特定の情報を抽出する時が来ました。 ニーズに応じて、次のようなデータを抽出したい場合があります。

  1. 店名と住所。
  2. 購入日時。
  3. 商品名と価格。
  4. 小計、税金、合計金額。

これを行うには、.NET アプリケーションで正規表現や文字列操作技術を使用できます。 たとえば、次のコードスニペットを使用して、OCR 結果から日付を抽出することができます。

using System;
using System.Text.RegularExpressions;

// Define a regular expression pattern for matching dates
var datePattern = @"\d{1,2}\/\d{1,2}\/\d{2,4}";

// Search for a date in the OCR result text
var dateMatch = Regex.Match(result.Text, datePattern);
if (dateMatch.Success)
{
    // Parse the matched date string into a DateTime object
    var dateValue = DateTime.Parse(dateMatch.Value);
    Console.WriteLine("Date: " + dateValue);
}

領収書から抽出する必要があるその他の情報についても、同様のパターンを作成することができます。

抽出されたデータの保存と分析

領収書から関係する情報を抽出したので、それをデータベースに保存したり、分析したり、CSV、JSON、Excel などの他のファイル形式にエクスポートしたりできます。

結論

結論として、IronOCR を使用した領収書 OCR は、財務データのデジタル化と管理において革新的で効率的なソリューションです。 IronOCR を使用すると、手動データ入力を置き換えることができます。 このステップバイステップガイドに従うことで、IronOCR のパワーを利用して費用追跡とデータ分析を改善できます。 最良の部分は、IronOCR は 無料トライアル を提供しており、何のコミットメントもなくその機能を体験できることです。

試用期間後にIronOCRの使用を継続することを決定した場合、ライセンスは$999から始まり、アプリケーションでOCR技術の利点を活用するコスト効率の良い方法を提供します。

関連する記事

Key in blue circle

無料の30日間トライアルキーをすぐに入手してください。

Your trial license will be sent to your email address

制限なし。100% ロック解除済み。クレジットカード不要。

bullet_checkedクレジットカードやアカウントの作成は不要です。制限なし。100% ロック解除済み。クレジットカード不要。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
義務のない相談を受ける
下記のフォームを記入するか、sales@ironsoftware.comにメールしてください。
あなたの詳細は常に守秘されます。
世界中の数百万人のエンジニアから信頼されています。
ライセンスはより安く
あなたの無料30日間の試用キーをすぐに入手。
クレジットカードやアカウントの作成は不要です。