IRONSOFTWAREHOME
KORZYSTANIE Z IRONOCR

Ekstrakcja danych z paragonów za pomocą OCR (samouczek krok po kroku)

Kannaopat Udonpant
Kannapat Udonpant
Updated: 21 kwietnia 2026

Rozpoznawanie optyczne (OCR) paragonów za pomocą IronOCR to przełomowe rozwiązanie zarówno dla firm, jak i osób prywatnych. Proces ten pozwala na wyodrębnienie ważnych informacji z fizycznych paragonów i przekształcenie ich w dane cyfrowe. W tym artykułe krok po kroku dowiesz się, jak korzystać z IronOCR, aby w pełni wykorzystać swoje paragony.

Krótkie wprowadzenie do OCR

Optyczne rozpoznawanie znaków (OCR) to technologia, która pozwala komputerom odczytywać i rozumieć tekst z obrazów lub zeskanowanych dokumentów. Dzięki konwersji tekstu drukowanego na tekst czytelny dla komputera technologia OCR umożliwia przechowywanie, przetwarzanie i analizowanie informacji zawartych w dokumentach fizycznych.

2. Wprowadzenie do IronOCR

IronOCR to biblioteka OCR (Optical Character Recognition) dla programistów C# i .NET. Umożliwia programistom wyodrębnianie tekstu z obrazów, plików PDF i innych formatów dokumentów. IronOCR opiera się na popularnym silniku OCR Tesseract i oferuje dodatkowe funkcje, co czyni go idealnym wyborem do różnych zastosowań, w tym do rozpoznawania tekstu z paragonów.

3. Korzyści wynikające z użycia IronOCR do ekstrakcji danych

Oto kilka kluczowych korzyści wynikających z użycia IronOCR do ekstrakcji danych z paragonów za pomocą OCR:

  • Wysoka dokładność: IronOCR zapewnia doskonałą dokładność API OCR, gwarantując niezawodne wyodrębnianie danych z paragonów i innych dokumentów.
  • Obsługa wielu języków: IronOCR obsługuje ponad 125 języków, dzięki czemu nadaje się do zastosowań globalnych.
  • Łatwość użytkowania: Biblioteka oferuje proste i intuicyjne API, ułatwiające programistom wdrażanie funkcji OCR w ich projektach.
  • Możliwość dostosowania: IronOCR oferuje różne opcje precyzyjnego dostosowywania wyników OCR, zapewniając optymalne wyodrębnianie danych dla konkretnego zastosowania.

4. Jak działa IronOCR

IronOCR wykorzystuje zaawansowane algorytmy OCR do rozpoznawania i wyodrębniania tekstu z obrazów i dokumentów. Może przetwarzać różne formaty, w tym JPEG, PNG, TIFF i PDF. Biblioteka odczytuje plik wejściowy, rozpoznaje zawarty w nim tekst i generuje wyodrębniony tekst jako ciąg znaków, który następnie może być przetwarzany lub przechowywany zgodnie z wymaganiami. IronOCR wykorzystuje również wizję komputerową w celu uzyskania najlepszych wyników.

5. Wymagania wstępne dotyczące korzystania z IronOCR

Aby rozpocząć korzystanie z IronOCR do wyodrębniania danych z paragonów, należy najpierw zainstalować pakiet IronOCR. Można to łatwo zrobić za pomocą NuGet, menedżera pakietów dla .NET. Wystarczy otworzyć projekt w Visual Studio i wykonać następujące kroki:

  1. Kliknij prawym przyciskiem myszy swój projekt w Eksploratorze rozwiązań i wybierz "Zarządzaj pakietami NuGet".

  2. W oknie NuGet Package Manager wyszukaj "IronOCR".

  3. Wybierz pakiet IronOcr i kliknij "Zainstaluj".

    OCR Odczyt danych z paragonów (Samouczek krok po kroku), Rysunek 1: Wyszukaj pakiet IronOCR w UI Menedżera Pakietów NuGet Wyszukaj pakiet IronOcr w UI Menedżera Pakietów NuGet

6. Przygotowanie obrazu paragonu

Przed wyodrębnieniem danych z paragonu warto upewnić się, że obrazy paragonów są wysokiej jakości, aby poprawić dokładność procesu OCR API paragonów. Oto kilka wskazówek dotyczących robienia dobrych zdjęć paragonów:

  1. Użyj zeskanowanego dokumentu. Do skanowania paragonów można użyć skanera o wysokiej rozdzielczości.

  2. Upewnij się, że paragon jest dobrze oświetlony i nie ma na nim cieni.

  3. Wygładź wszelkie zagięcia lub fałdy na paragonie, aby żadne kluczowe informacje nie były zasłonięte.

  4. Upewnij się, że tekst na paragonie jest czytelny i nie jest rozmazany, aby usprawnić przetwarzanie paragonów.

    OCR Odczyt danych z paragonów (Samouczek krok po kroku), Rysunek 2: Przykładowy obraz paragonu do ekstrakcji tekstu Przykładowy obraz paragonu do wyodrębnienia tekstu

7. Wykonywanie OCR na obrazie paragonu

Po zainstalowaniu IronOCR i przygotowaniu obrazu paragonu nadszedł czas na przeprowadzenie procesu OCR. W aplikacji .NET użyj następującego fragmentu kodu:

using IronOcr;

// Initialize the IronTesseract class, which is responsible for OCR operations
var ocr = new IronTesseract();

// Use the OcrInput class to load the image of your receipt.
// Replace @"path/to/your/receipt/image.png" with the actual file path.
using (var ocrInput = new OcrInput(@"path/to/your/receipt/image.png"))
{
    // Read the content of the image and perform OCR recognition
    var result = ocr.Read(ocrInput);
    
    // Output the recognized text to the console
    Console.WriteLine(result.Text);
}

Wyjaśnienie kodu

using IronOcr;

Ta linia importuje bibliotekę IronOCR do aplikacji .NET, umożliwiając dostęp do jej funkcji.

var ocr = new IronTesseract();

Ta linia tworzy nową instancję klasy IronTesseract, głównej klasy odpowiedzialnej za operacje OCR w IronOCR.

using (var ocrInput = new OcrInput(@"path/to/your/receipt/image.png"))

Tutaj tworzona jest nowa instancja klasy OcrInput, reprezentującej obraz wejściowy dla procesu OCR. @"path/to/your/receipt/image.png" należy zastąpić rzeczywistą ścieżką do pliku z obrazem paragonu. Instrukcja using zapewnia, że zasoby przydzielone do instancji OcrInput są prawidłowo zwalniane po zakończeniu operacji OCR.

var result = ocr.Read(ocrInput);

Ta linia wywołuje metodę Read instancji IronTesseract, przekazując obiekt OcrInput jako parametr. Metoda Read przetwarza obraz wejściowy i wykonuje operację OCR, rozpoznając i ekstraktuąc tekst z obrazu. Rozpocznie to proces rozpoznawania paragonów.

Console.WriteLine(result.Text);

Na koniec ta linia wyświetla wyodrębniony tekst w konsoli. Obiekt result, który jest instancją klasy OcrResult, zawiera rozpoznany tekst i dodatkowe informacje o procesie OCR. Wyodrębniony tekst można wyświetlić, uzyskując dostęp do właściwości Text obiektu result.

OCR Odczyt danych z paragonów (Samouczek krok po kroku), Rysunek 3: Wynik wyodrębnionych tekstów Wynik wyodrębnionych tekstów

Dopracowanie wyników OCR

IronOCR oferuje kilka opcji poprawiających dokładność i wydajność OCR. Obejmuje to wstępne przetwarzanie obrazu, dostosowanie ustawień silnika OCR oraz wybór odpowiedniego języka dla paragonu.

Wstępne przetwarzanie obrazów

Możesz poprawić wyniki OCR, stosując techniki wstępnego przetwarzania obrazów, takie jak:

  1. Prostowanie: Skoryguj wszelkie obroty lub pochylenia obrazu.
  2. Usuwanie szumów: Popraw czytelność tekstu poprzez usunięcie szumów z obrazów.

Oto przykład zastosowania tych technik:

using IronOcr;

// Initialize the IronTesseract class
var ocr = new IronTesseract();

// Load the image of your receipt and apply preprocessing techniques
using (var input = new OcrInput(@"path/to/your/receipt/image.png"))
{
    input.DeNoise(); // Remove noise from the image
    input.DeSkew();  // Correct any skewing in the image

    // Perform OCR and extract the recognized text
    var result = ocr.Read(input);
    Console.WriteLine(result.Text);
}

Wybór języka

IronOCR obsługuje ponad 125 języków, a wybór odpowiedniego języka dla danego dokumentu może znacznie poprawić wyniki OCR. Aby określić język, dodaj następujący wiersz do swojego kodu:

ocr.Configuration.Language = OcrLanguage.English;

Pobieranie danych z wyników OCR

Po zakończeniu procesu OCR nadszedł czas na wyodrębnienie konkretnych informacji z tekstu. W zależności od potrzeb możesz chcieć wyodrębnić takie dane, jak:

  1. Nazwa i adres sklepu.
  2. Data i godzina zakupu.
  3. Nazwy produktów i ceny.
  4. Suma częściowa, podatek i kwota całkowita.

W tym celu w aplikacji .NET można używać wyrażeń regularnych lub technik manipulacji ciągami znaków. Na przykład, można wyodrębnić datę z wyniku OCR za pomocą następującego fragmentu kodu:

using System;
using System.Text.RegularExpressions;

// Define a regular expression pattern for matching dates
var datePattern = @"\d{1,2}\/\d{1,2}\/\d{2,4}";

// Search for a date in the OCR result text
var dateMatch = Regex.Match(result.Text, datePattern);
if (dateMatch.Success)
{
    // Parse the matched date string into a DateTime object
    var dateValue = DateTime.Parse(dateMatch.Value);
    Console.WriteLine("Date: " + dateValue);
}

Możesz stworzyć podobne wzorce dla innych informacji, które chcesz wyodrębnić z paragonu.

Przechowywanie i analiza wyodrębnionych danych

Teraz, gdy wyodrębniłeś już istotne informacje z paragonu, możesz je zapisać w bazie danych, przeanalizować lub wyeksportować do innych formatów plików, takich jak CSV, JSON lub Excel.

Wnioski

Podsumowując, OCR paragonów przy użyciu IronOCR to innowacyjne i wydajne rozwiązanie do digitalizacji i zarządzania danymi finansowymi. Dzięki IronOCR można zrezygnować z ręcznego wprowadzania danych. Postępując zgodnie z tym przewodnikiem krok po kroku, możesz wykorzystać możliwości IronOCR do usprawnienia śledzenia wydatków i analizy danych. Najlepsze jest to, że IronOCR oferuje bezpłatną wersję próbną, dzięki czemu możesz sprawdzić jego możliwości bez żadnych zobowiązań.

Po okresie próbnym, jeśli zdecydujesz się kontynuować używanie IronOCR, licencja zaczyna się od $999, zapewniając opłacalny sposób wykorzystania korzyści technologii OCR w twoich aplikacjach.

Powiązane artykuły

Key in blue circle

Uzyskaj natychmiast swój darmowy 30-dniowy Klucz Testowy.

Your trial license will be sent to your email address

Brak ograniczeń. 100% dostępności. Bez karty kredytowej.

bullet_checkedNie wymaga karty kredytowej ani tworzenia kontaBrak ograniczeń. 100% dostępności. Bez karty kredytowej.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
Otrzymaj swoją Konsultację Bez Zobowiązań
Wypełnij poniższy formularz lub wyślij e-mail na sales@ironsoftware.com
Twoje dane zawsze będą utrzymywane w tajemnicy.
Zaufane przez miliony inżynierów na całym świecie
Logotypy klientów Iron Software
Otrzymaj swój darmowy Klucz Próbny na 30 dni natychmiast.
Nie wymaga karty kredytowej ani tworzenia konta