
OCR-Rechnungsverarbeitung in C# (Entwickler-Tutorial)
Die Verarbeitung von Rechnungsdaten bezieht sich auf den Erhalt, die Verwaltung und Validierung von Rechnungen von Lieferanten oder Anbietern und stellt sicher, dass Zahlungen korrekt und pünktlich erfolgen. Es umfasst Schritte zur Gewährleistung von Genauigkeit, Compliance und Effizienz bei der Abwicklung von Geschäftstransaktionen, um Papierrechnungen zu vermeiden. Automatisierte Rechnungsverarbeitung kann manuelle Dateneingabefehler erheblich reduzieren und die Effizienz verbessern. IronOCR ist eine leistungsstarke optische Zeichenerkennungs- (OCR-) Softwarebibliothek, die verwendet werden kann, um Daten oder Text von Rechnungen aus einer digitalen Datei zu extrahieren. Dadurch wird es zu einem hervorragenden Werkzeug für die Automatisierung der OCR-Rechnungsverarbeitung in C#-Anwendungen.
So verarbeiten Sie Rechnungsdaten mit OCR-Software wie IronOCR
- Ein Visual Studio Projekt erstellen.
- Installieren Sie die IronOCR C#-Bibliothek.
- Muster-Rechnungseingangsbild.
- Nutzen Sie Tesseract und extrahieren Sie Daten aus dem Rechnungsbild.
- Lesen Sie nur einen Bereich eines Bildes.
Optische Zeichenerkennung (OCR)
Optische Zeichenerkennung ist eine Technologie, die es ermöglicht, verschiedene Arten von Dokumenten, PDFs oder Bilder von Text in editierbare und durchsuchbare Daten zu erkennen und umzuwandeln. OCR-Technologie verarbeitet Textbilder und extrahiert die Zeichen, um sie maschinenlesbar zu machen. Fortgeschrittene OCR-Rechnungssoftware-Systeme helfen bei Finanzmanagement-Tools und Rechnungsautomatisierung.
Wichtige Punkte zur OCR
- Funktionalität: OCR-Software scannt Bilder oder Texte (z. B. Fotos oder gescannte Dokumente) und wandelt die Zeichen in digitalen Text um, der bearbeitet, durchsucht und gespeichert werden kann.
- Anwendungsgebiete: OCR wird in verschiedenen Branchen für Aufgaben wie die Digitalisierung gedruckter Dokumente, die Rechnungsverarbeitung, die Extraktion von Formulardaten, die automatische Kennzeichenerkennung (ANPR), den Workflow der Kreditorenbuchhaltung und das Scannen von Büchern eingesetzt.
- Technologie: OCR verwendet Algorithmen, um Hell-Dunkel-Muster zu erkennen und Zeichen zu interpretieren. Moderne OCR-Systeme verwenden auch maschinelles Lernen und künstliche Intelligenz, um die Genauigkeit zu verbessern.
- Vorteile: OCR steigert die Produktivität durch die Automatisierung der Dateneingabe, reduziert Fehler und ermöglicht eine einfachere Datensuche und -abfrage. Es unterstützt auch die Dokumentenarchivierung und hilft Unternehmen, papierlose Workflows zu verwalten.
Die OCR-Technologie hat sich erheblich weiterentwickelt und ist hochgenau und nützlich für die Verarbeitung von Dokumenten und die Extraktion von Rechnungsdaten in verschiedenen Rechnungsformaten, um manuelle Dateneingaben zu reduzieren, die manuelle Rechnungsverarbeitung zu eliminieren und die Datensicherheit zu verbessern.
IronOCR
IronOCR ist eine leistungsstarke optische Zeichenerkennungsbibliothek für .NET (C#), die Entwicklern ermöglicht, Text aus Bildern, PDFs und anderen Dokumentformaten zu extrahieren, OCR-Rechnungssoftware zu entwickeln und den Kreditorenworkflow zu implementieren. Sie bietet eine benutzerfreundliche API zur Integration von OCR-Funktionen in das Kreditorensystem oder Buchhaltungssystem.
Wichtige Merkmale von IronOCR
- Textextraktion: Es kann Text aus verschiedenen Bildformaten (PNG, JPG, TIFF usw.) und PDFs extrahieren, einschließlich mehrseitiger PDFs für Buchhaltungssoftware.
- Genauigkeit: IronOCR verwendet fortschrittliche Algorithmen und Techniken des maschinellen Lernens, um eine hohe Genauigkeit bei der Texterkennung zu gewährleisten, selbst bei verrauschten oder qualitativ minderwertigen Bildern für Kreditorenprozesse und Skontoabzüge.
- Sprachunterstützung: Die Bibliothek unterstützt mehrere Sprachen, darunter Englisch, Spanisch, Französisch und andere, was die Texterkennung in verschiedenen Sprachen erleichtert.
- Benutzerfreundlichkeit: IronOCR bietet eine einfache API, die es Entwicklern ermöglicht, OCR-Funktionen schnell in ihre Anwendungen zu integrieren, ohne dass tiefgreifende technische Kenntnisse der OCR-Techniken erforderlich sind.
- Barcode- und QR-Code-Erkennung: Zusätzlich zur Standard-Texterkennung kann IronOCR auch Barcodes und QR-Codes aus Bildern erkennen und extrahieren.
- PDF-Unterstützung: Es kann gescannte PDFs lesen und Text daraus extrahieren und ist daher nützlich für die Verarbeitung von Rechnungen, Quittungen und anderen Geschäftsdokumenten.
- Anpassung: Die Bibliothek ermöglicht die Anpassung der OCR-Einstellungen an spezifische Bedürfnisse, z. B. die Anpassung der Genauigkeit oder die Verarbeitung unterschiedlicher Bildauflösungen.
Voraussetzungen
Bevor Sie beginnen, stellen Sie sicher, dass Sie Folgendes haben:
- Visual Studio ist auf Ihrem Computer installiert.
- Grundkenntnisse der C#-Programmierung.
- IronOCR NuGet-Paket in Ihrem Projekt installiert.
Schritt 1: Erstellen Sie ein Visual Studio-Projekt
Öffnen Sie Visual Studio und klicken Sie auf Neues Projekt erstellen.

Wählen Sie in den Optionen die Konsole-App aus.

Geben Sie den Projektnamen und den Pfad an.

Wählen Sie den .NET-Versionstyp.

Schritt 2: Installieren Sie die IronOCR C#-Bibliothek
Gehen Sie in Ihrem Projekt in Visual Studio zu Extras > NuGet-Paket-Manager > NuGet-Pakete für die Lösung verwalten. Klicken Sie auf die Registerkarte Durchsuchen und suchen Sie IronOCR. Wählen Sie IronOCR und klicken Sie auf Installieren.

Eine weitere Option ist die Verwendung der Konsole und des unten stehenden Befehls.
Schritt 3: Muster-Rechnungseingangsbild
Beispiel für ein digitales Rechnungsbild mit der Rechnungsnummer.

Schritt 4: Nutzen Sie Tesseract und extrahieren Sie Daten aus dem Rechnungsbild
Verwenden Sie nun den untenstehenden Code, um Daten aus einer Rechnung für die OCR-Rechnungsverarbeitung zu extrahieren.
using IronOcr;
// Set the license key
License.LicenseKey = "Your License";
string filePath = "sample1.jpg"; // Path to the invoice image
// Create an instance of IronTesseract
var ocr = new IronTesseract();
// Load the image for OCR
using (var ocrInput = new OcrInput())
{
ocrInput.LoadImage(filePath);
// Optionally apply filters if needed
ocrInput.Deskew();
// ocrInput.DeNoise();
// Perform OCR to extract text
var ocrResult = ocr.Read(ocrInput);
// Output the extracted text
Console.WriteLine("Extracted Text:");
Console.WriteLine(ocrResult.Text);
// Next steps would involve processing the extracted text
}Imports IronOcr
' Set the license key
License.LicenseKey = "Your License"
Dim filePath As String = "sample1.jpg" ' Path to the invoice image
' Create an instance of IronTesseract
Dim ocr As New IronTesseract()
' Load the image for OCR
Using ocrInput As New OcrInput()
ocrInput.LoadImage(filePath)
' Optionally apply filters if needed
ocrInput.Deskew()
' ocrInput.DeNoise()
' Perform OCR to extract text
Dim ocrResult = ocr.Read(ocrInput)
' Output the extracted text
Console.WriteLine("Extracted Text:")
Console.WriteLine(ocrResult.Text)
' Next steps would involve processing the extracted text
End UsingCode-Erklärung
Der bereitgestellte Code demonstriert, wie die IronOCR-Bibliothek in C# verwendet wird, um Text aus einem Bild (z. B. einer Rechnung) unter Verwendung von OCR (optische Zeichenerkennung) zu extrahieren. Hier eine Erklärung zu jedem Teil des Codes:
-
Einrichtung des Lizenzschlüssels:
- Der Code beginnt mit der Einstellung des Lizenzschlüssels für IronOCR. Dieser Schlüssel ist notwendig, um die volle Funktionalität der Bibliothek zu nutzen. Wenn Sie über eine gültige Lizenz verfügen, ersetzen Sie "Your License" durch Ihren tatsächlichen Lizenzschlüssel.
-
Angabe der Eingabedatei:
- Die Variable
filePathenthält den Speicherort des Bildes, das die Rechnung enthält (in diesem Fall "sample1.jpg"). Dies ist die Datei, die für die Textextraktion verarbeitet wird.
- Die Variable
-
Erstellen einer OCR-Instanz: Es wird eine Instanz von
IronTesseracterstellt.IronTesseractist die Klasse, die für die Durchführung der OCR-Operation an den Eingabedaten zuständig ist. -
Laden des Bildes:
- Der Code erzeugt ein
OcrInputObjekt, das das durchfilePathangegebene Bild mithilfe der MethodeLoadImagelädt.
- Der Code erzeugt ein
-
Bildfilter anwenden:
- Der Code wendet optional Filter wie
Deskew()an, um verzerrte Bilder zu korrigieren und die Genauigkeit der OCR zu verbessern.
- Der Code wendet optional Filter wie
-
OCR durchführen: Die Methode
ocr.Read()extrahiert Text aus dem geladenen Bild und gibt einOcrResultzurück, das den extrahierten Text enthält. -
Anzeige des extrahierten Textes:
- Der extrahierte Text wird auf der Konsole ausgegeben. Dieser Text ist das, was IronOCR aus dem Bild erkannt hat und kann weiterverarbeitet werden.
Ausgabe

Schritt 5: Lesen Sie nur einen Bereich eines Bildes
Um die Effizienz zu steigern, kann nur ein Teil des Bildes zur Extraktion verarbeitet werden.
using IronOcr;
using IronSoftware.Drawing;
// Set the license key
License.LicenseKey = "Your Key";
string filePath = "sample1.jpg"; // Path to the invoice image
// Create an instance of IronTesseract
var ocr = new IronTesseract();
// Load the image for OCR
using (var ocrInput = new OcrInput())
{
// Define the region of interest
var ContentArea = new Rectangle(x: 0, y: 0, width: 1000, height: 250);
ocrInput.LoadImage(filePath, ContentArea);
// Optionally apply filters if needed
ocrInput.Deskew();
// ocrInput.DeNoise();
// Perform OCR to extract text
var ocrResult = ocr.Read(ocrInput);
// Output the extracted text
Console.WriteLine("Extracted Text:");
Console.WriteLine(ocrResult.Text);
}Imports IronOcr
Imports IronSoftware.Drawing
' Set the license key
License.LicenseKey = "Your Key"
Dim filePath As String = "sample1.jpg" ' Path to the invoice image
' Create an instance of IronTesseract
Dim ocr As New IronTesseract()
' Load the image for OCR
Using ocrInput As New OcrInput()
' Define the region of interest
Dim ContentArea As New Rectangle(x:=0, y:=0, width:=1000, height:=250)
ocrInput.LoadImage(filePath, ContentArea)
' Optionally apply filters if needed
ocrInput.Deskew()
' ocrInput.DeNoise()
' Perform OCR to extract text
Dim ocrResult = ocr.Read(ocrInput)
' Output the extracted text
Console.WriteLine("Extracted Text:")
Console.WriteLine(ocrResult.Text)
End UsingCode-Erklärung
Dieser Code extrahiert Text aus einem bestimmten Bereich eines Bildes unter Verwendung von IronOCR mit Optionen für Bildfilter, die die Genauigkeit verbessern. Hier eine Aufteilung jedes Teils:
-
Lizenzeinrichtung:
- Setzt den Lizenzschlüssel für IronOCR, der notwendig ist, um die OCR-Funktionen der Bibliothek zu verwenden. Ersetzen Sie "Your Key" durch Ihren gültigen Lizenzschlüssel.
-
Festlegen des Bilddateipfads:
- Gibt den Dateipfad zum Rechnungsbild an, das verarbeitet werden soll, und das die Inhalte für die Textextraktion enthält.
-
Erstellen einer OCR-Instanz:
- Es wird eine Instanz von
IronTesseracterstellt, um die OCR-Operationen durchzuführen.
- Es wird eine Instanz von
-
Definition des zu bearbeitenden Bereichs:
- Gibt einen rechteckigen Bereich innerhalb des Bildes an (beginnend an der oberen linken Ecke), um den OCR-Prozess auf einen relevanten Abschnitt zu konzentrieren und die Effizienz zu verbessern.
-
Laden des Bildes:
- Lädt den angegebenen Inhaltsbereich des Bildes aus der Datei. Dies beschränkt die OCR-Verarbeitung auf einen bestimmten Teil des Bildes.
-
Filter anwenden:
- Wendet Filter wie
Deskew()an, um die Bildausrichtung zu verbessern, und gegebenenfallsDeNoise(), um das Bild zu bereinigen und so die Genauigkeit der OCR zu verbessern.
- Wendet Filter wie
-
Extrahieren des Textes:
- Liest den Text aus dem definierten Bereich und speichert ihn in einem
OcrResult.
- Liest den Text aus dem definierten Bereich und speichert ihn in einem
-
Ausgabe des extrahierten Textes:
- Gibt den OCR-verarbeiteten Text zur weiteren Verwendung auf der Konsole aus.
Ausgabe

Lizenz (Testversion verfügbar)
IronOCR erfordert einen Schlüssel, um Daten aus Rechnungen zu extrahieren. Erhalten Sie Ihren Entwickler-Testschlüssel von der Lizenzseite.
using IronOcr;
License.LicenseKey = "Your Key";Imports IronOcr
License.LicenseKey = "Your Key"Abschluss
Dieser Artikel lieferte ein einfaches Beispiel, wie man mit IronOCR für die Rechnungsverarbeitung beginnt. Passen Sie diesen Code weiter an, um Ihre spezifischen Anforderungen zu erfüllen.
IronOCR bietet eine effiziente und einfach zu integrierende Lösung zur Textextraktion aus Bildern und PDFs, was es ideal für die Rechnungsverarbeitung macht. Durch die Kombination von IronOCR mit C#-String-Manipulation oder regulären Ausdrücken können Sie schnell wichtige Daten aus Rechnungen verarbeiten und extrahieren.
Dies ist ein einfaches Beispiel für die Rechnungsverarbeitung, und mit fortgeschritteneren Konfigurationen (wie Spracherkennung, mehrseitige PDF-Verarbeitung, etc.) können Sie die OCR-Ergebnisse feintunen, um die Genauigkeit für Ihren spezifischen Anwendungsfall zu verbessern.
Die API von IronOCR ist flexibel und kann für eine Vielzahl von OCR-Aufgaben über die Rechnungsverarbeitung hinaus eingesetzt werden, einschließlich Belegscannen, Dokumenten-Konvertierung und automatisierter Dateneingabe.

Verwandte Artikel

