
Traitement des factures avec OCR en C# (Tutoriel pour développeurs)
Le traitement des données de facturation consiste à recevoir, gérer et valider les factures des fournisseurs ou des vendeurs, et à s'assurer que les paiements sont effectués correctement et à temps. Cela implique des étapes conçues pour assurer l'exactitude, la conformité et l'efficacité dans le traitement des transactions commerciales afin d'éviter les factures papier. Le traitement automatisé des factures peut considérablement réduire les erreurs de saisie manuelle des données et améliorer l'efficacité. IronOCR est une puissante bibliothèque de reconnaissance optique de caractères (OCR) qui peut être utilisée pour extraire des données ou du texte de factures à partir d'un fichier numérique, en faisant un excellent outil pour automatiser le traitement OCR des factures dans les applications C#.
Comment traiter les données de facturation en utilisant un logiciel OCR comme IronOCR
- Créez un projet Visual Studio.
- Installez la bibliothèque C# IronOCR.
- Exemple d'image de facture d'entrée.
- Utilisez Tesseract et extrayez les données de l'image du reçu.
- Lire uniquement une région d'une image.
Reconnaissance Optique de Caractères (OCR)
La reconnaissance optique de caractères est une technologie qui permet de reconnaître et de convertir différents types de documents, de PDF ou d'images de texte en données éditables et consultables. La technologie OCR traite les images de texte et extrait les caractères, les rendant lisibles par machine. Les systèmes avancés de logiciels de facturation OCR aident dans les outils de gestion financière et l'automatisation des factures.
Points clés sur l'OCR
- Fonctionnalités : Le logiciel OCR numérise les images ou le texte (par exemple, les photos ou les documents numérisés) et convertit les caractères en texte numérique qui peut être modifié, recherché et stocké.
- Applications : La reconnaissance optique de caractères (OCR) est largement utilisée dans divers secteurs pour des tâches telles que la numérisation de documents imprimés, le traitement des factures, l'extraction de données de formulaires, la reconnaissance automatique des plaques d'immatriculation (ANPR), le flux de travail des comptes fournisseurs et la numérisation de livres.
- Technologie : La reconnaissance optique de caractères (OCR) utilise des algorithmes pour identifier les motifs de lumière et d'ombre afin d'interpréter les caractères. Les systèmes OCR modernes emploient également l'apprentissage automatique et l'intelligence artificielle pour améliorer la précision.
- Avantages : La reconnaissance optique de caractères (OCR) améliore la productivité en automatisant la saisie des données, en réduisant les erreurs et en facilitant la recherche et la récupération des données. Il prend également en charge l'archivage des documents et aide les entreprises à gérer des flux de travail sans papier.
La technologie OCR a considérablement évolué, devenant très précise et utile pour traiter les documents et l'extraction de données de factures à travers de nombreux formats de factures différents, afin de réduire la saisie manuelle de données, d'éliminer le traitement manuel des factures et d'améliorer la sécurité des données.
IronOCR
IronOCR est une puissante bibliothèque de reconnaissance optique de caractères (OCR) pour .NET (C#) qui permet aux développeurs d'extraire du texte d'images, de PDF et d'autres formats de documents, de développer des logiciels de facturation OCR et de mettre en œuvre des flux de travail des comptes fournisseurs. Il fournit une API facile à utiliser pour intégrer les capacités OCR dans le système de comptes fournisseurs ou le système comptable.
Fonctionnalités clés d'IronOCR
- Extraction de texte : Il peut extraire du texte à partir de divers formats d'image (PNG, JPG, TIFF, etc.) et de PDF, y compris les PDF multipages pour les logiciels de comptabilité.
- Précision : IronOCR utilise des algorithmes avancés et des techniques d'apprentissage automatique pour fournir une grande précision dans la reconnaissance de texte, même pour les images bruitées ou de faible qualité, pour les processus de comptes fournisseurs et les remises pour paiement anticipé.
- Prise en charge des langues : La bibliothèque prend en charge plusieurs langues, dont l'anglais, l'espagnol, le français et d'autres, ce qui facilite la reconnaissance de textes dans différentes langues.
- Facilité d'utilisation : IronOCR offre une API simple qui permet aux développeurs d'intégrer rapidement la fonctionnalité OCR dans leurs applications sans nécessiter de connaissances techniques approfondies des techniques OCR.
- Reconnaissance des codes-barres et des codes QR : Outre la reconnaissance de texte standard, IronOCR peut également détecter et extraire les codes-barres et les codes QR à partir d'images.
- Prise en charge des fichiers PDF : Il peut lire et extraire du texte à partir de fichiers PDF numérisés, ce qui le rend utile pour le traitement des factures, des reçus et autres documents commerciaux.
- Personnalisation : La bibliothèque permet de personnaliser les paramètres OCR en fonction des besoins spécifiques, comme le réglage de la précision ou la gestion de différentes résolutions d'image.
Prérequis
Avant de commencer, assurez-vous d'avoir les éléments suivants :
- Visual Studio est installé sur votre machine.
- Compréhension de base de la programmation C#.
- Le package NuGet IronOCR est installé dans votre projet.
Étape 1 : Créer un projet Visual Studio
Ouvrez Visual Studio et cliquez sur Créer un nouveau projet.

Sélectionnez Console App dans les options.

Fournissez le nom du projet et le chemin.

Sélectionnez le type de Version .NET.

Étape 2 : Installer la bibliothèque C# IronOCR
Dans votre projet dans Visual Studio, allez dans Outils > Package Manager NuGet > Gérer les Paquets NuGet pour la Solution. Cliquez sur l'onglet Parcourir et recherchez IronOCR. Sélectionnez IronOCR et cliquez sur Installer.

Une autre option est d'utiliser la console et la commande ci-dessous.
Étape 3 : Exemple d'image de facture d'entrée
Exemple d'image de facture numérique avec le numéro de la facture.

Étape 4 : Utiliser Tesseract et extraire les données de l'image du reçu
Utilisez maintenant le code ci-dessous pour extraire des données d'une facture pour le traitement OCR des factures.
using IronOcr;
// Set the license key
License.LicenseKey = "Your License";
string filePath = "sample1.jpg"; // Path to the invoice image
// Create an instance of IronTesseract
var ocr = new IronTesseract();
// Load the image for OCR
using (var ocrInput = new OcrInput())
{
ocrInput.LoadImage(filePath);
// Optionally apply filters if needed
ocrInput.Deskew();
// ocrInput.DeNoise();
// Perform OCR to extract text
var ocrResult = ocr.Read(ocrInput);
// Output the extracted text
Console.WriteLine("Extracted Text:");
Console.WriteLine(ocrResult.Text);
// Next steps would involve processing the extracted text
}Imports IronOcr
' Set the license key
License.LicenseKey = "Your License"
Dim filePath As String = "sample1.jpg" ' Path to the invoice image
' Create an instance of IronTesseract
Dim ocr As New IronTesseract()
' Load the image for OCR
Using ocrInput As New OcrInput()
ocrInput.LoadImage(filePath)
' Optionally apply filters if needed
ocrInput.Deskew()
' ocrInput.DeNoise()
' Perform OCR to extract text
Dim ocrResult = ocr.Read(ocrInput)
' Output the extracted text
Console.WriteLine("Extracted Text:")
Console.WriteLine(ocrResult.Text)
' Next steps would involve processing the extracted text
End UsingExplication du code
Le code fourni démontre comment utiliser la bibliothèque IronOCR en C# pour extraire du texte d'une image (par exemple, une facture) en utilisant l'OCR (Reconnaissance Optique de Caractères). Voici une explication de chaque partie du code :
-
Configuration de la clé de licence :
- Le code commence par installer la clé de licence pour IronOCR. Cette clé est requise pour utiliser la pleine fonctionnalité de la bibliothèque. Si vous avez une licence valide, remplacez "Your License" par votre clé de licence réelle.
-
Spécification du fichier d'entrée :
- La variable
filePathcontient l'emplacement de l'image qui contient la facture (dans ce cas, "sample1.jpg"). C'est le fichier qui sera traité pour l'extraction de texte.
- La variable
-
Création d'une instance OCR :
- Une instance de
IronTesseractest créée.IronTesseractest la classe responsable de l'exécution de l'opération OCR sur les données d'entrée.
- Une instance de
-
Chargement de l'image :
- Le code crée un objet
OcrInput, qui charge l'image spécifiée parfilePathen utilisant la méthodeLoadImage.
- Le code crée un objet
-
Application de filtres d'image :
- Le code applique en option des filtres comme
Deskew()pour corriger les images déformées et améliorer la précision de l'OCR.
- Le code applique en option des filtres comme
-
Réaliser une reconnaissance optique de caractères (OCR) :
- La méthode
ocr.Read()extrait le texte de l'image chargée, renvoyant unOcrResultcontenant le texte extrait.
- La méthode
-
Affichage du texte extrait :
- Le texte extrait est imprimé sur la console. Ce texte est ce que IronOCR a reconnu de l'image et peut être utilisé pour un traitement ultérieur.
Sortie

Étape 5 : Lire uniquement une région d'une image
Pour améliorer l'efficacité, seule une partie de l'image peut être traitée pour l'extraction.
using IronOcr;
using IronSoftware.Drawing;
// Set the license key
License.LicenseKey = "Your Key";
string filePath = "sample1.jpg"; // Path to the invoice image
// Create an instance of IronTesseract
var ocr = new IronTesseract();
// Load the image for OCR
using (var ocrInput = new OcrInput())
{
// Define the region of interest
var ContentArea = new Rectangle(x: 0, y: 0, width: 1000, height: 250);
ocrInput.LoadImage(filePath, ContentArea);
// Optionally apply filters if needed
ocrInput.Deskew();
// ocrInput.DeNoise();
// Perform OCR to extract text
var ocrResult = ocr.Read(ocrInput);
// Output the extracted text
Console.WriteLine("Extracted Text:");
Console.WriteLine(ocrResult.Text);
}Imports IronOcr
Imports IronSoftware.Drawing
' Set the license key
License.LicenseKey = "Your Key"
Dim filePath As String = "sample1.jpg" ' Path to the invoice image
' Create an instance of IronTesseract
Dim ocr As New IronTesseract()
' Load the image for OCR
Using ocrInput As New OcrInput()
' Define the region of interest
Dim ContentArea As New Rectangle(x:=0, y:=0, width:=1000, height:=250)
ocrInput.LoadImage(filePath, ContentArea)
' Optionally apply filters if needed
ocrInput.Deskew()
' ocrInput.DeNoise()
' Perform OCR to extract text
Dim ocrResult = ocr.Read(ocrInput)
' Output the extracted text
Console.WriteLine("Extracted Text:")
Console.WriteLine(ocrResult.Text)
End UsingExplication du code
Ce code extrait le texte d'une région spécifique d'une image en utilisant IronOCR, avec des options pour les filtres d'image qui améliorent la précision. Voici un aperçu de chaque partie :
-
Configuration de la licence :
- Configure la clé de licence pour IronOCR, qui est nécessaire pour utiliser les fonctionnalités OCR de la bibliothèque. Remplacez "Your Key" par votre clé de licence valide.
-
Définition du chemin d'accès au fichier image :
- Spécifie le chemin du fichier vers l'image de la facture à traiter, qui contient le contenu pour l'extraction de texte.
-
Création d'une instance OCR :
- Une instance de
IronTesseractest créée pour effectuer les opérations OCR.
- Une instance de
-
Définir la zone à traiter :
- Spécifie une zone rectangulaire au sein de l'image (commençant au coin supérieur gauche) pour focaliser le processus OCR sur une section pertinente, améliorant l'efficacité.
-
Chargement de l'image :
- Charge la zone de contenu spécifiée de l'image depuis le fichier. Cela confine le traitement OCR à une partie spécifique de l'image.
-
Application des filtres :
- Applique des filtres comme
Deskew()pour améliorer l'alignement de l'image et potentiellementDeNoise()pour nettoyer l'image, améliorant ainsi la précision de l'OCR.
- Applique des filtres comme
-
Extraction du texte :
- Lit le texte de la région définie et le stocke dans un
OcrResult.
- Lit le texte de la région définie et le stocke dans un
-
Afficher le texte extrait :
- Sortie le texte traité par OCR vers la console pour une utilisation ultérieure.
Sortie

Licence (Essai disponible)
IronOCR nécessite une clé pour extraire des données des factures. Obtenez votre clé de test développeur depuis la page de licence.
using IronOcr;
License.LicenseKey = "Your Key";Imports IronOcr
License.LicenseKey = "Your Key"Conclusion
Cet article a fourni un exemple de base de comment commencer avec IronOCR pour le traitement de factures. Vous pouvez personnaliser et étendre ce code pour répondre à vos exigences spécifiques.
IronOCR offre une solution efficace et facile à intégrer pour extraire du texte à partir d'images et de PDFs, ce qui le rend idéal pour le traitement des factures. En utilisant IronOCR en combinaison avec la manipulation de chaînes C# ou des expressions régulières, vous pouvez rapidement traiter et extraire des données importantes des factures.
Ceci est un exemple de base de traitement de factures, et avec des configurations plus avancées (comme la reconnaissance des langues, le traitement de PDF multi-pages, etc.), vous pouvez affiner les résultats OCR pour améliorer la précision pour votre cas d'utilisation spécifique.
L'API d'IronOCR est flexible, et elle peut être utilisée pour une large variété de tâches OCR au-delà du traitement de factures, y compris la numérisation de reçus, la conversion de documents et l'automatisation de la saisie de données.

Articles connexes

