Lire le tableau dans le document

Cet exemple de code démontre comment utiliser le moteur OCR IronTesseract pour extraire du texte et des données de table à partir d'un document PDF.

  1. Une instance du moteur OCR IronTesseract est créée.
  2. Un objet OcrInput est initialisé, et un fichier PDF (table.pdf) est chargé à l'aide de la méthode LoadPdf.
  3. Le moteur OCR traite le document à l'aide de la méthode ReadDocumentAdvanced, qui retourne un objet OcrResult plus détaillé.
  4. La première table trouvée dans le document est accessible en utilisant result.Tables.First(), et les informations de cellule pour cette table sont extraites avec CellInfos.
  5. La liste des données de cellule (cellList) contient désormais les cellules de la table, incluant le contenu textuel et d'autres détails (ex. position de la cellule, taille).
  6. Cette méthode est utile pour extraire des données structurées comme des tableaux à partir de fichiers PDF, permettant d'accéder et de traiter par programmation le texte contenu dans chaque cellule du tableau.

Découvrez comment lire les tableaux dans les fichiers PDF avec IronOCR.

Prêt à commencer?
Nuget Téléchargements 6,151,372 | Version : 2026.7 vient de sortir
Still Scrolling Icon

Vous faites encore défiler ?

Vous voulez une preuve rapidement ? PM > Install-Package IronOcr
lancez un échantillon regardez votre image se transformer en texte consultable.