Lire le tableau dans le document
Cet exemple de code démontre comment utiliser le moteur OCR IronTesseract pour extraire du texte et des données de table à partir d'un document PDF.
- Une instance du moteur OCR
IronTesseractest créée. - Un objet
OcrInputest initialisé, et un fichier PDF (table.pdf) est chargé à l'aide de la méthodeLoadPdf. - Le moteur OCR traite le document à l'aide de la méthode
ReadDocumentAdvanced, qui retourne un objetOcrResultplus détaillé. - La première table trouvée dans le document est accessible en utilisant
result.Tables.First(), et les informations de cellule pour cette table sont extraites avecCellInfos. - La liste des données de cellule (
cellList) contient désormais les cellules de la table, incluant le contenu textuel et d'autres détails (ex. position de la cellule, taille). - Cette méthode est utile pour extraire des données structurées comme des tableaux à partir de fichiers PDF, permettant d'accéder et de traiter par programmation le texte contenu dans chaque cellule du tableau.
Découvrez comment lire les tableaux dans les fichiers PDF avec IronOCR.

