Dieses Codebeispiel zeigt, wie der IronTesseract OCR-Engine verwendet wird, um Text und Tabellendaten aus einem PDF-Dokument zu extrahieren.
- Eine Instanz der
IronTesseractOCR-Engine wird erstellt. - Ein
OcrInputObjekt wird initialisiert und eine PDF-Datei (table.pdf) wird mithilfe derLoadPdfMethode geladen. - Die OCR-Engine verarbeitet das Dokument mithilfe der
ReadDocumentAdvancedMethode, die ein detaillierteresOcrResultObjekt zurückgibt. - Die erste im Dokument gefundene Tabelle wird über
result.Tables.First()abgerufen. Die Zellinformationen dieser Tabelle werden mitCellInfosextrahiert. - Die Liste der Zelldaten (
cellList) enthält jetzt die Zellen der Tabelle, einschließlich des Textinhalts und anderer Details (z.B. Zellposition, Größe). - Diese Methode ist nützlich, um strukturierte Daten wie Tabellen aus PDFs zu extrahieren, sodass der Text innerhalb jeder Tabellenzelle programmatisch zugänglich und verarbeitbar ist.