Przeczytaj tabelę w dokumencie
Ten przyklad kodu demonstruje, jak korzystac z silnika OCR IronTesseract do wyodrebniania tekstu i danych tabelarycznych z dokumentu PDF.
- Tworzona jest instancja silnika OCR
IronTesseract. - Inicjalizowany jest obiekt
OcrInput, a plik PDF (table.pdf) jest ladowany przy uzyciu metodyLoadPdf. - Silnik OCR przetwarza dokument za pomoca metody
ReadDocumentAdvanced, ktora zwraca bardziej szczegolowy obiektOcrResult. - Pierwsza tabela znaleziona w dokumencie jest dostepna poprzez
result.Tables.First(), a informacje o komorkach tej tabeli sa wyciagane za pomocaCellInfos. - Lista danych komorkowych (
cellList) zawiera teraz komorki tabeli, wlaczajac tekst i inne szczegoly (np. położenie komorki, rozmiar). - Ta metoda jest przydatna do wyodrębniania danych strukturalnych, takich jak tabele z plików PDF, co pozwala na programowe uzyskanie dostępu do tekstu w każdej komórce tabeli i jego przetwarzanie.

