Przeczytaj tabelę w dokumencie

Ten przyklad kodu demonstruje, jak korzystac z silnika OCR IronTesseract do wyodrebniania tekstu i danych tabelarycznych z dokumentu PDF.

  1. Tworzona jest instancja silnika OCR IronTesseract.
  2. Inicjalizowany jest obiekt OcrInput, a plik PDF (table.pdf) jest ladowany przy uzyciu metody LoadPdf.
  3. Silnik OCR przetwarza dokument za pomoca metody ReadDocumentAdvanced, ktora zwraca bardziej szczegolowy obiekt OcrResult.
  4. Pierwsza tabela znaleziona w dokumencie jest dostepna poprzez result.Tables.First(), a informacje o komorkach tej tabeli sa wyciagane za pomoca CellInfos.
  5. Lista danych komorkowych (cellList) zawiera teraz komorki tabeli, wlaczajac tekst i inne szczegoly (np. położenie komorki, rozmiar).
  6. Ta metoda jest przydatna do wyodrębniania danych strukturalnych, takich jak tabele z plików PDF, co pozwala na programowe uzyskanie dostępu do tekstu w każdej komórce tabeli i jego przetwarzanie.

Poznaj, jak czytać tabele w plikach PDF za pomocą IronOCR.

Gotowy, aby rozpocząć?
Nuget Pliki do pobrania 6,136,090 | Wersja: 2026.7 właśnie wydany
Still Scrolling Icon

Wciąż przewijasz?

Czy chcesz szybko dowodu? PM > Install-Package IronOcr
uruchom próbkę obserwuj, jak twój obraz staje się tekstem z możliwością wyszukiwania.