Przejdź do treści stopki
KORZYSTANIE Z IRONOCR
HTML do PDF: krótki samouczek dla C# .NET

Wyodrębnianie danych tabel z zeskanowanych obrazów za pomocą IronOCR: Podsumowanie demonstracji na żywo

Wyodrębnianie danych z zeskanowanych obrazów to powszechne wyzwanie, szczególnie gdy dotyczy danych strukturalnych jak tabele. Dzięki zaawansowanym możliwościom uczenia maszynowego IronOCR, możesz teraz bezproblemowo wyodrębniać dane tabelaryczne, w tym wartości komórek i ich pozycje. W tej demonstracji Shadman Majid, inżynier sprzedaży oprogramowania, przechodzi krok po kroku przez implementację kodu, podczas gdy Anne Lazarakis, dyrektor ds. sprzedaży i marketingu, dzieli się rzeczywistymi przypadkami użycia od klientów Iron Software.

Rzeczywiste przypadki użycia

Ironocr Extract Table Data 4 related to Rzeczywiste przypadki użycia

Wyjaśnione przez Anne Lazarakis, dyrektor ds. sprzedaży i marketingu*

Przetwarzanie roszczeń ubezpieczeniowych (Opyn Market)

W mocno regulowanej branży ubezpieczeń zdrowotnych w USA firmy takie jak Opyn Market wciąż otrzymują wiele dokumentów faksem. Te zeskanowane dokumenty często zawierają dane tabelaryczne, które muszą być dokładnie wyodrębnione i wprowadzone do wewnętrznych systemów. Dzięki IronOCR są w stanie zautomatyzować ten proces, zmniejszając ręczną pracę i eliminując potencjalne błędy ludzkie.

Logistyka i dystrybucja żywności (iPAP)

iPAP, największy dystrybutor sera w USA, używa IronOCR do zarządzania ponad 200 zamówieniami klientów. Ich faktury są w różnych formatach z niespójnymi układami tabel. IronOCR pomaga im wydobywać numery zamówień, daty wysyłki i szczegóły artykułów z zeskanowanych dokumentów, nawet przy różnych formatach. Dzięki tej automatyzacji oszczędzają rocznie od 40 000 do 45 000 USD.

Ironocr Extract Table Data 2 related to Logistyka i dystrybucja żywności (iPAP)


Przegląd techniczny

Ironocr Extract Table Data 5 related to Przegląd techniczny

Sesja kodowania na żywo z Shadmanem Majidem, inżynierem sprzedaży oprogramowania*

IronOCR używa własnych modeli uczenia maszynowego do wykrywania i wyodrębniania danych tabelarycznych z zeskanowanych dokumentów. Ta funkcja wspiera:

  • Wyodrębnianie komórek tabeli i współrzędnych
  • OCR zeskanowanych obrazów i wieloramkowych plików PDF
  • Kompatybilność z C#, VB.NET, .NET Standard, .NET Framework i .NET Core

Ironocr Extract Table Data 3 related to Przegląd techniczny

Aby uzyskać dostęp do tej funkcjonalności, potrzeba:

Te pakiety zawierają wytrenowane modele ML niezbędne do wykrywania struktury tabel i dokładnego OCR.

Przykład kodu do wyodrębniania tabel

Poniżej znajduje się przykładowy fragment kodu C# pokazujący, jak używać IronOCR do wyodrębniania danych tabelarycznych z obrazów:

// Import the necessary IronOCR namespaces
using IronOcr;

// Initialize the IronTesseract to handle OCR processes
var Ocr = new IronTesseract();

// Load the image containing the table
using (var input = new OcrInput("invoice.jpg"))
{
    // Perform OCR and extract text data including tables
    var result = Ocr.Read(input);

    // Iterate through each page in the document
    foreach (var page in result.Pages)
    {
        // Iterate through each table found on the page
        foreach (var table in page.Tables)
        {
            Console.WriteLine("Table found:");
            // Iterate through each row in the table
            foreach (var row in table.Rows)
            {
                // Convert the row of cells to a comma-separated string
                var cells = string.Join(", ", row.Cells.Select(cell => cell.Text));
                Console.WriteLine(cells);
            }
        }
    }
}
// Import the necessary IronOCR namespaces
using IronOcr;

// Initialize the IronTesseract to handle OCR processes
var Ocr = new IronTesseract();

// Load the image containing the table
using (var input = new OcrInput("invoice.jpg"))
{
    // Perform OCR and extract text data including tables
    var result = Ocr.Read(input);

    // Iterate through each page in the document
    foreach (var page in result.Pages)
    {
        // Iterate through each table found on the page
        foreach (var table in page.Tables)
        {
            Console.WriteLine("Table found:");
            // Iterate through each row in the table
            foreach (var row in table.Rows)
            {
                // Convert the row of cells to a comma-separated string
                var cells = string.Join(", ", row.Cells.Select(cell => cell.Text));
                Console.WriteLine(cells);
            }
        }
    }
}
' Import the necessary IronOCR namespaces
Imports IronOcr

' Initialize the IronTesseract to handle OCR processes
Private Ocr = New IronTesseract()

' Load the image containing the table
Using input = New OcrInput("invoice.jpg")
	' Perform OCR and extract text data including tables
	Dim result = Ocr.Read(input)

	' Iterate through each page in the document
	For Each page In result.Pages
		' Iterate through each table found on the page
		For Each table In page.Tables
			Console.WriteLine("Table found:")
			' Iterate through each row in the table
			For Each row In table.Rows
				' Convert the row of cells to a comma-separated string
				Dim cells = String.Join(", ", row.Cells.Select(Function(cell) cell.Text))
				Console.WriteLine(cells)
			Next row
		Next table
	Next page
End Using
$vbLabelText   $csharpLabel
  • Ładowanie obrazu: Skrypt rozpoczyna się od zainicjowania silnika IronTesseract i załadowania pliku obrazu o nazwie invoice.jpg, który chcesz przetworzyć.
  • Wykonanie OCR: Przeprowadza OCR na wejściu w celu wyodrębnienia danych tekstowych, szczególnie koncentrując się na tabelach.
  • Wyodrębnianie tabel: Skrypt przechodzi przez każdą wykrytą tabelę i jej wiersze, wypisując zawartość komórek w ustrukturyzowany sposób.

Upewnij się, że zainstalowałeś niezbędne pakiety NuGet dla IronOCR przed uruchomieniem tego skryptu.


Wniosek

IronOCR ułatwia automatyzację wyodrębniania złożonych danych tabelarycznych z zeskanowanych dokumentów. Niezależnie od tego, czy jesteś w sektorze opieki zdrowotnej, logistyki, finansów czy produkcji, to rozwiązanie oferuje niezawodność, dokładność i oszczędności kosztów. Dzięki kilku liniom kodu możesz wyeliminować ręczne wprowadzanie danych i zmniejszyć błędy ludzkie.

Chcesz zobaczyć to w akcji? Zarezerwuj demonstrację na żywo z jednym z naszych inżynierów tutaj.

Często Zadawane Pytania

Jak mogę wyodrębnić dane z tabel ze skanowanych obrazów przy użyciu języka C#?

Możesz skorzystać z zaawansowanych możliwości uczenia maszynowego IronOCR, aby wyodrębnić dane z tabel ze skanowanych obrazów. Proces ten polega na użyciu silnika IronTesseract do przeprowadzenia OCR na obrazie i wyodrębnienia informacji, w tym wartości komórek i ich współrzędnych.

Jakie są praktyczne zastosowania wyodrębniania danych tabelarycznych ze skanowanych dokumentów?

Praktyczne zastosowania obejmują automatyzację przetwarzania roszczeń ubezpieczeniowych poprzez wyodrębnianie danych tabelarycznych z dokumentów przesyłanych faksem oraz zarządzanie zamówieniami klientów w logistyce, gdzie faktury mają różne formaty i niespójny układ tabel, co pokazują takie firmy jak Opyn Market i iPAP.

Jakie możliwości techniczne oferuje IronOCR w zakresie ekstrakcji danych z tabel?

IronOCR oferuje takie funkcje, jak wyodrębnianie komórek tabel i współrzędnych, OCR zeskanowanych obrazów i wielokadrowych plików PDF oraz kompatybilność z C#, VB.NET, .NET Standard, .NET Framework i .NET Core.

Jakie kroki obejmuje kod służący do wyodrębniania danych z tabel przy użyciu IronOCR?

Proces obejmuje zainicjowanie silnika IronTesseract, załadowanie obrazu, wykonanie OCR w celu wyodrębnienia danych tekstowych oraz iterację przez każdą wykrytą tabelę i jej wiersze w celu wygenerowania zawartości komórek.

Jakie pakiety są wymagane do wyodrębniania danych z tabel za pomocą IronOCR?

Aby korzystać z wyszkolonych modeli ML niezbędnych do wykrywania tabel i dokładnego OCR, potrzebny jest pakiet IronOCR NuGet wraz z pakietem IronOcr.Extensions.AdvancedScanning.

W jaki sposób IronOCR zwiększa wydajność w branży opieki zdrowotnej i logistyki?

IronOCR ogranicza nakład pracy ręcznej i ryzyko błędów ludzkich poprzez automatyzację procesu pozyskiwania złożonych danych tabelarycznych ze skanowanych dokumentów, zapewniając znaczną poprawę wydajności i oszczędności kosztów w branżach takich jak opieka zdrowotna i logistyka.

Czy mogę obejrzeć prezentację możliwości IronOCR na żywo?

Tak, możesz zarezerwować prezentację na żywo z jednym z inżynierów Iron Software, aby zobaczyć IronOCR w akcji i dowiedzieć się więcej o jego możliwościach w zakresie wyodrębniania danych z tabel.

Kannaopat Udonpant
Inżynier oprogramowania
Zanim stał się inżynierem oprogramowania, Kannapat ukończył doktorat z zasobów środowiskowych na Uniwersytecie Hokkaido w Japonii. W czasie studiowania, Kannapat również został członkiem Laboratorium Robotyki Pojazdów, które jest częścią Wydziału Inżynierii Bioprodukcji. W 2022 roku wykorzystał swoje umiejętności w ...
Czytaj więcej

Zespół wsparcia Iron

Jesteśmy online 24 godziny, 5 dni w tygodniu.
Czat
E-mail
Zadzwoń do mnie