Wyodrębnianie danych tabel z zeskanowanych obrazów za pomocą IronOCR: Podsumowanie demonstracji na żywo
Wyodrębnianie danych z zeskanowanych obrazów to powszechne wyzwanie, szczególnie gdy dotyczy danych strukturalnych jak tabele. Dzięki zaawansowanym możliwościom uczenia maszynowego IronOCR, możesz teraz bezproblemowo wyodrębniać dane tabelaryczne, w tym wartości komórek i ich pozycje. W tej demonstracji Shadman Majid, inżynier sprzedaży oprogramowania, przechodzi krok po kroku przez implementację kodu, podczas gdy Anne Lazarakis, dyrektor ds. sprzedaży i marketingu, dzieli się rzeczywistymi przypadkami użycia od klientów Iron Software.
Rzeczywiste przypadki użycia

Wyjaśnione przez Anne Lazarakis, dyrektor ds. sprzedaży i marketingu*
Przetwarzanie roszczeń ubezpieczeniowych (Opyn Market)
W mocno regulowanej branży ubezpieczeń zdrowotnych w USA firmy takie jak Opyn Market wciąż otrzymują wiele dokumentów faksem. Te zeskanowane dokumenty często zawierają dane tabelaryczne, które muszą być dokładnie wyodrębnione i wprowadzone do wewnętrznych systemów. Dzięki IronOCR są w stanie zautomatyzować ten proces, zmniejszając ręczną pracę i eliminując potencjalne błędy ludzkie.
Logistyka i dystrybucja żywności (iPAP)
iPAP, największy dystrybutor sera w USA, używa IronOCR do zarządzania ponad 200 zamówieniami klientów. Ich faktury są w różnych formatach z niespójnymi układami tabel. IronOCR pomaga im wydobywać numery zamówień, daty wysyłki i szczegóły artykułów z zeskanowanych dokumentów, nawet przy różnych formatach. Dzięki tej automatyzacji oszczędzają rocznie od 40 000 do 45 000 USD.

Przegląd techniczny

Sesja kodowania na żywo z Shadmanem Majidem, inżynierem sprzedaży oprogramowania*
IronOCR używa własnych modeli uczenia maszynowego do wykrywania i wyodrębniania danych tabelarycznych z zeskanowanych dokumentów. Ta funkcja wspiera:
- Wyodrębnianie komórek tabeli i współrzędnych
- OCR zeskanowanych obrazów i wieloramkowych plików PDF
- Kompatybilność z C#, VB.NET, .NET Standard, .NET Framework i .NET Core

Aby uzyskać dostęp do tej funkcjonalności, potrzeba:
IronOCRNuGet packageIronOcr.Extensions.AdvancedScanningpakiet NuGet do wykrywania tabel za pomocą modeli ML
Te pakiety zawierają wytrenowane modele ML niezbędne do wykrywania struktury tabel i dokładnego OCR.
Przykład kodu do wyodrębniania tabel
Poniżej znajduje się przykładowy fragment kodu C# pokazujący, jak używać IronOCR do wyodrębniania danych tabelarycznych z obrazów:
// Import the necessary IronOCR namespaces
using IronOcr;
// Initialize the IronTesseract to handle OCR processes
var Ocr = new IronTesseract();
// Load the image containing the table
using (var input = new OcrInput("invoice.jpg"))
{
// Perform OCR and extract text data including tables
var result = Ocr.Read(input);
// Iterate through each page in the document
foreach (var page in result.Pages)
{
// Iterate through each table found on the page
foreach (var table in page.Tables)
{
Console.WriteLine("Table found:");
// Iterate through each row in the table
foreach (var row in table.Rows)
{
// Convert the row of cells to a comma-separated string
var cells = string.Join(", ", row.Cells.Select(cell => cell.Text));
Console.WriteLine(cells);
}
}
}
}
// Import the necessary IronOCR namespaces
using IronOcr;
// Initialize the IronTesseract to handle OCR processes
var Ocr = new IronTesseract();
// Load the image containing the table
using (var input = new OcrInput("invoice.jpg"))
{
// Perform OCR and extract text data including tables
var result = Ocr.Read(input);
// Iterate through each page in the document
foreach (var page in result.Pages)
{
// Iterate through each table found on the page
foreach (var table in page.Tables)
{
Console.WriteLine("Table found:");
// Iterate through each row in the table
foreach (var row in table.Rows)
{
// Convert the row of cells to a comma-separated string
var cells = string.Join(", ", row.Cells.Select(cell => cell.Text));
Console.WriteLine(cells);
}
}
}
}
' Import the necessary IronOCR namespaces
Imports IronOcr
' Initialize the IronTesseract to handle OCR processes
Private Ocr = New IronTesseract()
' Load the image containing the table
Using input = New OcrInput("invoice.jpg")
' Perform OCR and extract text data including tables
Dim result = Ocr.Read(input)
' Iterate through each page in the document
For Each page In result.Pages
' Iterate through each table found on the page
For Each table In page.Tables
Console.WriteLine("Table found:")
' Iterate through each row in the table
For Each row In table.Rows
' Convert the row of cells to a comma-separated string
Dim cells = String.Join(", ", row.Cells.Select(Function(cell) cell.Text))
Console.WriteLine(cells)
Next row
Next table
Next page
End Using
- Ładowanie obrazu: Skrypt rozpoczyna się od zainicjowania silnika IronTesseract i załadowania pliku obrazu o nazwie
invoice.jpg, który chcesz przetworzyć. - Wykonanie OCR: Przeprowadza OCR na wejściu w celu wyodrębnienia danych tekstowych, szczególnie koncentrując się na tabelach.
- Wyodrębnianie tabel: Skrypt przechodzi przez każdą wykrytą tabelę i jej wiersze, wypisując zawartość komórek w ustrukturyzowany sposób.
Upewnij się, że zainstalowałeś niezbędne pakiety NuGet dla IronOCR przed uruchomieniem tego skryptu.
Wniosek
IronOCR ułatwia automatyzację wyodrębniania złożonych danych tabelarycznych z zeskanowanych dokumentów. Niezależnie od tego, czy jesteś w sektorze opieki zdrowotnej, logistyki, finansów czy produkcji, to rozwiązanie oferuje niezawodność, dokładność i oszczędności kosztów. Dzięki kilku liniom kodu możesz wyeliminować ręczne wprowadzanie danych i zmniejszyć błędy ludzkie.
Chcesz zobaczyć to w akcji? Zarezerwuj demonstrację na żywo z jednym z naszych inżynierów tutaj.
Często Zadawane Pytania
Jak mogę wyodrębnić dane z tabel ze skanowanych obrazów przy użyciu języka C#?
Możesz skorzystać z zaawansowanych możliwości uczenia maszynowego IronOCR, aby wyodrębnić dane z tabel ze skanowanych obrazów. Proces ten polega na użyciu silnika IronTesseract do przeprowadzenia OCR na obrazie i wyodrębnienia informacji, w tym wartości komórek i ich współrzędnych.
Jakie są praktyczne zastosowania wyodrębniania danych tabelarycznych ze skanowanych dokumentów?
Praktyczne zastosowania obejmują automatyzację przetwarzania roszczeń ubezpieczeniowych poprzez wyodrębnianie danych tabelarycznych z dokumentów przesyłanych faksem oraz zarządzanie zamówieniami klientów w logistyce, gdzie faktury mają różne formaty i niespójny układ tabel, co pokazują takie firmy jak Opyn Market i iPAP.
Jakie możliwości techniczne oferuje IronOCR w zakresie ekstrakcji danych z tabel?
IronOCR oferuje takie funkcje, jak wyodrębnianie komórek tabel i współrzędnych, OCR zeskanowanych obrazów i wielokadrowych plików PDF oraz kompatybilność z C#, VB.NET, .NET Standard, .NET Framework i .NET Core.
Jakie kroki obejmuje kod służący do wyodrębniania danych z tabel przy użyciu IronOCR?
Proces obejmuje zainicjowanie silnika IronTesseract, załadowanie obrazu, wykonanie OCR w celu wyodrębnienia danych tekstowych oraz iterację przez każdą wykrytą tabelę i jej wiersze w celu wygenerowania zawartości komórek.
Jakie pakiety są wymagane do wyodrębniania danych z tabel za pomocą IronOCR?
Aby korzystać z wyszkolonych modeli ML niezbędnych do wykrywania tabel i dokładnego OCR, potrzebny jest pakiet IronOCR NuGet wraz z pakietem IronOcr.Extensions.AdvancedScanning.
W jaki sposób IronOCR zwiększa wydajność w branży opieki zdrowotnej i logistyki?
IronOCR ogranicza nakład pracy ręcznej i ryzyko błędów ludzkich poprzez automatyzację procesu pozyskiwania złożonych danych tabelarycznych ze skanowanych dokumentów, zapewniając znaczną poprawę wydajności i oszczędności kosztów w branżach takich jak opieka zdrowotna i logistyka.
Czy mogę obejrzeć prezentację możliwości IronOCR na żywo?
Tak, możesz zarezerwować prezentację na żywo z jednym z inżynierów Iron Software, aby zobaczyć IronOCR w akcji i dowiedzieć się więcej o jego możliwościach w zakresie wyodrębniania danych z tabel.



