
Wyodrębnianie danych tabel z zeskanowanych obrazów za pomocą IronOCR: Podsumowanie demonstracji na żywo
Wyodrębnianie danych z zeskanowanych obrazów to powszechne wyzwanie, szczególnie gdy dotyczy danych strukturalnych jak tabele. Dzięki zaawansowanym możliwościom uczenia maszynowego IronOCR, możesz teraz bezproblemowo wyodrębniać dane tabelaryczne, w tym wartości komórek i ich pozycje. W tej demonstracji Shadman Majid, inżynier sprzedaży oprogramowania, przechodzi krok po kroku przez implementację kodu, podczas gdy Anne Lazarakis, dyrektor ds. sprzedaży i marketingu, dzieli się rzeczywistymi przypadkami użycia od klientów Iron Software.
Rzeczywiste przypadki użycia

Wyjaśnione przez Anne Lazarakis, dyrektor ds. sprzedaży i marketingu*
Przetwarzanie roszczeń ubezpieczeniowych (Opyn Market)
W mocno regulowanej branży ubezpieczeń zdrowotnych w USA firmy takie jak Opyn Market wciąż otrzymują wiele dokumentów faksem. Te zeskanowane dokumenty często zawierają dane tabelaryczne, które muszą być dokładnie wyodrębnione i wprowadzone do wewnętrznych systemów. Dzięki IronOCR są w stanie zautomatyzować ten proces, zmniejszając ręczną pracę i eliminując potencjalne błędy ludzkie.
Logistyka i dystrybucja żywności (iPAP)
iPAP, największy dystrybutor sera w USA, używa IronOCR do zarządzania ponad 200 zamówieniami klientów. Ich faktury są w różnych formatach z niespójnymi układami tabel. IronOCR pomaga im wydobywać numery zamówień, daty wysyłki i szczegóły artykułów z zeskanowanych dokumentów, nawet przy różnych formatach. Dzięki tej automatyzacji oszczędzają rocznie od 40 000 do 45 000 USD.

Przegląd techniczny

Sesja kodowania na żywo z Shadmanem Majidem, inżynierem sprzedaży oprogramowania*
IronOCR używa własnych modeli uczenia maszynowego do wykrywania i wyodrębniania danych tabelarycznych z zeskanowanych dokumentów. Ta funkcja wspiera:
- Wyodrębnianie komórek tabeli i współrzędnych
- OCR zeskanowanych obrazów i wieloramkowych plików PDF
- Kompatybilność z C#, VB.NET, .NET Standard, .NET Framework i .NET Core

Aby uzyskać dostęp do tej funkcjonalności, potrzeba:
IronOCRNuGet packageIronOcr.Extensions.AdvancedScanningpakiet NuGet do wykrywania tabel za pomocą modeli ML
Te pakiety zawierają wytrenowane modele ML niezbędne do wykrywania struktury tabel i dokładnego OCR.
Przykład kodu do wyodrębniania tabel
Poniżej znajduje się przykładowy fragment kodu C# pokazujący, jak używać IronOCR do wyodrębniania danych tabelarycznych z obrazów:
// Import the necessary IronOCR namespaces
using IronOcr;
// Initialize the IronTesseract to handle OCR processes
var Ocr = new IronTesseract();
// Load the image containing the table
using (var input = new OcrInput("invoice.jpg"))
{
// Perform OCR and extract text data including tables
var result = Ocr.Read(input);
// Iterate through each page in the document
foreach (var page in result.Pages)
{
// Iterate through each table found on the page
foreach (var table in page.Tables)
{
Console.WriteLine("Table found:");
// Iterate through each row in the table
foreach (var row in table.Rows)
{
// Convert the row of cells to a comma-separated string
var cells = string.Join(", ", row.Cells.Select(cell => cell.Text));
Console.WriteLine(cells);
}
}
}
}' Import the necessary IronOCR namespaces
Imports IronOcr
' Initialize the IronTesseract to handle OCR processes
Private Ocr = New IronTesseract()
' Load the image containing the table
Using input = New OcrInput("invoice.jpg")
' Perform OCR and extract text data including tables
Dim result = Ocr.Read(input)
' Iterate through each page in the document
For Each page In result.Pages
' Iterate through each table found on the page
For Each table In page.Tables
Console.WriteLine("Table found:")
' Iterate through each row in the table
For Each row In table.Rows
' Convert the row of cells to a comma-separated string
Dim cells = String.Join(", ", row.Cells.Select(Function(cell) cell.Text))
Console.WriteLine(cells)
Next row
Next table
Next page
End Using- Ładowanie obrazu: Skrypt rozpoczyna się od zainicjowania silnika IronTesseract i załadowania pliku obrazu o nazwie
invoice.jpg, który chcesz przetworzyć. - Wykonanie OCR: Przeprowadza OCR na wejściu w celu wyodrębnienia danych tekstowych, szczególnie koncentrując się na tabelach.
- Wyodrębnianie tabel: Skrypt przechodzi przez każdą wykrytą tabelę i jej wiersze, wypisując zawartość komórek w ustrukturyzowany sposób.
Upewnij się, że zainstalowałeś niezbędne pakiety NuGet dla IronOCR przed uruchomieniem tego skryptu.
Wniosek
IronOCR ułatwia automatyzację wyodrębniania złożonych danych tabelarycznych z zeskanowanych dokumentów. Niezależnie od tego, czy jesteś w sektorze opieki zdrowotnej, logistyki, finansów czy produkcji, to rozwiązanie oferuje niezawodność, dokładność i oszczędności kosztów. Dzięki kilku liniom kodu możesz wyeliminować ręczne wprowadzanie danych i zmniejszyć błędy ludzkie.
Chcesz zobaczyć to w akcji? Zarezerwuj demonstrację na żywo z jednym z naszych inżynierów tutaj.

Powiązane artykuły

