
using IronOCR 从扫描图像中提取表格数据:现场演示回顾
从扫描图像中提取数据是一项常见的挑战,尤其是涉及到诸如表格等结构化数据时。 通过IronOCR的先进机器学习功能,现在您可以无缝地提取包括单元格值及其位置在内的表格数据。 在此演示中,Shadman Majid,软件销售工程师,逐步讲解代码实施过程,而Anne Lazarakis,销售与市场总监,则分享了Iron Software客户的实际用例。
真实世界的使用案例

解释者:Anne Lazarakis,销售与市场总监*
保险索赔处理(Opyn Market)
在美国高度监管的医疗保险行业中,像Opyn Market这样的公司仍然通过传真接收许多文件。 这些扫描的文件通常包含必须准确提取并输入内部系统的表格数据。 通过IronOCR,他们能够自动化这一过程,减少手动工作并消除人为错误的可能性。
物流与食品配送(iPAP)
iPAP,美国最大的奶酪分销商,使用IronOCR管理200多个客户订单。 他们的发票有多种格式,表格布局不一致。 IronOCR帮助他们从扫描文件中高效提取采购订单号、发货日期和项目详情,即使格式多样。 此自动化每年为他们节省了4万到4.5万美元。

技术概述

与Shadman Majid一起的实时编码课程,软件销售工程师*
IronOCR使用专有的机器学习模型从扫描文件中检测和提取表格数据。 此功能支持:
- 提取表格单元格及坐标
- 对扫描图像和多帧PDF进行OCR
- 与C#、VB.NET、.NET Standard、.NET Framework和.NET Core的兼容性

要访问此功能,您需要:
IronOCRNuGet packageIronOcr.Extensions.AdvancedScanning通过ML模型检测表格的NuGet包
这些包包括用于表结构检测和准确OCR的训练有素的ML模型。
提取表格的示例代码
下面是一个C#代码片段示例,演示如何使用IronOCR从图像中提取表格数据:
// Import the necessary IronOCR namespaces
using IronOcr;
// Initialize the IronTesseract to handle OCR processes
var Ocr = new IronTesseract();
// Load the image containing the table
using (var input = new OcrInput("invoice.jpg"))
{
// Perform OCR and extract text data including tables
var result = Ocr.Read(input);
// Iterate through each page in the document
foreach (var page in result.Pages)
{
// Iterate through each table found on the page
foreach (var table in page.Tables)
{
Console.WriteLine("Table found:");
// Iterate through each row in the table
foreach (var row in table.Rows)
{
// Convert the row of cells to a comma-separated string
var cells = string.Join(", ", row.Cells.Select(cell => cell.Text));
Console.WriteLine(cells);
}
}
}
}' Import the necessary IronOCR namespaces
Imports IronOcr
' Initialize the IronTesseract to handle OCR processes
Private Ocr = New IronTesseract()
' Load the image containing the table
Using input = New OcrInput("invoice.jpg")
' Perform OCR and extract text data including tables
Dim result = Ocr.Read(input)
' Iterate through each page in the document
For Each page In result.Pages
' Iterate through each table found on the page
For Each table In page.Tables
Console.WriteLine("Table found:")
' Iterate through each row in the table
For Each row In table.Rows
' Convert the row of cells to a comma-separated string
Dim cells = String.Join(", ", row.Cells.Select(Function(cell) cell.Text))
Console.WriteLine(cells)
Next row
Next table
Next page
End Using- 加载图像: 脚本首先通过初始化IronTesseract引擎并加载您希望处理的名为
invoice.jpg的图像文件来开始。 - OCR执行: 它对输入执行OCR以提取文本数据,特别关注任何表格。
- 表格提取: 脚本遍历每个检测到的表格及其行,以结构化的方式输出单元格内容。
在运行此脚本之前,确保您已为IronOCR安装了必要的NuGet包。
结论
IronOCR使从扫描文件中自动提取复杂表格数据变得容易。 无论您是在医疗、物流、金融还是制造业,这一解决方案都提供了可靠性、准确性和节省成本的效率。 只需几行代码,您就可以消除手动数据输入并减少人为错误。
想看看它的实际效果吗? 立即预约我们的工程师进行现场演示此处。
相关文章


