在文档中读取表格
该代码示例演示了如何使用 IronTesseract OCR 引擎从PDF文档中提取文本和表格数据。
- 创建
IronTesseractOCR 引擎的实例。 - 初始化一个
OcrInput对象,并使用LoadPdf方法加载一个PDF文件(table.pdf)。 - OCR 引擎使用
ReadDocumentAdvanced方法处理文档,返回更详细的OcrResult对象。 - 使用
result.Tables.First()访问文档中找到的第一个表格,并使用CellInfos提取该表格的单元信息。 - 现在
cellList中的单元数据列表包含了表格的单元,包括文本内容和其他详细信息(例如,单元位置、大小)。 - 此方法可用于从 PDF 中提取结构化数据(如表格),允许以编程方式访问和处理每个表格单元格中的文本。
准备开始了吗?
Nuget 下载 6,136,090 | 版本: 2026.7 刚刚发布

