IronOCR中的意外空白

This article was translated from English: Does it need improvement?
Translated
View the article in English

提取的文本有时在字符之间有额外的空白,即使源文档看上去很干净。 通常的罪魁祸首是字符宽度和间距的变化,通常与输入字体有关,而图像过滤器仅靠自身很难清理。

Visual Studio 文本可视化工具中的 OCR 结果,参考编号内在 7 和 1 之间出现了意外的空格

以下方法已被证明能有效避免额外的空白。

解决方案

1. 切换至OCR友好字体

在您能做到的地方呈现或提供文档为Roboto。 这是一种干净、现代的字体,能可靠阅读,因此引擎产生的错误空格少于使用Arial等字体。

2. 使用ReadDocumentAdvanced()

ReadDocumentAdvanced()读取文档,而不是标准的读取方法。 它为您提供了更多对OCR过程的控制,并处理复杂文本布局更好。

3. 设置OcrLanguage.EnglishBest

将引擎指向OcrLanguage.EnglishBest模型。 此高级语言模型比标准英语选项更准确并减少了误读间距。

4. 训练自定义字体

当输入PDF使用了不寻常或非标准的字体时,默认设置会挣扎和插入空格。 训练自定义字体可以教导引擎识别特定字体,这大大提高了识别的精确度。 参见OCR自定义字体培训指南,了解完整工作流程。

应用这些设置后,提取的文本回来时没有多余的间距:

应用修复后的OCR结果,空白得到修正

提示先尝试OCR友好字体和EnglishBest模型;它们能修复大多数间距问题而无需自定义字体的训练努力。

Curtis Chau
技术作家

Curtis Chau 拥有卡尔顿大学的计算机科学学士学位,专注于前端开发,精通 Node.js、TypeScript、JavaScript 和 React。他热衷于打造直观且美观的用户界面,喜欢使用现代框架并创建结构良好、视觉吸引力强的手册。

除了开发之外,Curtis 对物联网 (IoT) 有浓厚的兴趣,探索将硬件和软件集成的新方法。在空闲时间,他喜欢玩游戏和构建 Discord 机器人,将他对技术的热爱与创造力相结合。

准备开始了吗?
Nuget 下载 6,136,090 | 版本: 2026.7 刚刚发布
Still Scrolling Icon

还在滚动吗?

想快速获得证据? PM > Install-Package IronOcr
运行示例 观看您的图像变成可搜索文本。