IronOCR中的意外空白
This article was translated from English: Does it need improvement?
Translated
View the article in English
提取的文本有时在字符之间有额外的空白,即使源文档看上去很干净。 通常的罪魁祸首是字符宽度和间距的变化,通常与输入字体有关,而图像过滤器仅靠自身很难清理。

以下方法已被证明能有效避免额外的空白。
解决方案
1. 切换至OCR友好字体
在您能做到的地方呈现或提供文档为Roboto。 这是一种干净、现代的字体,能可靠阅读,因此引擎产生的错误空格少于使用Arial等字体。
2. 使用ReadDocumentAdvanced()
用ReadDocumentAdvanced()读取文档,而不是标准的读取方法。 它为您提供了更多对OCR过程的控制,并处理复杂文本布局更好。
3. 设置OcrLanguage.EnglishBest
将引擎指向OcrLanguage.EnglishBest模型。 此高级语言模型比标准英语选项更准确并减少了误读间距。
4. 训练自定义字体
当输入PDF使用了不寻常或非标准的字体时,默认设置会挣扎和插入空格。 训练自定义字体可以教导引擎识别特定字体,这大大提高了识别的精确度。 参见OCR自定义字体培训指南,了解完整工作流程。
应用这些设置后,提取的文本回来时没有多余的间距:

提示先尝试OCR友好字体和EnglishBest模型;它们能修复大多数间距问题而无需自定义字体的训练努力。
准备开始了吗?
Nuget 下载 6,136,090 | 版本: 2026.7 刚刚发布

