IronOCR中的意外空白
提取的文本有时在字符之间有额外的空白,即使源文档看上去很干净。 通常的罪魁祸首是字符宽度和间距的变化,通常与输入字体有关,而图像过滤器仅靠自身很难清理。

以下方法已被证明能有效避免额外的空白。
解决方案
1. 切换至OCR友好字体
在您能做到的地方呈现或提供文档为Roboto。 这是一种干净、现代的字体,能可靠阅读,因此引擎产生的错误空格少于使用Arial等字体。
2. 使用ReadDocumentAdvanced()
用ReadDocumentAdvanced()读取文档,而不是标准的读取方法。 它为您提供了更多对OCR过程的控制,并处理复杂文本布局更好。
3. 设置OcrLanguage.EnglishBest
将引擎指向OcrLanguage.EnglishBest模型。 此高级语言模型比标准英语选项更准确并减少了误读间距。
4. 训练自定义字体
当输入PDF使用了不寻常或非标准的字体时,默认设置会挣扎和插入空格。 训练自定义字体可以教导引擎识别特定字体,这大大提高了识别的精确度。 参见OCR自定义字体培训指南,了解完整工作流程。
应用这些设置后,提取的文本回来时没有多余的间距:


