IronOCR에서 예상치 못한 공백
추출된 텍스트는 때때로 원본 문서가 깔끔해 보임에도 불구하고 문자 사이에 여분의 공백이 포함되기도 합니다. 문자 너비와 간격의 차이로 인해 일반적으로 입력 글꼴과 관련이 있으며, 이미지 필터만으로는 이를 거의 해결할 수 없습니다.

다음 방법들이 추가적인 공백을 방지하는 데 효과적임이 입증되었습니다.
해결책
1. OCR 친화적인 글꼴로 전환
가능한 곳에서는 문서를 Roboto로 렌더링하거나 제공하십시오. 깔끔하고 현대적인 서체로 신뢰성 있게 읽히며, Arial과 같은 글꼴보다 엔진이 잘못된 공백을 적게 생성합니다.
2. ReadDocumentAdvanced() 사용
표준 읽기 메서드 대신 ReadDocumentAdvanced()로 문서를 읽습니다. OCR 프로세스를 더 잘 제어할 수 있으며 복잡한 텍스트 레이아웃을 더 잘 처리합니다.
3. OcrLanguage.EnglishBest 설정
엔진을 OcrLanguage.EnglishBest 모델로 지정하십시오. 이 고급 언어 모델은 표준 영어 옵션보다 더 정확하며 잘못 읽힌 간격을 줄입니다.
4. 사용자 지정 글꼴 훈련
입력 PDF가 일반적이지 않거나 비표준 글꼴을 사용할 때, 기본 설정은 잘 못하고 공백을 삽입할 수 있습니다. 사용자 지정 글꼴을 훈련시키면 엔진이 특정 서체를 인식하도록 가르쳐 인식이 상당히 향상됩니다. OCR 사용자 지정 글꼴 훈련 가이드에서 전체 워크플로를 확인하십시오.
이러한 설정이 적용되면 추출된 텍스트는 불필요한 공백 없이 되돌아옵니다:


