IronOCR에서 예상치 못한 공백

This article was translated from English: Does it need improvement?
Translated
View the article in English

추출된 텍스트는 때때로 원본 문서가 깔끔해 보임에도 불구하고 문자 사이에 여분의 공백이 포함되기도 합니다. 문자 너비와 간격의 차이로 인해 일반적으로 입력 글꼴과 관련이 있으며, 이미지 필터만으로는 이를 거의 해결할 수 없습니다.

7과 1 사이의 참조 번호 안에 예상치 못한 공백이 있는 Visual Studio Text Visualizer의 OCR 결과

다음 방법들이 추가적인 공백을 방지하는 데 효과적임이 입증되었습니다.

해결책

1. OCR 친화적인 글꼴로 전환

가능한 곳에서는 문서를 Roboto로 렌더링하거나 제공하십시오. 깔끔하고 현대적인 서체로 신뢰성 있게 읽히며, Arial과 같은 글꼴보다 엔진이 잘못된 공백을 적게 생성합니다.

2. ReadDocumentAdvanced() 사용

표준 읽기 메서드 대신 ReadDocumentAdvanced()로 문서를 읽습니다. OCR 프로세스를 더 잘 제어할 수 있으며 복잡한 텍스트 레이아웃을 더 잘 처리합니다.

3. OcrLanguage.EnglishBest 설정

엔진을 OcrLanguage.EnglishBest 모델로 지정하십시오. 이 고급 언어 모델은 표준 영어 옵션보다 더 정확하며 잘못 읽힌 간격을 줄입니다.

4. 사용자 지정 글꼴 훈련

입력 PDF가 일반적이지 않거나 비표준 글꼴을 사용할 때, 기본 설정은 잘 못하고 공백을 삽입할 수 있습니다. 사용자 지정 글꼴을 훈련시키면 엔진이 특정 서체를 인식하도록 가르쳐 인식이 상당히 향상됩니다. OCR 사용자 지정 글꼴 훈련 가이드에서 전체 워크플로를 확인하십시오.

이러한 설정이 적용되면 추출된 텍스트는 불필요한 공백 없이 되돌아옵니다:

해결책을 적용한 후의 OCR 결과. 간격이 수정되었습니다.

OCR 친화적인 글꼴과 영어Best 모델을 먼저 시도하십시오. 사용자 지정 글꼴 교육 없이도 대부분의 간격 문제를 해결합니다.

Curtis Chau
기술 문서 작성자

커티스 차우는 칼턴 대학교에서 컴퓨터 과학 학사 학위를 취득했으며, Node.js, TypeScript, JavaScript, React를 전문으로 하는 프론트엔드 개발자입니다. 직관적이고 미적으로 뛰어난 사용자 인터페이스를 만드는 데 열정을 가진 그는 최신 프레임워크를 활용하고, 잘 구성되고 시각적으로 매력적인 매뉴얼을 제작하는 것을 즐깁니다.

커티스는 개발 분야 외에도 사물 인터넷(IoT)에 깊은 관심을 가지고 있으며, 하드웨어와 소프트웨어를 통합하는 혁신적인 방법을 연구합니다. 여가 시간에는 게임을 즐기거나 디스코드 봇을 만들면서 기술에 대한 애정과 창의성을 결합합니다.

시작할 준비 되셨나요?
Nuget 다운로드 6,136,090 | 버전: 2026.7 방금 출시
Still Scrolling Icon

아직도 스크롤하고 계신가요?

빠른 증거를 원하시나요? PM > Install-Package IronOcr
샘플을 실행하세요 이미지가 검색 가능한 텍스트로 바뀌는 것을 확인해 보세요.