비라틴 스크립트를 위한 검색 가능한 PDF의 깨진 텍스트
IronOCR로 문서를 OCR하고 검색 가능한 PDF로 저장하면 화면에서는 인식된 텍스트가 올바르게 보이지만 복사하거나 추출할 때는 엉망진창이 될 수 있습니다. 이는 PDF의 글꼴에 인식된 스크립트에 대한 글리프가 없을 때 발생하며, 비라틴 및 복잡한 스크립트에서는 일반적입니다. 해결책은 스크립트를 지원하는 글꼴로 PDF를 저장하는 것입니다; 아래 예제는 구자라티를 사용합니다.
인식된 텍스트가 매핑할 일치하는 문자가 없기 때문에, OCR이 페이지를 올바르게 읽었음에도 불구하고 복사된 텍스트가 깨지게 나옵니다. 라틴 전용 글꼴은 이것을 해결하지 못합니다: 제공하는 글꼴이 실제로 인식한 스크립트를 포함해야 합니다.
필수 조건
- IronOCR 및 스크립트를 위한 언어 팩과 함께 사용. 이 예제에서는
OcrLanguage.GujaratiBest를 사용합니다. - 대상 스크립트를 지원하는 TrueType 글꼴. 이 예제는 Google Fonts에서 자유롭게 제공되는 AnekGujarati를 사용합니다.
- 그 글꼴의 전체 파일 경로.
IronOCR 버전 2026.3.3 이상이 필요합니다.
해결책
1. 스크립트를 포괄하는 글꼴 배치
대상 스크립트에 대한 글리프가 포함된 글꼴을 찾아 기기에 배치하고 전체 경로를 기록합니다. 구자라티 예제의 경우:
C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf
AnekGujarati 가변 글꼴 파일 이름에 쉼표가 포함되어 있으므로 정확하게 복사하십시오. 경로는 정확한 글꼴 파일을 가리켜야 합니다.
2. SaveAsSearchablePdf에 글꼴 전달
검색 가능한 PDF를 저장할 때, 글꼴을 CustomFontFile (3번째) 인자로 공급합니다. 4번째 인자는 선택적 CustomFontName 레이블입니다; 이를 생략하면 IronOCR은 글꼴 파일의 자체 이름을 사용합니다:
ocrResult.SaveAsSearchablePdf(
strOutputFile,
false,
@"C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf",
"AnekGujarati");
ocrResult.SaveAsSearchablePdf(
strOutputFile,
false,
@"C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf",
"AnekGujarati");
ocrResult.SaveAsSearchablePdf( _
strOutputFile, _
False, _
"C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf", _
"AnekGujarati")
엉망이 된 추출을 수정하는 인자는 글꼴 파일(3번째 매개변수)입니다: OCR한 스크립트를 위한 글리프가 포함되어 있어야 합니다. 4번째 매개변수는 내장된 글꼴 이름만 지정하며 스크립트 매핑에는 영향을 미치지 않습니다. 다른 문서의 경우, 3번째 매개변수를 그 스크립트를 지원하는 글꼴에 연결하십시오.
3. 텍스트 추출 확인
생성된 PDF를 열고 인식된 텍스트를 복사하여 이제 추출이 올바른지 확인하십시오. 여전히 깨져 보인다면, 제공된 글꼴에 스크립트의 글리프가 거의 확실히 부족합니다; 글꼴이 실제로 그것을 포함하는지 다시 확인하십시오.
메모
- 구자라티에만 국한되지 않음: PDF 글꼴이 스크립트를 포함하지 않을 때, 어떤 비라틴 또는 복잡한 스크립트도 깨진 복사 텍스트를 표시할 수 있습니다. 데바나가리(힌두어, 마라티어), 아랍어, 태국어, 중국어, 일본어 또는 한국어 텍스트가 포함됩니다.
- 스크립트당 하나의 글꼴: 인식한 스크립트를 포함하는 글꼴을 제공합니다. Google의 Noto 패밀리는 폭넓은 옵션으로, Noto Sans Gujarati, Noto Sans Devanagari, Noto Sans Arabic처럼 스크립트별 글꼴을 제공합니다.

