Latin Olmayan Yazı Sistemleri İçin Aranabilir PDF'lerde Bozulmuş Metinler
IronOCR ile bir belgeyi tarayın, aranabilir bir PDF olarak kaydedin ve tanınan metin ekranda doğru görünebilir, ancak kopyaladığınızda veya çıkardığınızda saçmalıklara dönüşebilir. Bu, PDF'nin fontu, tanıdığınız yazı sistemi için glifleri içermediğinde olur ve Latin olmayan ve karmaşık yazı sistemlerinde yaygındır. Çözüm, PDF'yi yazı sisteminizi destekleyen bir font ile kaydetmektir. aşağıdaki örnek Gujarati kullanır.
Tanınan metin, eşleşen karakterlere sahip olmadığından, kopyalanan metin bozulmuş olarak çıkar, oysa OCR sayfayı doğru okumuştur. Yalnızca Latin karakter içeren bir font bunu çözmez: verdiğiniz font, gerçekten tanıdığınız yazı sistemini kapsamalıdır.
Gereksinimler
- Yazı sistemi için dil paketi ile birlikte IronOCR. Bu örnek
OcrLanguage.GujaratiBestkullanır. - Hedef yazı sisteminizi destekleyen bir TrueType fontu. Bu örnek, Google Fonts'tan ücretsiz olarak erişilebilen AnekGujarati kullanır.
- O fontun tam dosya yolu.
Çözüm
1. Yazı Sisteminizi Kapsayan Bir Font Yerleştirin
Hedef yazı sisteminiz için glifler içeren bir font bulun, makineye yerleştirin ve tam yolunu not edin. Gujarati örneği için:
C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf
AnekGujarati değişken-font dosya adı bir virgül içerir, bu yüzden onu tam kopyalayın. Yol tam olarak font dosyasına işaret etmelidir.
2. Fontu SaveAsSearchablePdf'a Geçirin
Aranabilir PDF'yi kaydederken, yazı sistemine uygun fontunuza ait yolu CustomFontFile (3. argüman) olarak girin. 4. argüman isteğe bağlı bir CustomFontName etiketidir; onu atladığınızda, IronOCR font dosyasının kendi adını kullanır:
ocrResult.SaveAsSearchablePdf(
strOutputFile,
false,
@"C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf",
"AnekGujarati");
ocrResult.SaveAsSearchablePdf(
strOutputFile,
false,
@"C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf",
"AnekGujarati");
ocrResult.SaveAsSearchablePdf( _
strOutputFile, _
False, _
"C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf", _
"AnekGujarati")
Karışık çıkarmayı düzelten argüman, font dosyasıdır (3. parametre): Bu dosya, OCR işlemi yapmış olduğunuz yazı sistemi için glifler içermelidir. 4. parametre sadece yerleşik fontun adını belirler ve yazı sistemi haritalamayı etkilemez. Farklı bir belge için, 3. parametreyi o yazı sistemini destekleyen bir fonta yönlendirin.
3. Metin Çıkarımlarını Doğrulayın
Oluşturulan PDF'yi açın ve tanınan metni kopyalayarak şimdi doğru şekilde çıkarıldığını doğrulayın. Hala bozulmuş görünüyorsa, sağlanan fontun yazı sisteminiz için glifleri neredeyse kesinlikle eksiktir; fontun gerçekten kapsadığından emin olun.
Notlar
- Gujarati ile sınırlı değil: herhangi bir Latin olmayan veya karmaşık yazı sistemi, PDF fontu bunu kapsamadığında bozulmuş kopyalanmış metin gösterebilir, gibi Devanagari (Hintçe, Marathi), Arapça, Tayca ve Çince, Japonca veya Korece metin.
- Her yazı sistemi için bir font: Tanıdığınız yazı sistemini içeren bir font temin edin. Google Noto ailesi, Noto Sans Gujarati, Noto Sans Devanagari ve Noto Sans Arapça gibi yazı sistemine özgü fontlarla geniş bir seçenektir.

