Latin Olmayan Yazı Sistemleri İçin Aranabilir PDF'lerde Bozulmuş Metinler

This article was translated from English: Does it need improvement?
Translated
View the article in English

IronOCR ile bir belgeyi tarayın, aranabilir bir PDF olarak kaydedin ve tanınan metin ekranda doğru görünebilir, ancak kopyaladığınızda veya çıkardığınızda saçmalıklara dönüşebilir. Bu, PDF'nin fontu, tanıdığınız yazı sistemi için glifleri içermediğinde olur ve Latin olmayan ve karmaşık yazı sistemlerinde yaygındır. Çözüm, PDF'yi yazı sisteminizi destekleyen bir font ile kaydetmektir. aşağıdaki örnek Gujarati kullanır.

Tanınan metin, eşleşen karakterlere sahip olmadığından, kopyalanan metin bozulmuş olarak çıkar, oysa OCR sayfayı doğru okumuştur. Yalnızca Latin karakter içeren bir font bunu çözmez: verdiğiniz font, gerçekten tanıdığınız yazı sistemini kapsamalıdır.

Gereksinimler

  • Yazı sistemi için dil paketi ile birlikte IronOCR. Bu örnek OcrLanguage.GujaratiBest kullanır.
  • Hedef yazı sisteminizi destekleyen bir TrueType fontu. Bu örnek, Google Fonts'tan ücretsiz olarak erişilebilen AnekGujarati kullanır.
  • O fontun tam dosya yolu.

Lütfen dikkate alınIronOCR sürüm 2026.3.3 veya daha yenisi gerektirir.

Çözüm

1. Yazı Sisteminizi Kapsayan Bir Font Yerleştirin

Hedef yazı sisteminiz için glifler içeren bir font bulun, makineye yerleştirin ve tam yolunu not edin. Gujarati örneği için:

C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf

AnekGujarati değişken-font dosya adı bir virgül içerir, bu yüzden onu tam kopyalayın. Yol tam olarak font dosyasına işaret etmelidir.

2. Fontu SaveAsSearchablePdf'a Geçirin

Aranabilir PDF'yi kaydederken, yazı sistemine uygun fontunuza ait yolu CustomFontFile (3. argüman) olarak girin. 4. argüman isteğe bağlı bir CustomFontName etiketidir; onu atladığınızda, IronOCR font dosyasının kendi adını kullanır:

ocrResult.SaveAsSearchablePdf(
    strOutputFile,
    false,
    @"C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf",
    "AnekGujarati");
ocrResult.SaveAsSearchablePdf(
    strOutputFile,
    false,
    @"C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf",
    "AnekGujarati");
ocrResult.SaveAsSearchablePdf( _
    strOutputFile, _
    False, _
    "C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf", _
    "AnekGujarati")
$vbLabelText   $csharpLabel

Karışık çıkarmayı düzelten argüman, font dosyasıdır (3. parametre): Bu dosya, OCR işlemi yapmış olduğunuz yazı sistemi için glifler içermelidir. 4. parametre sadece yerleşik fontun adını belirler ve yazı sistemi haritalamayı etkilemez. Farklı bir belge için, 3. parametreyi o yazı sistemini destekleyen bir fonta yönlendirin.

3. Metin Çıkarımlarını Doğrulayın

Oluşturulan PDF'yi açın ve tanınan metni kopyalayarak şimdi doğru şekilde çıkarıldığını doğrulayın. Hala bozulmuş görünüyorsa, sağlanan fontun yazı sisteminiz için glifleri neredeyse kesinlikle eksiktir; fontun gerçekten kapsadığından emin olun.

Notlar

  • Gujarati ile sınırlı değil: herhangi bir Latin olmayan veya karmaşık yazı sistemi, PDF fontu bunu kapsamadığında bozulmuş kopyalanmış metin gösterebilir, gibi Devanagari (Hintçe, Marathi), Arapça, Tayca ve Çince, Japonca veya Korece metin.
  • Her yazı sistemi için bir font: Tanıdığınız yazı sistemini içeren bir font temin edin. Google Noto ailesi, Noto Sans Gujarati, Noto Sans Devanagari ve Noto Sans Arapça gibi yazı sistemine özgü fontlarla geniş bir seçenektir.
Curtis Chau
Teknik Yazar

Curtis Chau, Bilgisayar Bilimleri alanında Lisans Derecesine (Carleton Üniversitesi) sahip ve Node.js, TypeScript, JavaScript ve React konularında uzmanlaşmış ön uç geliştirmeyle ilgileniyor. Sezgisel ve estetik açıdan hoş kullanıcı arayüzleri oluşturma tutkunu, Curtis modern çerçevelerle çalışmayı ve iyi yapı...

Daha Fazla Oku
Başlamaya Hazır mısınız?
Nuget İndirmeler 6,175,195 | Sürüm: 2026.7 yeni yayınlandı
Still Scrolling Icon

Hâlâ Kaydırıyor Musunuz?

Hızlıca kanıt ister misiniz? PM > Install-Package IronOcr
örnek çalıştır görüntünüzün aranabilir metin haline gelmesini izleyin.