IRONSOFTWAREHOME

Verzerrter Text in durchsuchbaren PDFs für nicht-lateinische Schriften

Curtis Chau
Curtis Chau
Updated: 3. Juli 2026

OCRen Sie ein Dokument mit IronOCR, speichern Sie es als durchsuchbares PDF, und der erkannte Text kann auf dem Bildschirm korrekt aussehen, aber unverständlich werden, wenn Sie ihn kopieren oder extrahieren. Dies passiert, wenn die Schriftart des PDFs keine Glyphen für die Schrift hat, die Sie erkannt haben, und es ist häufig bei nicht-lateinischen und komplexen Schriften. Die Lösung ist, das PDF mit einer Schriftart zu speichern, die Ihre Schrift unterstützt; das folgende Beispiel verwendet Gujarati.

Der erkannte Text hat keine passenden Zeichen zum Zuordnen, daher erscheint kopierter Text verzerrt, obwohl OCR die Seite korrekt gelesen hat. Eine nur lateinische Schriftart wird dies nicht lösen: Die Schriftart, die Sie bereitstellen, muss die Schrift abdecken, die Sie tatsächlich erkannt haben.

Voraussetzungen

  • IronOCR mit dem Sprachpaket für Ihre Schrift. Dieses Beispiel verwendet OcrLanguage.GujaratiBest.
  • Eine TrueType-Schriftart, die Ihre Zielschrift unterstützt. Dieses Beispiel verwendet AnekGujarati, frei verfügbar von Google Fonts.
  • Der vollständige Dateipfad zu dieser Schriftart.
Hinweis:: Erfordert IronOCR Version 2026.3.3 oder später.

Lösung

1. Platzieren Sie eine Schriftart, die Ihre Schrift abdeckt

Finden Sie eine Schriftart, die Glyphen für Ihre Zielschrift enthält, platzieren Sie sie auf dem Gerät und notieren Sie den vollständigen Pfad. Für das Gujarati-Beispiel:

C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf
Text

Der AnekGujarati variable-font Dateiname enthält ein Komma, daher kopieren Sie ihn genau. Der Pfad muss auf die exakte Schriftartdatei verweisen.

2. Übergeben Sie die Schriftart an SaveAsSearchablePdf

Beim Speichern des durchsuchbaren PDFs geben Sie den Pfad zur Ihrer skriptfähigen Schriftart als CustomFontFile (3. Argument) an. Das 4. Argument ist ein optionales CustomFontName Etikett; wenn Sie es weglassen, verwendet IronOCR den eigenen Namen der Schriftdatei:

ocrResult.SaveAsSearchablePdf(
    strOutputFile,
    false,
    @"C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf",
    "AnekGujarati");
C#

Das Argument, das die verzerrte Extraktion behebt, ist die Schriftdatei (3. Parameter): sie muss Glyphen für die Schrift enthalten, die Sie OCRen. Der 4. Parameter benennt nur die eingebettete Schriftart und beeinflusst die Skriptzuordnung nicht. Für ein anderes Dokument verweisen Sie den 3. Parameter auf eine Schrift, die diese Schrift unterstützt.

3. Bestätigen Sie die Textextraktionen

Öffnen Sie das generierte PDF und kopieren Sie den erkannten Text, um zu überprüfen, ob er jetzt korrekt extrahiert wird. Wenn er immer noch verzerrt erscheint, fehlen der bereitgestellten Schriftart höchstwahrscheinlich Glyphen für Ihre Schrift; überprüfen Sie erneut, ob die Schriftart sie wirklich abdeckt.

Anmerkungen

  • Nicht spezifisch für Gujarati: Jede nicht-lateinische oder komplexe Schrift kann verzerrten kopierten Text anzeigen, wenn die PDF-Schriftart sie nicht abdeckt, einschließlich Devanagari (Hindi, Marathi), Arabisch, Thai und Chinesisch, Japanisch oder Koreanisch.
  • Eine Schriftart pro Schrift: Stellen Sie eine Schriftart bereit, die die erkannte Schrift enthält. Die Noto-Familie von Google ist eine breite Option, mit schrifteinheitlichen Schriften wie Noto Sans Gujarati, Noto Sans Devanagari und Noto Sans Arabisch.
Curtis Chau
Technischer Autor

Curtis Chau hat einen Bachelor-Abschluss in Informatik von der Carleton University und ist spezialisiert auf Frontend-Entwicklung mit Expertise in Node.js, TypeScript, JavaScript und React. Leidenschaftlich widmet er sich der Erstellung intuitiver und ästhetisch ansprechender Benutzerschnittstellen und arbeitet gerne mit modernen Frameworks sowie der Erstellung gut strukturierter, optisch ansprechender Handbücher.

...
Weiterlesen

Bereit anzufangen?

Nuget Downloads 6,236,385Version:2026.9gerade veröffentlicht

Erhalten Sie sofort Ihren kostenlosen 30-Tage-Testschlüssel.
Ihr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.
C# NuGet-Bibliothek für PDF
Installation mit NuGet

Version: 2026.9

PM > Install-Package IronOcr
nuget.org/packages/IronOcr/
  1. Rechtsklick auf Referenzen, NuGet-Pakete verwalten
  2. Wählen Sie Durchsuchen und suchen Sie nach "IronOCR"
  3. Paket auswählen und installieren
C# PDF DLL
Download DLL

Version: 2026.9

oder laden Sie den Windows Installer hier herunter.

  1. Laden Sie IronOCR herunter und entpacken Sie es in einem Ordner wie ~/Libs in Ihrem Lösungsverzeichnis.
  2. Klicken Sie im Visual Studio Solution Explorer mit der rechten Maustaste auf Referenzen. Wählen Sie Durchsuchen, "IronOCR.dll"

Lizenzen von $999

Key in blue circle

Holen Sie sich sofort Ihren kostenlosen 30-Tage-Testschlüssel.

Your trial license will be sent to your email address

Keine Einschränkungen. 100 % freigeschaltet. Keine Kreditkarte.

bullet_checkedIhr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.Keine Einschränkungen. 100 % freigeschaltet. Keine Kreditkarte.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
Erhalten Sie Ihre unverbindliche Beratung
Füllen Sie das Formular unten aus oder senden Sie eine E-Mail an sales@ironsoftware.com
Ihre Daten werden immer vertraulich behandelt.
Von Millionen von Ingenieur*innen weltweit vertraut
Kundenlogos von Iron Software
Erhalten Sie sofort Ihren kostenlosen 30-Tage-Testschlüssel.
Ihr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.