Unerwartete Leerzeichen in IronOCR
Extrahierter Text enthält manchmal zusätzliche Leerzeichen zwischen Zeichen, selbst wenn das Quelldokument sauber aussieht. Der übliche Übeltäter ist die Variation in Zeichenbreite und -abstand, oft in Verbindung mit der Eingabeschriftart, und Bildfilter allein beseitigen es selten.

Die folgenden Ansätze haben sich als wirksam erwiesen, um die zusätzlichen Leerzeichen zu vermeiden.
Lösung
1. Wechseln Sie zu einer OCR-freundlichen Schriftart
Renden oder liefern Sie das Dokument in Roboto, wo Sie können. Es ist eine saubere, moderne Schriftart, die zuverlässig gelesen wird, sodass die Engine weniger unsinnige Leerzeichen produziert als bei Schriften wie Arial.
2. Verwenden Sie ReadDocumentAdvanced()
Lesen Sie das Dokument mit ReadDocumentAdvanced() anstelle der Standard-Lesemethode. Es gibt Ihnen mehr Kontrolle über den OCR-Prozess und handhabt komplexe Textlayouts besser.
3. Setzen Sie OcrLanguage.EnglishBest
Richten Sie die Engine auf das OcrLanguage.EnglishBest Modell aus. Dieses fortschrittliche Sprachmodell ist genauer als die Standard-Englisch-Option und reduziert Fehlinterpretationsabstände.
4. Trainieren Sie eine benutzerdefinierte Schriftart
Wenn das Eingabe-PDF eine ungewöhnliche oder nicht standardmäßige Schriftart verwendet, können die Standardeinstellungen Schwierigkeiten haben und Leerzeichen einfügen. Das Training einer benutzerdefinierten Schriftart lehrt die Engine, diese spezifische Schriftart zu erkennen, was die Erkennung erheblich verbessert. Siehe den Leitfaden zur OCR-benutzerdefinierten Schriftartschulung für den vollständigen Workflow.
Mit diesen Einstellungen angewendet, wird der extrahierte Text ohne die überflüssigen Leerzeichen zurückgegeben:


