Unerwartete Leerzeichen in IronOCR

This article was translated from English: Does it need improvement?
Translated
View the article in English

Extrahierter Text enthält manchmal zusätzliche Leerzeichen zwischen Zeichen, selbst wenn das Quelldokument sauber aussieht. Der übliche Übeltäter ist die Variation in Zeichenbreite und -abstand, oft in Verbindung mit der Eingabeschriftart, und Bildfilter allein beseitigen es selten.

OCR-Ergebnis im Visual Studio Text Visualizer mit einem unerwarteten Leerzeichen innerhalb der Referenznummer, zwischen der 7 und der 1

Die folgenden Ansätze haben sich als wirksam erwiesen, um die zusätzlichen Leerzeichen zu vermeiden.

Lösung

1. Wechseln Sie zu einer OCR-freundlichen Schriftart

Renden oder liefern Sie das Dokument in Roboto, wo Sie können. Es ist eine saubere, moderne Schriftart, die zuverlässig gelesen wird, sodass die Engine weniger unsinnige Leerzeichen produziert als bei Schriften wie Arial.

2. Verwenden Sie ReadDocumentAdvanced()

Lesen Sie das Dokument mit ReadDocumentAdvanced() anstelle der Standard-Lesemethode. Es gibt Ihnen mehr Kontrolle über den OCR-Prozess und handhabt komplexe Textlayouts besser.

3. Setzen Sie OcrLanguage.EnglishBest

Richten Sie die Engine auf das OcrLanguage.EnglishBest Modell aus. Dieses fortschrittliche Sprachmodell ist genauer als die Standard-Englisch-Option und reduziert Fehlinterpretationsabstände.

4. Trainieren Sie eine benutzerdefinierte Schriftart

Wenn das Eingabe-PDF eine ungewöhnliche oder nicht standardmäßige Schriftart verwendet, können die Standardeinstellungen Schwierigkeiten haben und Leerzeichen einfügen. Das Training einer benutzerdefinierten Schriftart lehrt die Engine, diese spezifische Schriftart zu erkennen, was die Erkennung erheblich verbessert. Siehe den Leitfaden zur OCR-benutzerdefinierten Schriftartschulung für den vollständigen Workflow.

Mit diesen Einstellungen angewendet, wird der extrahierte Text ohne die überflüssigen Leerzeichen zurückgegeben:

OCR-Ergebnis nach Anwendung der Korrekturen, mit den korrigierten Abständen

TippsVersuchen Sie zuerst die OCR-freundliche Schriftart und das EnglishBest-Modell; sie beheben die meisten Abstandsprobleme ohne den Aufwand des Trainings einer benutzerdefinierten Schriftart.

Curtis Chau
Technischer Autor

Curtis Chau hat einen Bachelor-Abschluss in Informatik von der Carleton University und ist spezialisiert auf Frontend-Entwicklung mit Expertise in Node.js, TypeScript, JavaScript und React. Leidenschaftlich widmet er sich der Erstellung intuitiver und ästhetisch ansprechender Benutzerschnittstellen und arbeitet gerne mit modernen Frameworks sowie der Erstellung gut strukturierter, optisch ansprechender ...

Weiterlesen
Bereit anzufangen?
Nuget Downloads 6,136,090 | Version: 2026.7 gerade veröffentlicht
Still Scrolling Icon

Scrollst du immer noch?

Sie brauchen schnell einen Beweis? PM > Install-Package IronOcr
Führen Sie ein Beispiel aus und beobachten Sie, wie Ihr Bild zu durchsuchbarem Text wird.