IRONSOFTWAREHOME

Mehrsprachigkeit mit Tesseract in C#

Kannaopat Udonpant
Kannapat Udonpant
Updated: 29. Juni 2026

IronOCR ermöglicht die Textextraktion aus Dokumenten in mehreren Sprachen unter Verwendung der Tesseract-Engine, indem primäre und sekundäre Sprachen mit nur einer Zeile Code konfiguriert werden. IronOCR unterstützt über 125 Sprachpakete für eine nahtlose mehrsprachige OCR-Verarbeitung.

Einführung

IronOCR bietet Textextraktion aus verschiedenen Sprachen und Skripten unter Verwendung der Tesseract Engine als zuverlässiges OCR-Tool.

Dieser Artikel zeigt, wie IronOCR mit Hilfe von Tesseract Text in mehreren Sprachen verarbeitet. Sie lernen, wie Sie mehrsprachige OCR-Lösungen implementieren und die Fähigkeiten von IronOCR und die Integration seiner Tesseract-Engine verstehen.

Die Verarbeitung von Dokumenten in mehreren Sprachen ist für moderne Anwendungen unerlässlich. Internationale Geschäftsdokumente, mehrsprachige Websites und globale Kommunikationsplattformen erfordern eine genaue Textextraktion über Sprachgrenzen hinweg. IronOCR adressiert dieses Bedürfnis durch die Integration der umfangreichen Sprachunterstützung von Tesseract, was die Texterkennung aus Dokumenten mit mehreren Schriften und Zeichensätzen gleichzeitig ermöglicht.

Schnellstart: IronOCR verwenden, um Text in mehreren Sprachen zu erkennen

Konfigurieren Sie IronOCR mit einer Primärsprache und fügen Sie Sekundärsprachen in einer Zeile hinzu, um Text aus mehrsprachigen Dokumenten oder Bildern zu extrahieren.

  1. 1Install IronOCR with NuGet Package Manager

    PM > Install-Package IronOcr

  2. 2Kopieren Sie diesen Codeausschnitt und führen Sie ihn aus.

    string text = new IronTesseract { Language = OcrLanguage.Spanish }.AddSecondaryLanguage(OcrLanguage.French).Read("doc_or_image_path").Text;
    C#
  3. 3Bereitstellen zum Testen in Ihrer Live-Umgebung

    Beginnen Sie noch heute, IronOCR in Ihrem Projekt zu verwenden, mit einer kostenlosen Testversion
    arrow pointer

Wie lese ich mehrsprachige PDFs mit IronOCR?

IronOCR bietet etwa 125 Sprachpakete an; standardmäßig ist nur Englisch installiert. Laden Sie weitere Sprachen von NuGet herunter. Alle verfügbaren Sprachpakete hier ansehen.

PDFs, die mehrere Sprachen enthalten, erfordern eine spezielle Konfiguration der OCR-Engine. IronOCR ermöglicht die Angabe von Primär- und Sekundärsprachen vor der Verarbeitung von Dokumenten und gewährleistet so eine optimale Erkennungsgenauigkeit bei unterschiedlichen Skripten und Zeichensätzen.

Welche Sprachen sind für die PDF-Extraktion verfügbar?

Das folgende Beispiel zeigt, wie Sie mehrere Sprachen in IronOCR verwenden, um Text aus einer PDF-Datei zu extrahieren.

using IronOcr;
using System;

// Instantiate IronTesseract
IronTesseract ocrTesseract = new IronTesseract();

// Set secondary language to Russian
ocrTesseract.AddSecondaryLanguage(OcrLanguage.Russian);

// Add PDF
using var pdfInput = new OcrPdfInput(@"example.pdf");
// Perform OCR
OcrResult result = ocrTesseract.Read(pdfInput);

// Output extracted text to console
Console.WriteLine(result.Text);

Für komplexe PDF-Verarbeitungsszenarien lesen Sie unseren Leitfaden PDF OCR Text Extraction, der fortgeschrittene Techniken für verschiedene PDF-Formate und -Strukturen abdeckt.

Wie wirkt sich die Sprachpriorität auf die OCR-Ergebnisse aus?

Fügen Sie beliebig viele Zweitsprachen mit der AddSecondaryLanguage-Methode hinzu. Beachten Sie, dass zusätzliche Sprachen die Geschwindigkeit und Leistung beeinträchtigen können. Die Priorität der Sprachen hängt von der Reihenfolge ab, in der sie hinzugefügt werden, wobei die erste Sprache eine höhere Priorität hat.

Bei der Bearbeitung mehrsprachiger Dokumente ist das Verständnis der Sprachpriorität entscheidend. Die Primärsprache erhält während der Texterkennung höchste Priorität - die OCR-Engine versucht zuerst, Zeichen mit dem Zeichensatz der Primärsprache abzugleichen. Sekundärsprachen werden konsultiert, wenn Zeichen aufgetreten, die nicht zu Primärsprachenmustern passen.

Für optimale Leistung:

  • Legen Sie die gebräuchlichste Sprache in Ihrem Dokument als Primärsprache fest
  • Fügen Sie Sekundärsprachen nach Häufigkeit geordnet in das Dokument ein
  • Beschränken Sie die sekundären Sprachen auf diejenigen, die für Ihren Anwendungsfall notwendig sind

Für Hochleistungsanwendungen mit mehreren Sprachen finden Sie in unserem Leitfaden Schnelle OCR-Konfiguration eine Anleitung zur Optimierung der Verarbeitungsgeschwindigkeit.

Wie bearbeite ich mehrsprachige Bilder mit Tesseract?

Englisch ist die primäre Standardsprache. Um es zu ändern, setzen Sie die Eigenschaft Language auf Ihre gewünschte Sprache und fügen Sie bei Bedarf Zweitsprachen hinzu.

Bilder, die mehrsprachigen Text enthalten, müssen sorgfältig konfiguriert werden. Im Gegensatz zu PDFs können Bilder unterschiedliche Textorientierungen, verschiedene Schriftarten und gemischte Schriften enthalten. Die Tesseract-Integration von IronOCR bietet umfassende Sprachkonfigurationsoptionen für diese Szenarien.

Wann sollte ich die Standard-Spracheinstellung ändern?

Ändern Sie die Standardsprache, wenn:

  • Der Großteil des Dokuments ist in einer nicht-englischen Sprache verfasst
  • Bearbeitung von Dokumenten aus einer bestimmten Region oder einem bestimmten Land
  • Ihre Anwendung richtet sich an Benutzer, die mit nicht-englischen Inhalten arbeiten
  • Optimierung der Erkennungsgenauigkeit für bestimmte Zeichensätze

Hier ist ein vollständiges Beispiel für eine mehrsprachige Bildverarbeitung:

using IronOcr;
using System;

// Instantiate IronTesseract
IronTesseract ocrTesseract = new IronTesseract();

// Set primary language to Russian
ocrTesseract.Language = OcrLanguage.Russian;
ocrTesseract.AddSecondaryLanguage(OcrLanguage.Japanese);

// Add image
using var imageInput = new OcrImageInput(@"example.png");
// Perform OCR
OcrResult result = ocrTesseract.Read(imageInput);

// Output extracted text to console
Console.WriteLine(result.Text);

Für benutzerdefinierte Sprachen oder spezielle Schriftarten lesen Sie bitte unsere Anleitung zur Verwendung benutzerdefinierter Sprachdateien.

Welche Ergebnisse kann ich von mehrsprachiger OCR erwarten?

Eine korrekte Konfiguration führt zu Ergebnissen wie diesen:

Mehrsprachige Textverarbeitungs-App, die russische und japanische Inhalte zeigt, mit Konsolenausgabe zur Zeichenverarbeitung

Die Qualität der mehrsprachigen OCR-Ergebnisse hängt von mehreren Faktoren ab:

  1. Bildqualität: Eine höhere Auflösung (300+ DPI) liefert bessere Ergebnisse. Siehe unseren DPI-Einstellungsleitfaden.
  2. Textklarheit: Klarer, gut definierter Text ohne Artefakte führt zu einer genaueren Erkennung
  3. Sprachkonfiguration: Eine ordnungsgemäße Einrichtung der primären und sekundären Sprache gewährleistet korrekte Zeichenerkennungsmuster
  4. Vorbearbeitung: Geeignete Filter verbessern die Ergebnisse erheblich. Siehe unseren Leitfaden zu Bildkorrekturfiltern für Verbesserungstechniken.

Was sind die wichtigsten Erkenntnisse für mehrsprachige OCR?

IronOCR extrahiert mit Hilfe der Tesseract-Engine effektiv Text aus mehrsprachigen Dokumenten. Das Programm bewältigt die Komplexität des Lesens von Texten in vielen Sprachen und bietet eine vielseitige Lösung. Ob bei der Verarbeitung von PDFs mit verschiedenen Sprachen oder bei der Arbeit mit mehrsprachigen Bildinhalten, IronOCR vereinfacht das Erkennen und Extrahieren von Text in verschiedenen Sprachen.

Die wichtigsten Vorteile von IronOCR für die mehrsprachige Textextraktion:

  • Umfangreiche Sprachunterstützung: Über 125 internationale OCR-Sprachen über NuGet-Pakete
  • Flexible Konfiguration: Einfache API für primäre und sekundäre Spracheinstellungen
  • Hohe Genauigkeit: Verwendet Tesseract 5's fortschrittliche Erkennungsalgorithmen
  • Leistungsoptimierung: Eingebaute Multithreading-Unterstützung
  • Plattformübergreifende Kompatibilität: Funktioniert unter Windows, Linux und macOS

IronOCR bietet eine umfassende Lösung, die Benutzerfreundlichkeit mit leistungsstarken Funktionen für die mehrsprachige OCR-Implementierung kombiniert. Erstellen Sie Dokumentenmanagementsysteme, Übersetzungstools oder andere Anwendungen, die eine mehrsprachige Textextraktion erfordern, mit der für den Erfolg erforderlichen Flexibilität und Zuverlässigkeit.

Starten Sie Ihr mehrsprachiges OCR-Projekt, indem Sie IronOCR von NuGet herunterladen und sich mit unserer Dokumentation und den Beispielen vertraut machen. Für spezielle Anwendungsfälle oder fortgeschrittene Szenarien bieten unsere Fehlersuchanleitungen Einblicke für optimale Ergebnisse.

Häufig gestellte Fragen

Wie führe ich OCR für Dokumente durch, die mehrere Sprachen enthalten?

IronOCR ermöglicht es Ihnen, mehrsprachige OCR mit nur einer Zeile Code zu konfigurieren. Legen Sie eine Primärsprache mit der Eigenschaft Language fest und fügen Sie Sekundärsprachen mit der Methode AddSecondaryLanguage hinzu. Auf diese Weise kann IronOCR Text aus Dokumenten, die mehrere Schriften und Zeichensätze gleichzeitig enthalten, genau extrahieren.

Welche Sprachen werden für die Textextraktion unterstützt?

IronOCR unterstützt über 125 Sprachpakete durch die Integration der Tesseract-Engine. Während Englisch standardmäßig installiert ist, können Sie zusätzliche Sprachpakete von NuGet herunterladen, um OCR-Funktionen für Sprachen von Spanisch und Französisch bis hin zu Arabisch, Chinesisch, Japanisch und vielen anderen zu aktivieren.

Wie füge ich Sekundärsprachen für die OCR-Verarbeitung hinzu?

Verwenden Sie die AddSecondaryLanguage-Methode in IronOCR, um zusätzliche Sprachen zu aktivieren. Zum Beispiel: new IronTesseract { Language = OcrLanguage.Spanish }.AddSecondaryLanguage(OcrLanguage.French). Mit dieser Konfiguration kann IronOCR innerhalb desselben Dokuments sowohl spanischen als auch französischen Text erkennen.

Kann ich Text aus mehrsprachigen PDFs extrahieren?

Ja, IronOCR kann PDFs mit mehreren Sprachen verarbeiten. Konfigurieren Sie einfach die OCR-Engine mit Ihrer primären und sekundären Sprache vor der Verarbeitung. IronOCR verarbeitet automatisch verschiedene Skripte und Zeichensätze in der PDF-Datei und gewährleistet eine genaue Textextraktion in allen im Dokument enthaltenen Sprachen.

Muss ich die Sprachpakete separat installieren?

IronOCR enthält zwar standardmäßig Englisch, aber zusätzliche Sprachpakete müssen über NuGet installiert werden. Jedes Sprachpaket enthält die erforderlichen Daten, damit die Tesseract-Engine von IronOCR Text in der jeweiligen Sprache erkennen kann. Sie können alle verfügbaren Sprachpakete auf der IronOCR-Sprachen-Seite einsehen und herunterladen.

Was ist der minimale Arbeitsablauf für mehrsprachige OCR?

Der minimale Arbeitsablauf umfasst 5 Schritte: 1) Herunterladen der IronOCR-Bibliothek, 2) Vorbereiten des PDF- oder Bilddokuments, 3) Installieren der erforderlichen Sprachpakete über NuGet, 4) Verwenden der AddSecondaryLanguage-Methode, um zusätzliche Sprachen zu aktivieren, und 5) Festlegen der Eigenschaft Language für Ihre Primärsprache. Diese Einstellung ermöglicht eine genaue mehrsprachige Textextraktion.

What are the benefits of using IronOCR for multi-language text extraction?

IronOCR offers extensive language support, flexible language configuration, high accuracy with Tesseract 5's algorithms, performance optimization with multithreading, and cross-platform compatibility, making it ideal for applications requiring multilingual text extraction.

Bereit anzufangen?

Nuget Downloads 6,236,385Version:2026.9gerade veröffentlicht

Holen Sie sich Ihre KOSTENLOSE

30-Tage-Testlizenz sofort.

bullet_checkedKeine Kreditkarte oder Kontoerstellung erforderlich
bullet_testTesten Sie in der Produktion
ohne Wasserzeichen
bullet_calendar30 Tage voll
funktionsfähiges Produkt
bullet_support24/5 technischer
Support während der Testphase
Erhalten Sie sofort Ihren kostenlosen 30-Tage-Testschlüssel.
Ihr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.
C# NuGet-Bibliothek für PDF
Installation mit NuGet

Version: 2026.9

PM > Install-Package IronOcr
nuget.org/packages/IronOcr/
  1. Rechtsklick auf Referenzen, NuGet-Pakete verwalten
  2. Wählen Sie Durchsuchen und suchen Sie nach "IronOCR"
  3. Paket auswählen und installieren
C# PDF DLL
Download DLL

Version: 2026.9

oder laden Sie den Windows Installer hier herunter.

  1. Laden Sie IronOCR herunter und entpacken Sie es in einem Ordner wie ~/Libs in Ihrem Lösungsverzeichnis.
  2. Klicken Sie im Visual Studio Solution Explorer mit der rechten Maustaste auf Referenzen. Wählen Sie Durchsuchen, "IronOCR.dll"

Lizenzen von $999

Key in blue circle

Holen Sie sich sofort Ihren kostenlosen 30-Tage-Testschlüssel.

Your trial license will be sent to your email address

Keine Einschränkungen. 100 % freigeschaltet. Keine Kreditkarte.

bullet_checkedIhr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.Keine Einschränkungen. 100 % freigeschaltet. Keine Kreditkarte.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
Erhalten Sie Ihre unverbindliche Beratung
Füllen Sie das Formular unten aus oder senden Sie eine E-Mail an sales@ironsoftware.com
Ihre Daten werden immer vertraulich behandelt.
Von Millionen von Ingenieur*innen weltweit vertraut
Kundenlogos von Iron Software
Erhalten Sie sofort Ihren kostenlosen 30-Tage-Testschlüssel.
Ihr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.