IRONSOFTWAREHOME

Cómo utilizar varios idiomas con Tesseract en C#

Kannaopat Udonpant
Kannapat Udonpant
Updated: 29 de junio de 2026

IronOCR permite la extracción de texto de documentos en varios idiomas utilizando el motor Tesseract mediante la configuración de idiomas primarios y secundarios con una sola línea de código, y admite más de 125 paquetes de idiomas para un procesamiento OCR multilingüe sin problemas.

Introducción

IronOCR proporciona extracción de texto de varios lenguajes y scripts utilizando Tesseract Engine como herramienta OCR fiable.

Este artículo explora cómo IronOCR gestiona texto en varios idiomas a través de Tesseract. Aprenderá cómo implementar soluciones OCR multilingües y comprender las capacidades de IronOCR y su integración con el motor Tesseract.

El procesamiento de documentos en varios idiomas es esencial para las aplicaciones modernas. Los documentos comerciales internacionales, los sitios web multilingües y las plataformas de comunicación globales requieren una extracción de texto precisa que supere las barreras lingüísticas. IronOCR aborda esta necesidad integrándose con el amplio soporte de idiomas de Tesseract, lo que permite la extracción de texto de documentos que contienen múltiples escrituras y conjuntos de caracteres simultáneamente.

Inicio rápido: Usar IronOCR para reconocer texto en múltiples idiomas

Configure IronOCR con un idioma principal y añada idiomas secundarios en una sola línea para extraer texto de documentos o imágenes multilingües.

  1. 1Install IronOCR with NuGet Package Manager

    PM > Install-Package IronOcr

  2. 2Copie y ejecute este fragmento de código.

    string text = new IronTesseract { Language = OcrLanguage.Spanish }.AddSecondaryLanguage(OcrLanguage.French).Read("doc_or_image_path").Text;
    C#
  3. 3Despliegue para probar en su entorno real

    Comienza a usar IronOCR en tu proyecto hoy mismo con una prueba gratuita
    arrow pointer

¿Cómo leer archivos PDF en varios idiomas con IronOCR?

IronOCR ofrece aproximadamente 125 paquetes de idiomas; por defecto, sólo está instalado el inglés. Descargue otros idiomas de NuGet. Vea todos los paquetes de idiomas disponibles aquí..

Los PDF que contienen varios idiomas requieren una configuración específica del motor de OCR. IronOCR permite especificar los idiomas primario y secundario antes de procesar los documentos, lo que garantiza una precisión de reconocimiento óptima en diferentes alfabetos y conjuntos de caracteres.

¿Qué idiomas están disponibles para la extracción de PDF?

El siguiente ejemplo muestra cómo usar múltiples idiomas en IronOCR para extraer texto de un archivo PDF.

using IronOcr;
using System;

// Instantiate IronTesseract
IronTesseract ocrTesseract = new IronTesseract();

// Set secondary language to Russian
ocrTesseract.AddSecondaryLanguage(OcrLanguage.Russian);

// Add PDF
using var pdfInput = new OcrPdfInput(@"example.pdf");
// Perform OCR
OcrResult result = ocrTesseract.Read(pdfInput);

// Output extracted text to console
Console.WriteLine(result.Text);

Para situaciones complejas de procesamiento de PDF, consulte nuestra guía sobre Extracción de texto de PDF OCR, que incluye técnicas avanzadas para diversos formatos y estructuras de PDF.

¿Cómo afecta la prioridad del idioma a los resultados del OCR?

Agregue cualquier cantidad de lenguajes secundarios usando el método AddSecondaryLanguage. Tenga en cuenta que los idiomas adicionales pueden afectar a la velocidad y el rendimiento. La prioridad de los idiomas depende del orden en que se añadan, teniendo mayor prioridad el primero.

Comprender la prioridad lingüística es crucial a la hora de procesar documentos multilingües. El idioma principal recibe la máxima prioridad durante la extracción de texto: el motor OCR primero intenta coincidir caracteres con el conjunto de caracteres del idioma principal. Se consultan idiomas secundarios al encontrar caracteres que no coinciden con los patrones del idioma principal.

Para un rendimiento óptimo:

  • Establezca el idioma más común del documento como principal
  • Añadir idiomas secundarios ordenados por frecuencia en el documento
  • Limite los idiomas secundarios a los necesarios para su caso de uso

Para aplicaciones de alto rendimiento con varios idiomas, consulte nuestra guía Configuración rápida de OCR para optimizar la velocidad de procesamiento.

¿Cómo puedo procesar imágenes multilingües con Tesseract?

El inglés es el idioma principal por defecto. Para cambiarlo, establezca la propiedad Language en su idioma deseado y luego agregue idiomas secundarios según sea necesario.

Las imágenes que contienen texto multilingüe requieren una cuidadosa configuración. A diferencia de los PDFs, las imágenes pueden contener orientaciones de texto variadas, diferentes fuentes y escrituras mixtas. La integración de Tesseract de IronOCR proporciona opciones de configuración de idiomas completas para estos escenarios.

¿Cuándo debo cambiar el idioma predeterminado?

Cambie el idioma predeterminado cuando:

  • La mayor parte del documento está en un idioma distinto del inglés
  • Procesamiento de documentos de una región o país específicos
  • Su aplicación se dirige a usuarios que trabajan con contenidos en lengua no inglesa
  • Optimización de la precisión de reconocimiento para conjuntos de caracteres específicos

He aquí un ejemplo completo de procesamiento de imágenes en varios idiomas:

using IronOcr;
using System;

// Instantiate IronTesseract
IronTesseract ocrTesseract = new IronTesseract();

// Set primary language to Russian
ocrTesseract.Language = OcrLanguage.Russian;
ocrTesseract.AddSecondaryLanguage(OcrLanguage.Japanese);

// Add image
using var imageInput = new OcrImageInput(@"example.png");
// Perform OCR
OcrResult result = ocrTesseract.Read(imageInput);

// Output extracted text to console
Console.WriteLine(result.Text);

Para idiomas personalizados o fuentes especializadas, consulte nuestro tutorial sobre Uso de archivos de idioma personalizados.

¿Qué resultados puedo esperar del OCR multilingüe?

Una configuración adecuada produce resultados como estos:

Aplicación de procesamiento de texto multilíngüe mostrando contenido en ruso y japonés con salida de consola mostrando procesamiento de caracteres

La calidad de los resultados del OCR multilingüe depende de varios factores:

  1. Calidad de imagen: Una resolución más alta (300+ DPI) produce mejores resultados. Consulte nuestra guía Configuración de la DPI.
  2. Claridad del texto: Texto claro y bien definido sin artefactos mejora el reconocimiento preciso
  3. Configuración del idioma: Una configuración adecuada de idiomas primarios y secundarios asegura patrones correctos de reconocimiento de caracteres
  4. Preprocesamiento: Los filtros adecuados mejoran los resultados de forma significativa. Consulte nuestra guía Filtros de corrección de imágenes para conocer las técnicas de mejora.

¿Cuáles son los puntos clave del OCR multilingüe?

IronOCR, que utiliza el motor Tesseract, extrae texto de documentos multilingües con eficacia. Maneja las complejidades de la lectura de texto en muchos idiomas, proporcionando una solución versátil. Tanto si se procesan PDF con varios idiomas como si se trabaja con contenido de imágenes multilingüe, IronOCR simplifica el reconocimiento y la extracción de texto entre idiomas.

Principales ventajas de IronOCR para la extracción de texto en varios idiomas:

  • Soporte extenso de idiomas: Más de 125 idiomas OCR internacionales a través de paquetes NuGet
  • Configuración flexible: API sencilla para configuraciones de idiomas primarios y secundarios
  • Alta precisión: Utiliza los algoritmos de reconocimiento avanzados de Tesseract 5
  • Optimización del rendimiento: Soporte de multihilo incorporado
  • Compatibilidad multiplataforma: Funciona en Windows, Linux y macOS

IronOCR ofrece una solución completa que combina la facilidad de uso con potentes funciones para la implementación de OCR en varios idiomas. Construya sistemas de gestión de documentos, herramientas de traducción o cualquier aplicación que requiera la extracción de texto multilingüe con la flexibilidad y fiabilidad necesarias para el éxito.

Comience su proyecto de OCR multilingüe descargando IronOCR de NuGet y explorando nuestra documentación y ejemplos. Para casos de uso específicos o escenarios avanzados, nuestras guías de resolución de problemas proporcionan información para obtener resultados óptimos.

Preguntas Frecuentes

¿Cómo se realiza el OCR en documentos que contienen varios idiomas?

IronOCR permite configurar el OCR multilingüe con una sola línea de código. Establezca un idioma principal mediante la propiedad Language y añada idiomas secundarios mediante el método AddSecondaryLanguage. Esto permite a IronOCR extraer con precisión texto de documentos que contengan simultáneamente varias escrituras y conjuntos de caracteres.

¿Qué idiomas son compatibles con la extracción de texto?

IronOCR es compatible con más de 125 paquetes de idiomas gracias a su integración con el motor Tesseract. Aunque el inglés se instala por defecto, puede descargar paquetes de idiomas adicionales de NuGet para habilitar las capacidades de OCR para idiomas que van desde el español y el francés hasta el árabe, el chino, el japonés y muchos más.

¿Cómo añado idiomas secundarios para el procesamiento OCR?

Utilice el método AddSecondaryLanguage en IronOCR para habilitar idiomas adicionales. Por ejemplo: new IronTesseract { Language = OcrLanguage.Spanish }.AddSecondaryLanguage(OcrLanguage.French). Esta configuración permite a IronOCR reconocer texto tanto en español como en francés dentro del mismo documento.

¿Puedo extraer texto de PDF multilingües?

Sí, IronOCR puede procesar PDF que contengan varios idiomas. Simplemente configure el motor de OCR con sus idiomas primario y secundario antes del procesamiento. IronOCR gestionará automáticamente las distintas secuencias de comandos y conjuntos de caracteres del PDF, garantizando una extracción de texto precisa en todos los idiomas presentes en el documento.

¿Necesito instalar paquetes de idiomas por separado?

Sí, aunque IronOCR incluye el inglés por defecto, deben instalarse paquetes de idiomas adicionales a través de NuGet. Cada paquete de idioma contiene los datos necesarios para que el motor Tesseract de IronOCR reconozca el texto en ese idioma específico. Puede ver y descargar todos los paquetes de idiomas disponibles en la página de idiomas de IronOCR.

¿Cuál es el flujo de trabajo mínimo para el OCR multilingüe?

El flujo de trabajo mínimo consta de 5 pasos: 1) Descargue la biblioteca IronOCR, 2) Prepare su documento PDF o imagen, 3) Instale los paquetes de idiomas necesarios a través de NuGet, 4) Utilice el método AddSecondaryLanguage para habilitar idiomas adicionales y 5) Establezca la propiedad Language para su idioma principal. Esta configuración permite una extracción de texto multilingüe precisa.

What are the benefits of using IronOCR for multi-language text extraction?

IronOCR offers extensive language support, flexible language configuration, high accuracy with Tesseract 5's algorithms, performance optimization with multithreading, and cross-platform compatibility, making it ideal for applications requiring multilingual text extraction.

¿Listo para empezar?

Nuget Downloads 6,236,385Versión:2026.9recién lanzado

Obtén tu GRATIS

Clave de prueba de 30 días instantáneamente.

bullet_checkedNo se requiere tarjeta de crédito ni creación de cuenta
bullet_testPrueba en producción
sin marcas de agua
bullet_calendarProducto completamente
funcional por 30 días
bullet_supportSoporte técnico 24/5
durante la prueba
Obtenga su Clave de Prueba de 30 días gratis al instante.
No se requiere tarjeta de crédito ni creación de cuenta
Biblioteca C# NuGet para PDF
Instalar con NuGet

Versión: 2026.9

PM > Install-Package IronOcr
nuget.org/packages/IronOcr/
  1. En el Explorador de Soluciones, haga clic derecho en Referencias, Administrar Paquetes NuGet
  2. Selecciona Examinar y busca "IronOCR"
  3. Seleccione el paquete e instale
C# PDF DLL
Descargar DLL

Versión: 2026.9

o descargar el instalador de Windows aquí.

  1. Descarga y descomprime IronOCR en una ubicación como ~/Libs dentro de tu directorio de Solución
  2. En Visual Studio Solution Explorer, haz clic derecho en Referencias. Selecciona Examinar, "IronOCR.dll"

Licencias desde $999

Key in blue circle

Obtenga su clave de prueba gratuita de 30 días al instante.

Your trial license will be sent to your email address

Sin limitaciones. 100 % desbloqueado. Sin tarjeta de crédito.

bullet_checkedNo se requiere tarjeta de crédito ni creación de cuentaSin limitaciones. 100 % desbloqueado. Sin tarjeta de crédito.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
Obtén tu Consulta Sin Compromiso
Completa el formulario a continuación o envía un correo a sales@ironsoftware.com
Tus detalles siempre serán mantenidos confidenciales.
Confiado por millones de ingenieros en todo el mundo
Logos de clientes de Iron Software
Obtenga su Clave de Prueba de 30 días gratis al instante.
No se requiere tarjeta de crédito ni creación de cuenta