Espacios en blanco inesperados en IronOCR
El texto extraído a veces contiene espacios en blanco adicionales entre caracteres, incluso cuando el documento fuente parece limpio. El culpable habitual es la variación en el ancho y espacio entre caracteres, a menudo vinculado a la fuente de entrada, y los filtros de imagen solos rara vez lo solucionan.

Los siguientes enfoques han demostrado ser efectivos para evitar los espacios adicionales.
Solución
1. Cambia a una fuente amigable para OCR
Renderiza o entrega el documento en Roboto donde sea posible. Es un tipo de letra limpia y moderna que se lee de manera confiable, por lo que el motor produce menos espacios espurios que con fuentes como Arial.
2. Usa ReadDocumentAdvanced()
Lee el documento con ReadDocumentAdvanced() en lugar del método de lectura estándar. Te da más control sobre el proceso OCR y maneja mejor los diseños complejos de texto.
3. Configura OcrLanguage.EnglishBest
Apunta el motor al modelo OcrLanguage.EnglishBest. Este modelo de lenguaje avanzado es más preciso que la opción estándar en inglés y reduce los espacios mal interpretados.
4. Entrena una fuente personalizada
Cuando el PDF de entrada usa una fuente inusual o no estándar, la configuración predeterminada puede tener dificultades e insertar espacios. Entrenar una fuente personalizada enseña al motor a reconocer ese tipo de letra específico, lo que mejora considerablemente el reconocimiento. Consulta la guía de entrenamiento de fuentes personalizadas de OCR para el flujo de trabajo completo.
Con estas configuraciones aplicadas, el texto extraído vuelve sin el espaciado errante:


