Espaces blancs inattendus dans IronOCR
Le texte extrait contient parfois des espaces blancs supplémentaires entre les caractères, même lorsque le document source semble propre. Le coupable habituel est la variation dans la largeur et l'espacement des caractères, souvent lié à la police d'entrée, et les filtres d'image seuls n'y remédient que rarement.

Les approches suivantes ont prouvé leur efficacité pour éviter les espaces supplémentaires.
Solution
1. Passez à une police favorable à l'OCR
Rendez ou fournissez le document en Roboto où vous le pouvez. C'est une police moderne et propre qui lit de manière fiable, donc le moteur produit moins d'espaces factices qu'il ne le fait avec des polices comme Arial.
2. Utilisez ReadDocumentAdvanced()
Lisez le document avec ReadDocumentAdvanced() au lieu de la méthode de lecture standard. Cela vous donne plus de contrôle sur le processus OCR et gère mieux les mises en page de texte complexes.
3. Définissez OcrLanguage.EnglishBest
Dirigez le moteur sur le modèle OcrLanguage.EnglishBest. Ce modèle de langue avancé est plus précis que l'option anglaise standard et réduit l'espacement mal lu.
4. Entraînez une police personnalisée
Lorsque le PDF d'entrée utilise une police inhabituelle ou non standard, les paramètres par défaut peuvent avoir du mal et insérer des espaces. Entraîner une police personnalisée apprend au moteur à reconnaître cette police spécifique, ce qui affine considérablement la reconnaissance. Voir le guide d'entraînement de police personnalisée OCR pour tout le flux de travail.
Avec ces paramètres appliqués, le texte extrait revient sans les espaces errants :


