IRONSOFTWAREHOME

Texte brouillé dans les PDF interrogeables pour les scripts non latins

Curtis Chau
Curtis Chau
Updated: 3 juillet 2026

Effectuez une OCR d'un document avec IronOCR, enregistrez-le sous forme de PDF interrogeable, et le texte reconnu peut sembler correct à l'écran mais devient du charabia lorsque vous le copiez ou l'extrayez. Cela se produit lorsque la police du PDF n'a pas de glyphes pour le script que vous avez reconnu, et c'est courant avec les scripts non latins et complexes. La solution est d'enregistrer le PDF avec une police qui prend en charge votre script ; l'exemple ci-dessous utilise le gujarati.

Le texte reconnu n'a pas de caractères correspondants pour s'y associer, donc le texte copié devient brouillé même si l'OCR a correctement lu la page. Une police uniquement latine ne résoudra pas cela : la police que vous fournissez doit couvrir le script que vous avez réellement reconnu.

Prérequis

  • IronOCR avec le pack linguistique pour votre script. Cet exemple utilise OcrLanguage.GujaratiBest.
  • Une police TrueType qui prend en charge votre script cible. Cet exemple utilise AnekGujarati, disponible gratuitement sur Google Fonts.
  • Le chemin complet du fichier vers cette police.
Veuillez noter: Requiert la version 2026.3.3 ou ultérieure d'IronOCR.

Solution

1. Placez une police qui couvre votre script

Trouvez une police qui inclut les glyphes pour votre script cible, mettez-la sur la machine et notez son chemin complet. Pour l'exemple en gujarati :

C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf
Text

Le nom de fichier de police à variables AnekGujarati contient une virgule, donc copiez-le précisément. Le chemin doit pointer vers le fichier de police exact.

2. Passez la police à SaveAsSearchablePdf

Lorsque vous enregistrez le PDF interrogeable, fournissez le chemin vers votre police compatible avec le script en tant que CustomFontFile (3e) argument. Le 4e argument est un label CustomFontName optionnel ; si vous l'omettez, IronOCR utilise le nom même du fichier de police :

ocrResult.SaveAsSearchablePdf(
    strOutputFile,
    false,
    @"C:\Path\To\AnekGujarati-VariableFont_wdth,wght.ttf",
    "AnekGujarati");
C#

L'argument qui corrige l'extraction brouillée est le fichier de police (3e paramètre) : il doit contenir des glyphes pour le script que vous avez OCRisé. Le 4e paramètre ne nomme que la police intégrée et n'affecte pas la cartographie du script. Pour un autre document, pointez le 3e paramètre vers une police qui prend en charge ce script.

3. Confirmez les extraits de texte

Ouvrez le PDF généré et copiez le texte reconnu pour vérifier qu'il s'extrait correctement. S'il apparaît toujours brouillé, la police fournie manque presque certainement de glyphes pour votre script ; revérifiez que la police le couvre réellement.

Remarques

  • Pas spécifique au gujarati : tout script non latin ou complexe peut montrer du texte copié brouillé lorsque la police du PDF ne le couvre pas, y compris le devanagari (hindi, marathi), l'arabe, le thaï et le texte chinois, japonais ou coréen.
  • Une police par script : fournissez une police qui inclut le script que vous avez reconnu. La famille Noto de Google est une option large, avec des polices par script comme Noto Sans Gujarati, Noto Sans Devanagari, et Noto Sans Arabic.
Curtis Chau
Rédacteur technique

Curtis Chau détient un baccalauréat en informatique (Université de Carleton) et se spécialise dans le développement front-end avec expertise en Node.js, TypeScript, JavaScript et React. Passionné par la création d'interfaces utilisateur intuitives et esthétiquement plaisantes, Curtis aime travailler avec des frameworks modernes et créer des manuels bien structurés et visuellement attrayants.

...
Lire la suite

Prêt à commencer?

Nuget Downloads 6,236,385Version :2026.9vient de sortir

Obtenez votre clé d'essai 30 jours gratuitement.
Aucune carte de crédit ou création de compte requise
Bibliothèque C# NuGet pour PDF
Installer avec NuGet

Version : 2026.9

PM > Install-Package IronOcr
nuget.org/packages/IronOcr/
  1. Dans l'explorateur de solutions, faites un clic droit sur Références, Gestion des packages NuGet
  2. Sélectionnez Parcourir et cherchez "IronOCR"
  3. Sélectionnez le package et installez
C# PDF DLL
Télécharger DLL

Version : 2026.9

ou téléchargez le programme d'installation Windows ici.

  1. Téléchargez et décompressez IronOCR à un emplacement tel que ~/Libs dans votre répertoire du projet
  2. Dans l'Explorateur de Solutions de Visual Studio, faites un clic droit sur Références. Sélectionnez Parcourir, "IronOCR.dll"

Licences à partir de $999

Vous avez une question ? Contactez notre équipe de développement.

Key in blue circle

Obtenez votre clé d'essai de 30 jours instantanément.

Your trial license will be sent to your email address

Aucune restriction. 100 % débloqué. Pas de carte bancaire.

bullet_checkedAucune carte de crédit ou création de compte requiseAucune restriction. 100 % débloqué. Pas de carte bancaire.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
Obtenez Votre Consultation sans Engagement
Remplissez le formulaire ci-dessous ou envoyez un email à sales@ironsoftware.com
Vos informations seront toujours gardées confidentielles.
De confiance par des millions d'ingénieurs dans le monde entier
Logos des clients d'Iron Software
Obtenez votre clé d'essai 30 jours gratuitement.
Aucune carte de crédit ou création de compte requise