Espaços em Branco Inesperados no IronOCR
O texto extraído às vezes contém espaços em branco extras entre caracteres, mesmo quando o documento de origem parece limpo. O culpado usual é a variação na largura e espaçamento dos caracteres, geralmente associada à fonte de entrada, e os filtros de imagem raramente resolvem isso.

As seguintes abordagens se mostraram eficazes para evitar os espaços extras.
Solução
1. Mudar para uma Fonte Amigável ao OCR
Renderize ou forneça o documento em Roboto onde puder. É uma fonte limpa e moderna que lê de forma confiável, então o mecanismo produz menos espaços espúrios do que com fontes como Arial.
2. Use ReadDocumentAdvanced()
Leia o documento com ReadDocumentAdvanced() em vez do método de leitura padrão. Isso lhe dá mais controle sobre o processo de OCR e lida melhor com layouts de texto complexos.
3. Defina OcrLanguage.EnglishBest
Direcione o motor ao modelo OcrLanguage.EnglishBest. Este modelo de linguagem avançado é mais preciso do que a opção padrão em inglês e reduz o espaçamento mal lido.
4. Treine uma Fonte Personalizada
Quando o PDF de entrada usa uma fonte incomum ou não padrão, as configurações padrão podem ter dificuldades e inserir espaços. Treinar uma fonte personalizada ensina o motor a reconhecer essa tipografia específica, o que aprimora o reconhecimento consideravelmente. Veja o guia de treinamento de fonte personalizada de OCR para o fluxo de trabalho completo.
Com essas configurações aplicadas, o texto extraído volta sem o espaçamento indesejado:


