Niespodziewane białe spacje w IronOCR
Wyodrębniony tekst czasami zawiera dodatkowe białe spacje między znakami, nawet gdy dokument źródłowy wygląda na czysty. Zazwyczaj przyczyną jest różnorodność szerokości i odstępów między znakami, często związana z czcionką wejściową, a same filtry obrazu rzadko rozwiązują ten problem.

Poniższe podejścia okazały się skuteczne w unikaniu dodatkowych spacji.
Rozwiązanie
1. Przełącz na czcionkę przyjazną dla OCR
Renderuj lub dostarczaj dokument w Roboto gdziekolwiek możesz. Jest to czysta, nowoczesna czcionka, która odczytuje się niezawodnie, więc silnik generuje mniej fałszywych spacji niż fonty takie jak Arial.
2. Użyj ReadDocumentAdvanced()
Przeczytaj dokument za pomocą ReadDocumentAdvanced() zamiast standardowej metody odczytu. Daje większą kontrolę nad procesem OCR i lepiej obsługuje skomplikowane układy tekstu.
3. Ustaw OcrLanguage.EnglishBest
Wskaż silnikowi model OcrLanguage.EnglishBest. Ten zaawansowany model języka jest bardziej dokładny niż standardowa opcja angielska i redukuje błędy w odczytywaniu spacji.
4. Wytrenuj niestandardową czcionkę
Kiedy wejściowy PDF używa nietypowej lub niestandardowej czcionki, domyślne ustawienia mogą mieć kłopoty i wstawiać spacje. Trenowanie niestandardowej czcionki uczy silnik rozpoznawania tego specyficznego kroju pisma, co znacznie poprawia dokładność rozpoznawania. Zapoznaj się z przewodnikiem dla OCR trenującym niestandardowe czcionki dla pełnego przepływu pracy.
Z zastosowanymi tymi ustawieniami, wyodrębniony tekst wraca bez zbędnych spacji:


