Support de Reconnaissance de Marques Optiques (OMR)
IronOCR lit le texte imprimé et manuscrit à partir de PDFs, images et documents numérisés. Il ne détecte pas encore les marques comme les cases à cocher cochées, les bulles remplies ou les boutons radio sélectionnés. Cette fonctionnalité est la Reconnaissance de Marques Optiques (OMR), une technologie distincte de la reconnaissance de caractères qu'IronOCR fournit.
Ce que fait l'OMR
L'OMR détecte la présence ou l'absence d'une marque dans une zone prédéfinie d'un formulaire, sans lire aucune lettre ou chiffre. C'est l'approche standard pour des mises en page comme :
- Examens à choix multiples
- Cases à cocher de sondage
- Bulletins de vote
- Formulaires de retour d'information
Là où l'OCR renvoie des caractères (Z, 9), l'OMR renvoie un booléen : une zone est soit remplie, soit elle ne l'est pas. Décisions typiques qu'il prend :
- Si une case est cochée.
- Quelle bulle (
D) est remplie. - Si un bouton radio est sélectionné.
- Comment un utilisateur a marqué le formulaire avec un stylo, un crayon ou une autre entrée non-numérique.
L'OMR fonctionne mieux quand le design du formulaire est connu et cohérent, avec des zones clairement définies pour chaque marque.
OMR vs OCR
Les deux technologies résolvent des problèmes différents et sont souvent nécessaires ensemble dans le traitement de formulaires.
- Objectif : OCR lit et convertit le texte ; L'OMR détecte la présence d'une marque.
- Sortie : OCR produit des caractères ; L'OMR produit un booléen sélectionné/non-sélectionné.
- Utilisation typique : OCR gère les factures, documents et livres ; L'OMR gère les enquêtes, examens et listes de contrôle.
- Exigences d'entrée : OCR gère les polices de texte et l'écriture manuscrite ; L'OMR nécessite des mises en page propres avec des cases à cocher définies.
- Technique sous-jacente : OCR repose sur la segmentation des caractères et le traitement du langage ; L'OMR repose sur la numérisation des zones géométriques et le seuillage.
Statut actuel dans IronOCR
IronOCR ne supporte pas officiellement l'OMR. La bibliothèque se spécialise dans la reconnaissance textuelle et la lecture de mise en page, et la détection de marque est un paradigme différent qui n'est pas directement disponible aujourd'hui.
La demande pour cette fonctionnalité a augmenté régulièrement à travers les tickets clients et les demandes de fonctionnalité.
Feuille de route
L'équipe IronOCR a enregistré de multiples demandes de fonctionnalités pour l'OMR et évalue la meilleure façon d'ajouter la détection de cases à cocher et de boutons radio à la bibliothèque. Le développement du support de l'OMR est sur la feuille de route, mais n'est pas encore en cours de diffusion.

