Produit
Extraire des factures en arabe, en français et en écritures mixtes
Une même facture peut mêler un fournisseur en arabe, des libellés en anglais et deux systèmes de chiffres. C'est d'abord un problème de mise en page, avant d'être un problème de reconnaissance de caractères.
EasyInvoiceOCR · Publié le · Mis à jour le · 9 min de lecture
Une facture émise à Riyad peut comporter les coordonnées du fournisseur en arabe, les désignations d'articles en anglais, des chiffres arabes orientaux dans l'en-tête et des chiffres occidentaux dans le tableau des totaux. Chacune de ces ruptures est un endroit où un analyseur conçu pour une seule écriture se trompe sans le signaler.
L'ordre de lecture n'est pas l'ordre visuel
Dans un document de droite à gauche, le libellé se place à droite de sa valeur. Un analyseur qui suppose un appariement de gauche à droite rattache chaque libellé au mauvais champ — et l'affirme avec assurance, car la reconnaissance des caractères, elle, a parfaitement fonctionné. Seul l'appariement a échoué.
C'est pourquoi la mise en page doit être résolue à partir des coordonnées, et non du seul ordre de lecture. Le bon libellé est celui qui est le plus proche de la valeur dans le sens où le document s'écrit réellement.
Deux systèmes de chiffres sur une même page
Les chiffres arabes orientaux doivent être normalisés avant tout contrôle arithmétique, et il est fréquent de rencontrer les deux systèmes sur une même facture : l'un dans l'en-tête, l'autre dans le tableau. Les chiffres sont ramenés à la forme occidentale et les dates au format ISO 8601 avant le début des vérifications, afin qu'aucune comparaison ne porte sur deux notations différentes.
Une date ambiguë est refusée, pas devinée
Une date notée 03/04/2026 désigne le 3 avril ou le 4 mars selon le pays d'émission. Lorsque le format ne peut pas être établi à partir du document lui-même, le champ est signalé plutôt que tranché par hypothèse. Une date devinée qui se révèle fausse coûte plus cher qu'une date laissée vide.
Valider par l'arithmétique plutôt que par la confiance
Le meilleur indice qu'une extraction multilingue est correcte n'est pas le score de reconnaissance, c'est la cohérence des montants. Quand les lignes s'additionnent au sous-total et que le sous-total augmenté de la taxe donne le total, l'extraction est presque certainement juste, quelle que soit l'écriture d'origine.
Cinq conversions offertes. Rien ne quitte votre navigateur pendant la reconnaissance.
Articles liés
- Précision
Précision d'un OCR de factures : ce que le chiffre signifie vraiment
Les taux annoncés sont rarement comparables. Comment se mesure la précision par champ, et comment la tester sur vos propres factures.
- Précision
Pourquoi extraire les lignes est plus difficile que lire le total
Les totaux occupent des emplacements prévisibles, pas les tableaux. Colonnes sans filets, libellés qui débordent et sauts de page : le vrai test d'un analyseur.