Aller au contenu

← Blog Billify

OCR de factures : comment fonctionne la lecture automatique ?

5 juillet 2026 · 6 min de lecture

Ressaisir une facture à la main prend une à trois minutes : identifier le fournisseur, recopier le montant HT, vérifier la TVA, noter le numéro de pièce. Multiplié par 50 ou 200 factures par mois, cela représente des journées entières de saisie — avec les inévitables fautes de frappe qui coûtent cher au moment de la déclaration de TVA.

L'OCR de factures promet l'inverse : vous déposez vos PDF, scans ou photos, et vous récupérez quelques secondes plus tard un tableau structuré avec le fournisseur, la date, les montants et le compte comptable. Mais que se passe-t-il concrètement entre le dépôt du fichier et l'export Excel ? Voici la chaîne technique, étape par étape et sans jargon inutile.

L'OCR de facture, c'est quoi exactement ?

OCR signifie Optical Character Recognition, reconnaissance optique de caractères. Appliqué aux factures, le terme recouvre deux opérations distinctes : transformer une image (scan, photo, PDF) en texte lisible par une machine, puis comprendre ce texte pour en extraire les informations utiles à la comptabilité.

La nuance est importante. Lire « TVA 20 % : 240,00 € », n'importe quel logiciel d'OCR sait le faire depuis vingt ans. Comprendre que ces 240 € sont la TVA déductible d'une facture d'achat, qu'ils doivent être cohérents avec un HT de 1 200 €, et que la charge relève du compte 6156, c'est une autre affaire — et c'est là que se joue la différence entre les outils.

Les 5 étapes de la lecture automatique d'une facture

1. Numérisation et préparation de l'image

Tout commence par un fichier : PDF natif, scan ou photo de smartphone. Si le document est une image, il est d'abord nettoyé : redressement de la page, amélioration du contraste, suppression du bruit. Sur un PDF natif, le texte est déjà présent dans le fichier et peut être extrait directement, sans OCR au sens strict — plus rapide et plus fiable.

2. Reconnaissance des caractères

Le moteur d'OCR analyse l'image et identifie chaque caractère : lettres, chiffres, symboles monétaires. À ce stade, on obtient du texte brut, en vrac, sans aucune structure.

3. Extraction des champs : fournisseur, date, HT, TVA, TTC

C'est le cœur de l'extraction de données de facture. Le système doit repérer, dans ce texte brut, les informations qui comptent :

  • le nom du fournisseur, idéalement avec son SIREN ;
  • la date d'émission et l'échéance ;
  • le numéro de facture, indispensable pour détecter les doublons ;
  • les montants HT, TVA et TTC, parfois ventilés par taux (20 %, 10 %, 5,5 %) ;
  • la devise et le libellé des prestations.

La difficulté ? Aucune facture ne se ressemble : le total TTC peut s'appeler « Total », « Net à payer » ou « Montant dû », et le fournisseur apparaître en haut de page, dans un logo ou dans les mentions légales.

4. Contrôles de cohérence

Un bon outil ne se contente pas d'extraire : il vérifie. Le contrôle le plus simple est arithmétique : HT + TVA doit être égal au TTC. Si le système lit 1 200 € HT, 240 € de TVA et 1 400 € TTC, quelque chose cloche — probablement une erreur de lecture sur un chiffre. S'y ajoutent d'autres vérifications : taux de TVA légal en France, date plausible, total des lignes égal au total de la facture. De quoi signaler les cas douteux plutôt que de laisser passer une erreur silencieuse.

5. Classification comptable selon le PCG

Dernière étape, la plus « métier » : proposer un compte du Plan Comptable Général. Une facture d'électricité ira en 6061, un abonnement logiciel en 6265, des honoraires d'avocat en 6226. Cette imputation peut être largement automatisée dès lors que le système comprend la nature de la dépense. Le résultat final est un fichier structuré — chez Billify, un export Excel aux colonnes du PCG, directement réutilisable dans Cegid, Sage, Pennylane ou Quadratus.

OCR classique ou IA spécialisée : quelle différence ?

L'OCR « classique » fonctionne par gabarits : on lui apprend que, pour tel fournisseur, le total se trouve en bas à droite et la date en haut. Cela fonctionne… tant que la facture ressemble au modèle : nouveau fournisseur, nouvelle mise en page, et l'extraction échoue.

Les modèles d'IA récents — notamment les grands modèles de langage spécialisés dans les documents — lisent la facture comme le ferait un humain, en s'appuyant sur le sens et le contexte plutôt que sur la position des éléments. Un montant précédé de « Net à payer » sera reconnu comme le TTC même si l'outil n'a jamais vu ce fournisseur. Résultat : plus de gabarits à maintenir et une bien meilleure tolérance aux mises en page inhabituelles.

Cette puissance a une contrepartie : beaucoup de solutions envoient vos factures aux API de géants américains — pas anodin pour des documents qui contiennent vos prix d'achat et vos fournisseurs. C'est pourquoi Billify fait tourner ses propres modèles sur des GPU hébergés en France, à Gravelines : aucune donnée n'est transmise à OpenAI, Google ou Anthropic, comme le détaille notre politique de confidentialité.

Les cas difficiles : scans flous, factures multi-pages, notes de frais

La lecture automatique de factures n'est pas magique, et certains documents résistent plus que d'autres.

  • Les scans de mauvaise qualité : photocopie de photocopie, ticket thermique à moitié effacé, photo prise de biais. Le prétraitement aide beaucoup, et l'IA compense en partie grâce au contexte — elle peut retrouver un 8 dégradé si le calcul HT + TVA le confirme. Mais un document illisible pour un humain le restera pour la machine.
  • Les factures multi-pages : une facture de quatre pages avec le récapitulatif à la fin doit être traitée comme un tout, pas page par page. Autre piège : un scan qui empile plusieurs factures dans un seul PDF — il faut d'abord détecter où finit l'une et où commence la suivante.
  • Les notes de frais : tickets de restaurant froissés, reçus de péage, TVA à taux multiples sur un même ticket (10 % sur les plats, 20 % sur l'alcool). Les documents les plus courts, mais souvent les plus retors.

C'est sur ces cas que l'écart entre OCR basique et IA spécialisée se voit le plus.

Quelle fiabilité attendre d'un OCR de facture ?

Sur des PDF natifs propres, une bonne solution extrait correctement la quasi-totalité des champs. Sur des scans corrects, la fiabilité reste élevée ; elle diminue sur les photos dégradées et les tickets. Deux réflexes pour évaluer un outil :

  1. Testez avec vos vraies factures — vos fournisseurs, vos scans, vos cas tordus — pas avec des exemples de démonstration.
  2. Exigez des contrôles de cohérence visibles : un outil qui signale « HT + TVA ≠ TTC, à vérifier » vaut mieux qu'un résultat faux affiché avec assurance.

Côté budget, le modèle le plus lisible est la tarification à la page : chez Billify, 1 crédit = 1 page analysée, sans abonnement imposé — le détail est sur la page tarifs.

En résumé

Derrière « OCR de factures » se cache une chaîne complète : préparation de l'image, reconnaissance du texte, extraction des champs, contrôles arithmétiques et classification au PCG. L'IA spécialisée l'a rendue robuste face à la diversité réelle des factures — à condition de choisir un outil qui traite vos données avec sérieux, hébergement en France compris.

Le plus simple pour vous faire une idée reste d'essayer l'analyse avec vos propres documents : Billify vous offre 100 pages gratuites à l'inscription, sans carte bancaire.

Essayez Billify sur vos propres factures

100 pages offertes à l'inscription, sans carte bancaire. Hébergé en France, conforme RGPD.

Créer mon compte →