Du PDF au tableau : fiabiliser l’extraction de données avec l’IA

Une feuille sculptée dans la pierre se transforme en grille de compartiments, dont un accueille un bloc métallique sombre.

Vos équipes recopient des références, des quantités ou des délais depuis des PDF vers un tableau. L’IA peut préparer cette saisie. Le résultat mérite cependant une vérification : une valeur bien rangée dans une colonne peut encore correspondre à la mauvaise ligne ou avoir perdu son unité.

Prenons un exemple fictif. Une PME qui distribue du matériel reçoit des devis de plusieurs fournisseurs. Elle souhaite préparer un tableau de comparaison avant de décider quoi commander. L’objectif du pilote est de produire une proposition de saisie traçable, que l’équipe achats peut contrôler rapidement.

Définir précisément les informations attendues

Avant de choisir un outil, construisez le tableau cible avec ses utilisateurs. Pour chaque colonne, précisez ce qu’elle contient, son format et le traitement prévu lorsque l’information manque.

Dans notre PME fictive, le tableau conserve une ligne par article proposé et rattache chaque ligne au fournisseur, au numéro du devis et à la page source. Une même référence peut figurer plusieurs fois avec des conditionnements différents : la règle doit en tenir compte.

Voici un exemple entièrement fictif de données et de règles :

Information dans le devis

Règle pour le tableau

Référence « A-047 »

Conserver les caractères et le zéro initial.

Quantité « 12 unités »

Séparer la quantité et l’unité, en gardant le texte source.

Prix « 18,50 € HT / unité »

Distinguer montant, devise, base HT et unité de prix.

Délai « Sous trois semaines »

Conserver cette durée sans inventer une date de livraison.

Mention absente ou illisible

Signaler le problème avec un statut explicite.

Cette définition évite de laisser chaque personne interpréter les colonnes différemment. Si plusieurs usages documentaires sont envisagés, notre guide de l’audit IA en entreprise aide à choisir le premier périmètre.

Vérifier comment le document est lu

Le traitement doit préserver les relations entre les informations. Une quantité placée sous une référence, une note en bas de page ou un tableau poursuivi sur la page suivante peuvent changer l’interprétation d’une offre.

Les outils d’analyse documentaire peuvent combiner reconnaissance optique des caractères, ou OCR, et analyse de la mise en page. Le modèle Layout de Microsoft Document Intelligence extrait notamment du texte, des tableaux et leur structure. Cette capacité doit être testée sur vos propres documents. Source : analyse de la mise en page, Microsoft Learn.

Rassemblez des PDF issus de vos fournisseurs habituels, des scans et des documents comportant plusieurs pages. Vérifiez visuellement quelques résultats : le prix appartient-il au bon article ? Une remise est-elle rattachée à la bonne ligne ? Les mentions communes restent-elles accessibles ?

Conservez le document original avec un lien vers la page concernée. Si l’outil fournit la zone d’où provient la valeur, utilisez-la dans l’écran de contrôle. La personne chargée de vérifier pourra retrouver l’information sans parcourir tout le dossier.

Donner une structure stable au résultat

Une sortie structurée définit les champs attendus et les types de valeurs autorisés. Certains services permettent de décrire ce format avec un schéma JSON, une spécification lisible par le logiciel. La documentation Gemini présente ce mécanisme et demande de contrôler les valeurs dans l’application, même lorsque le JSON est valide. Source : sorties structurées, Google AI for Developers.

Pour notre tableau, nous proposons de conserver côte à côte la valeur d’origine, la valeur normalisée et son statut. Le texte « 18,50 € HT / unité » peut ainsi devenir un montant numérique accompagné de ses attributs, tout en restant consultable.

Prévoyez des statuts distincts pour une donnée trouvée, absente, illisible ou contradictoire. Une case vide ne permet pas, à elle seule, de comprendre ce qui s’est passé. Les transformations autorisées doivent être décrites avec l’équipe métier.

Ajouter des contrôles adaptés au métier

Une fois les données extraites, appliquez des vérifications simples et explicites. Dans notre exemple, la référence proposée existe-t-elle dans le catalogue utilisé pour la comparaison ? La devise est-elle indiquée ? Le montant présenté concerne-t-il une unité ou un lot ?

Séparez les contrôles de format et les contrôles de cohérence. Le premier peut confirmer qu’une quantité est numérique. Le second vérifie si cette quantité se rapporte au conditionnement attendu. Une valeur peut réussir le premier contrôle et nécessiter une relecture au second.

Pour la ligne fictive de 12 unités à 18,50 € HT, le produit donne 222 € HT avant toute remise ou frais. Si le document présente un autre montant, faites examiner l’écart en tenant compte des conditions du devis. L’application doit signaler ce qu’elle compare et les hypothèses utilisées.

Définissez aussi les contrôles qui empêchent l’utilisation d’une ligne. Une référence incertaine peut justifier une vérification préalable, tandis qu’une information descriptive facultative peut rester vide. Ces décisions appartiennent au responsable du processus.

Mesurer les erreurs sur un jeu de documents réservé au test

Faites préparer des réponses de référence par une personne qui connaît les documents. Elle relève les valeurs attendues et indique celles qui doivent rester absentes ou incertaines. Conservez un ensemble de documents qui ne servira pas à ajuster les consignes ou le modèle.

Google Document AI évalue les extractions en comparant les données prédites aux annotations des documents de test. Sa documentation distingue notamment la précision, qui mesure la part des prédictions correspondant aux annotations, et le rappel, qui mesure la part des annotations correctement retrouvées. Source : évaluer les performances, Google Cloud.

Pour le pilote, examinez les résultats par champ. Comptez les références erronées, les quantités manquantes, les unités confondues et les lignes oubliées. Vérifiez également combien de documents restent utilisables sans correction sur les informations que vous jugez essentielles.

Incluez des variations qui posent réellement problème à l’équipe : fournisseur peu fréquent, note manuscrite, tableau sur plusieurs pages ou changement de présentation. Notez les cas non pris en charge pour définir le périmètre du service.

Organiser une relecture qui aide à décider

Certains outils produisent des scores de confiance. Microsoft recommande d’évaluer ces scores sur un pilote représentatif pour déterminer les seuils de traitement automatique et de revue humaine. Le seuil utile dépend donc des documents et du scénario. Source : évaluation de Document Intelligence, Microsoft Learn.

Dans notre exemple, nous proposons de soumettre les lignes à l’équipe achats pendant le pilote. L’écran présente la valeur extraite, sa source et le motif de la vérification : information absente, incohérence détectée ou lecture incertaine.

Enregistrez les corrections avec leur cause. Une unité mal interprétée peut demander une meilleure règle de normalisation ; une mauvaise lecture peut demander un document plus lisible. Cette distinction permet de cibler l’amélioration suivante.

Lorsque les résultats deviennent suffisamment solides au regard des critères définis, l’équipe peut décider quelles situations accepter automatiquement. Continuez à examiner un échantillon de ces résultats et réévaluez le comportement lorsque les formats ou les outils évoluent.

Décider du déploiement avec le coût du contrôle

Mesurez le temps du parcours complet : préparation des fichiers, extraction, vérification, correction et transfert dans l’outil final. Comparez-le au traitement habituel des mêmes types de documents. Ajoutez les coûts d’exploitation et de maintenance, comme le propose notre guide des indicateurs de ROI d’un projet IA.

Choisissez ensuite une étape suivante limitée : élargir à une famille de documents, corriger un type d’erreur ou prolonger les essais. Pour notre PME fictive, un pilote réussi doit permettre de préparer le tableau de comparaison avec une qualité connue et un effort de contrôle mesuré.

Vous souhaitez exploiter les informations contenues dans vos PDF ? Présentez votre cas à Studio UNIQ pour définir les données attendues, les contrôles utiles et le périmètre d’un premier pilote.

Create a free website with Framer, the website builder loved by startups, designers and agencies.