For the complete documentation index, see llms.txt. This page is also available as Markdown.

Bonnes pratiques pour le Schéma de données

Bonnes pratiques pour concevoir un Schéma de données qui améliore la précision de l’extraction.

Nous vous recommandons de commencer par consulter Aperçu du Schéma de données cela d'abord. Cela vous aidera à comprendre les termes utilisés sur cette page.

Pour obtenir les meilleures données d'extraction possibles à partir d'un modèle, l'essentiel est de vous assurer que le Schéma de données que vous utilisez est clair et optimisé.

Toute fonctionnalité supplémentaire que vous activez pour augmenter la précision, comme Apprentissage continu (RAG) ou Score de confiance et exactitude améliorée dépendra fortement du Schéma de données.

Optimisation automatisée

Avant de modifier les champs manuellement, nous vous recommandons fortement d'exécuter d'abord l'outil d'optimisation assisté par IA.

L'outil analysera vos documents et déterminera dans quelle mesure le Schéma de données leur convient. À partir de là, il vous proposera des suggestions pour améliorer la précision des extractions.

Le processus est entièrement automatisé, vous n'avez qu'à fournir quelques documents d'exemple.

Exécution de l'analyse

Pour lancer l'analyse, téléversez d'abord au moins 5 documents à l'aide du Live test.

Ensuite, allez à la page Schéma de données et cliquez sur le bouton « Assistant IA » :

AI Assistant Button

Dans la boîte de dialogue, cliquez sur le bouton « » (icône de baguette magique) :

AI Assistant Auto Optimize Button

Vous pouvez maintenant vous détendre, prendre une tasse de thé et attendre que l'analyse se termine.

Le Schéma de données du modèle sera temporairement verrouillé pendant ce processus. Vous pouvez quitter sans risque la page du modèle ; l'analyse continuera en arrière-plan.

Application des résultats de l'analyse

Une fois l'analyse terminée, la fenêtre de discussion se remplira de toutes les améliorations proposées.

Pour chaque champ, vous verrez :

  • une case à cocher

  • la description et les consignes actuelles de "Baseline", en rouge

  • les changements proposés "Optimized", en vert

Pour appliquer les changements proposés, cochez chaque champ pour lequel vous souhaitez appliquer les changements.

Lorsque vous aurez sélectionné tous les champs que vous souhaitez modifier, cliquez sur le bouton « Appliquer la sélection » :

AI Assistant Optimize Apply Changes Button

Vous recevrez un message de confirmation dans la fenêtre de dialogue une fois les changements appliqués.

Tester le Schéma de données optimisé

Pour tester et valider les changements, rendez-vous dans le Live test, puis cliquez sur l'onglet « Historique des documents ».

De là, ouvrez les documents et cliquez sur le bouton « Relancer le document » (c'est une icône de redémarrage) :

Rerun the Document Button

Bonnes pratiques pour les champs

Le cœur du Schéma de données. Les différentes propriétés des champs jouent toutes un rôle pour obtenir la meilleure précision possible.

Nom et titre du champ

Le champ Nom est généré automatiquement à partir du champ Titre. Vous pouvez également modifier le Titre ensuite.

Le Nom et Titre sont utilisés pendant le traitement (l'inférence).

Utilisez des noms clairs et simples qui décriront précisément le champ que vous souhaitez extraire. L'objectif est d'éviter toute confusion possible entre les points de données présents dans le document.

À titre d'exemple, extrayons le nom de l'entreprise qui a émis une facture.

Dans notre Schéma de données, nous avons utilisé le champ Nom: supplier_name Cela indique clairement au modèle qu'il doit extraire uniquement le nom du fournisseur de la facture.

vous pouvez également utiliser vendor_name, cela a une signification similaire et une précision équivalente.

⚠️ supplier pourrait fonctionner, mais c'est trop large : de quelles informations sur le fournisseur a-t-on exactement besoin ?

⚠️ company_name pourrait fonctionner, mais c'est ambigu : nous savons que vous avez besoin du nom de l'entreprise, mais nous ne savons pas si l'entreprise désigne le fournisseur ou le client.

company ne fonctionnera probablement pas comme prévu : nous ne savons ni quelles informations vous avez besoin, ni quelle entreprise est concernée.

Type de champ

Essayez d'utiliser l'un des types de champs qui correspond le mieux à l'utilisation du champ et à la façon dont il apparaît dans le document.

Par exemple, bien que vous puissiez utiliser une chaîne pour due_date, un type de champ de date est nettement préférable.

Description du champ

La Description du champ a un impact sur les performances du modèle.

Utilisez-la pour décrire ce que représente le champ et/ou à quoi il vous sert.

Par exemple, le supplier_name champ pourrait contenir :

Le nom du fournisseur.

Utilisé dans le traitement interne pour faire correspondre notre identifiant fournisseur avec le nom trouvé sur le document.

Consignes d'extraction des champs

Parfois, changer le nom et le type du champ ne suffit pas pour expliquer ce dont vous avez besoin pour un champ. Dans ce cas, vous pouvez ajouter des consignes d'extraction Consignes au champ.

Utilisez un langage naturel pour expliquer comment extraire correctement les données et/ou toute étape supplémentaire, comme le formatage.

Par exemple, avec supplier_phone_number, l'ajout des consignes d'extraction suivantes pourrait être utile :

Si vous trouvez plusieurs numéros de téléphone dans le document, utilisez le numéro de téléphone du siège du fournisseur.

Reformatez toujours les données pour correspondre au format international des numéros de téléphone, comme suit : +1-212-867-5309

Importance relative des propriétés des champs

Toutes les propriétés de champ n'ont pas la même importance ou le même poids lorsqu'il s'agit de la façon dont les modèles traitent les fichiers.

De plus, tous les types de champs ne sont pas traités de la même manière.

Dans le tableau suivant, les « Champs normaux » sont ceux qui extraient des informations textuelles du document (texte, dates, nombres, etc.), qu'il s'agisse de champs simples, de listes ou de champs d'objet imbriqués.

La « Détection d'objets » désigne un traitement spécifique visant à extraire les polygones de divers éléments du document, tels que des signatures, des photos d'identité, etc.

Propriété
Utilisation du champ normal
Utilisation de la détection d'objets

Nom

La plus importante

Non utilisée

Titre

Importante

La plus importante

Description

Complémentaire

Non utilisée

Consignes

Complémentaire

Non utilisée

Valeurs de classification

Très importante (uniquement pour les champs de classification)

Non utilisée

Moins, c'est mieux

Il peut être tentant de donner des instructions très détaillées dans les consignes et les descriptions. Cependant, dans de nombreux cas, cela est en réalité contre-productif et entraînera une baisse de la précision.

Voici un exemple avec trop de détails (ne faites pas cela) :

Le numéro de commande se trouve généralement à côté des mots « numéro de commande » sur la facture, mais parfois il n'y a pas de numéro de commande, auquel cas il se trouve à côté des mots « numéro de facture client ». Il se trouve généralement sur la première page, dans un encadré vert.

Quel est le problème ici ? Eh bien, la première chose à comprendre est que vous ne donnez pas des instructions à un humain, mais à une machine. Les machines préfèrent des instructions concises. En revanche, cette machine a été entraînée sur des millions de documents et est capable de déterminer d'elle-même l'emplacement d'un champ de valeur.

Il ne reste donc plus que l'instruction concernant le numéro de facture client et numéro de commande.

Une version plus simple et meilleure serait :

Utilisez la valeur du « numéro de facture client » si le « numéro de commande » est absent du document.

Lever l'ambiguïté avec des champs supplémentaires

Dans certains cas, il peut être utile d'ajouter des champs supplémentaires dont vous n'avez pas réellement besoin afin de lever l'ambiguïté sur les données dont vous avez besoin.

Supposons que vous traitiez des factures et que vous deviez extraire le « Numéro de référence ». Lors du traitement des factures, vous constatez que, parfois, le « Numéro de commande » est pris pour le numéro de référence.

Une première étape logique serait d'ajouter une consigne, quelque chose comme « N'utilisez JAMAIS le 'Numéro de commande' pour renseigner ce champ ». Bien que cela devrait fonctionner dans la plupart des cas, la distinction entre une référence et une commande peut ne pas être parfaitement claire pour le modèle.

Ajouter davantage de texte ou d'informations plus détaillées est potentiellement contre-productif.

Une solution possible serait d'ajouter le champ « Numéro de référence » dans votre Schéma de données, en plus du champ « Numéro de commande ». De cette façon, l'ambiguïté est levée ; il est désormais très clair pour le modèle qu'il s'agit de points de données distincts.

Ensuite, dans votre flux de traitement des données, ignorez simplement le champ supplémentaire.

Comme rappel, le nombre de champs dans le Schéma de données n'a aucun impact sur la tarification.

Bonnes pratiques pour les différentes régions ou langues

Il est important de faire d'abord la distinction entre la représentation et le contenu.

La représentation signifie qu'un contenu équivalent peut être affiché ou présenté différemment (pour une langue, il s'agit d'une traduction).

Le contenu signifie que la structure des données est différente, quelle que soit sa représentation (langue).

Dans le contexte d'un Schéma de données, la configuration optimale dépend principalement du fait que les données que vous devez extraire (le contenu) varient ou non selon la région ou la langue.

En général, la question suivante est : dois-je utiliser un seul modèle ou plusieurs modèles ?

Quand utiliser différents modèles

Si les données changent considérablement, il sera avantageux d'avoir différents modèles pour différentes régions. Par exemple :

  • différentes lignes/calculs de taxes sur les factures

  • des champs spécifiques sur les documents d'identité

  • un reporting différent sur les factures d'énergie

Avoir différents modèles pour mieux adapter les données à extraire fournira généralement des résultats plus précis. Cela permettra également d'avoir des Bonnes pratiques pour le Schéma de données.

Quand utiliser un seul modèle

D'un autre côté, si les données à extraire ne varient pas significativement, même lorsque la langue change, il n'est généralement pas nécessaire d'avoir différents modèles. Par exemple :

  • même document, langue différente (pays multilingues comme la Belgique, le Canada, l'Inde, etc.)

  • mêmes données à extraire, même si le document change (seul un sous-ensemble de données est requis)

Foire aux questions

Quand dois-je utiliser les consignes du Schéma de données plutôt que les consignes RAG ?

Les deux fonctionnent de la même manière pour fournir un contexte supplémentaire au modèle afin de mieux identifier les données et de les extraire.

La principale différence réside dans le fait que elles sont appliquées :

Si la consigne doit s'appliquer à tous les documents ⇒ utilisez la consigne du Schéma de données.

Si la consigne ne s'applique qu'à un gabarit spécifique ⇒ utilisez la consigne RAG.

Le modèle peut-il interpréter correctement des positions comme haut, bas, etc. ?

Les modèles Mindee sont multimodaux, ce qui signifie qu'ils utilisent à la fois des informations textuelles et visuelles.

À ce titre, il est possible de rédiger des consignes transmettant des informations de position, par exemple :

Le logo du fournisseur sera toujours en haut de la page.

Puis-je faire référence à un emplacement ou à un texte précis sur la page ?

Chaque page du document est traitée dans son ensemble, et les modèles disposent à la fois d'un composant visuel et d'un composant textuel (modèles multimodaux).

Il est donc possible de faire référence à d'autres emplacements et textes de la page dans les consignes.

C'est particulièrement utile pour lever l'ambiguïté lorsqu'une donnée similaire se trouve à plusieurs endroits sur la page.

Faire référence à un autre emplacement :

Le bon numéro de téléphone se trouve sous le nom du client.

Préciser un emplacement et un texte :

Le bon nom du client se trouve dans la première ligne de l'adresse de livraison.

Le modèle fonctionne-t-il mieux avec les informations des champs en anglais ?

Lors de nos propres tests, les grandes langues européennes telles que le français, l'espagnol ou l'allemand sont comparables à l'anglais en termes de précision du modèle.

Dans certains cas, il peut être avantageux de définir le Schéma de données, comme les noms et descriptions des champs, dans la langue présente dans le document. Cela peut aider à améliorer la précision, notamment lorsque des termes difficilement traduisibles sont utilisés dans la définition du champ.

Par exemple, un modèle pour des factures en français peut utiliser « TVA Intracommunautaire » comme nom de champ plutôt que « TVA intra-communautaire », bien que les deux fonctionnent.

Le mieux est d'essayer les deux en utilisant la fonctionnalité Live test .

Étapes suivantes

Une fois que vous êtes satisfait des résultats de votre Schéma de données, vous voudrez connecter votre plateforme et commencer à traiter des documents.

Mis à jour

Ce contenu vous a-t-il été utile ?