> For the complete documentation index, see [llms.txt](https://docs.mindee.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.mindee.com/v2/fr/modeles-extraction/extraction-models-overview.md).

# Aperçu du modèle Extraction

## Qu'est-ce qu'un modèle d'extraction ?

Un **modèle d'extraction** sur la plateforme Mindee est un type de [modèle](/v2/fr/models/models-overview.md) conçu pour extraire des données structurées à partir de documents. Les modèles d'extraction traitent les informations textuelles à l'aide de la reconnaissance optique de caractères (OCR) et traitent la structure des documents à l'aide d'informations visuelles (détection d'objets).

Cette double approche permet d'extraire simultanément des éléments textuels et visuels.

Chaque modèle définit un ensemble de champs appelé un [Aperçu du schéma de données](/v2/fr/modeles-extraction/data-schema.md). Les champs peuvent inclure "Nom du fournisseur", "Numéro de facture" ou "Montant total" pour un modèle de facture, à titre d'exemple. Le système identifiera ensuite et extraira les données des fichiers téléversés selon ces définitions de champs.

Les modèles d'extraction peuvent être utilisés pour tout type de document, y compris : factures, reçus, passeports, cartes d'identité, états financiers, [etc.](/v2/fr/cas-dutilisation/extraction-models.md).

Vous pouvez même extraire des données d'objets comportant des informations textuelles : distributeurs de carburant, jauges d'eau, odomètres, compteurs électriques, etc.

Les modèles vous permettent d'automatiser le processus de transformation de documents non structurés en données structurées exploitables. Ils peuvent être adaptés à différents types de documents et à des besoins métier, garantissant que seules les informations pertinentes sont capturées pour vos flux de travail.

Chaque modèle d'extraction contient ces outils et fonctionnalités dédiés :

* [Aperçu du schéma de données](/v2/fr/modeles-extraction/data-schema.md): un modèle est également défini par un Schéma de données, qui fixe la liste des champs que l'API doit extraire pour un type de document donné.
* [Apprentissage continu (RAG)](/v2/fr/modeles-extraction/optional-features/improving-accuracy.md): cela permet à l'utilisateur de donner des instructions supplémentaires sur certains exemples présentant un comportement inattendu afin d'améliorer durablement les performances d'extraction du modèle.
* [Paramètres du modèle](/v2/fr/models/model-settings.md): paramètres généraux du modèle tels que la zone de traitement, la Politique de stockage, le transfert de propriété, etc.

## Créer un modèle d'extraction <a href="#creating-from-scratch" id="creating-from-scratch"></a>

Depuis la page d'accueil de la plateforme Mindee, cliquez sur **"Créez votre modèle d'IA documentaire"**.

### Créer à partir du catalogue des modèles

Il y a de fortes chances que le document que vous essayez d'automatiser soit un type de document connu et qu'il soit déjà présent dans notre catalogue de modèles : Facture, Reçu, Passeport, Document financier, Carte d'identité...\
\
Ce sont des modèles prédéfinis avec des Schémas de données créés par notre équipe Data Science, ce qui vous permet de démarrer rapidement grâce à un ensemble de champs prédéfinis.

Vous pouvez rechercher dans notre catalogue des modèles adaptés, puis simplement cliquer sur celui qui correspond le mieux à vos besoins. Cela créera un nouveau modèle dans le compte de votre organisation avec son propre ID de modèle, ce qui vous permettra de l'utiliser et de le modifier.

{% hint style="info" %}
**Les modèles du catalogue sont fournis avec des champs d'extraction génériques.**

Vous devrez probablement ajouter et/ou modifier des champs pour répondre à vos besoins et à votre cas d'utilisation.
{% endhint %}

### Créer un modèle personnalisé <a href="#creating-from-scratch" id="creating-from-scratch"></a>

Si aucun des modèles du catalogue ne répond à vos besoins, vous pouvez repartir de zéro.\
Lors de la création d'un nouveau modèle, cliquez sur **"document personnalisé"**.

Ensuite, choisissez comment créer le modèle personnalisé :

* Décrivez aussi précisément que possible le ou les documents que le modèle traitera.\
  À privilégier lorsque les documents traités présentent des variations.

ou

* Téléversez un fichier exemple représentatif des documents à traiter.\
  À privilégier lorsque les documents traités sont similaires.

Notre agent IA vous aidera à définir rapidement un Schéma de données initial que vous pourrez ajuster plus tard.

Cette étape générera également l'ID de modèle unique.

{% hint style="info" icon="lightbulb" %}
**Nous vous recommandons de créer rapidement un modèle initial.**

Une fois créé, affinez les paramètres du nouveau modèle [Aperçu du schéma de données](/v2/fr/modeles-extraction/data-schema.md) sur la plateforme, en utilisant la [Live test](/v2/fr/models/live-test.md) fonctionnalité pour peaufiner vos champs et vos consignes.
{% endhint %}

## Modification de votre Schéma de données d'extraction

Une fois que vous avez créé un modèle, vous souhaiterez probablement modifier son [Schéma de données](/v2/fr/modeles-extraction/data-schema.md) pour mieux répondre à vos besoins.

Même si le modèle a été créé à partir d'un modèle du catalogue, il est unique à votre compte et entièrement personnalisable.

Accédez à la page du Schéma de données où vous pouvez ajuster les champs, mettre à jour les configurations et personnaliser les paramètres selon vos besoins.

### Utiliser l'Assistant IA

L'Assistant IA Mindee est un outil puissant qui peut vous aider à tirer le meilleur parti de votre modèle. C'est la méthode privilégiée pour modifier le Schéma de données.

L'Assistant est disponible dans une boîte de dialogue sur la page du Schéma de données du modèle.

Soyez aussi précis que possible avec les noms de champs ; les noms exacts et les valeurs doivent être entre guillemets.\
\
Exemples de phrases pour modifier votre Schéma de données avec l'Assistant IA :

* *Ajouter un nouveau champ : "ID du document"*\
  ⇒ Créera un nouveau champ texte.
* *Ajouter un nouveau champ : "is en retard"*\
  ⇒ Créera un nouveau champ booléen\
  Astuce : les noms des champs booléens doivent commencer par "is" ou "has".
* *Renommer le champ "date" en "date de facture"*
* *Modifier le champ "document\_type" en champ de classification. Les classes attendues sont "FACTURE" et "REÇU"*

## Optimiser les résultats du modèle

Afin d'optimiser la précision d'un modèle donné, la première étape consiste à [affiner le Schéma de données](/v2/fr/modeles-extraction/data-schema-best-practices.md).

Commencez en particulier par demander à l'Assistant IA Mindee d' [optimiser automatiquement](/v2/fr/modeles-extraction/data-schema-best-practices.md#automated-optimization) votre Schéma de données.

Si vous êtes parti d'un modèle du catalogue, il est généralement nécessaire de l'adapter à vos documents spécifiques et à votre cas d'utilisation.

Après cette étape, s'il reste encore des problèmes persistants ou des comportements inattendus, d'autres raffinements sont possibles.

### Problèmes avec des gabarits spécifiques

Lorsque la précision globale est bonne, mais qu'il y a des problèmes sur des gabarits de documents spécifiques.

Pour cela, vous devrez activer [Apprentissage continu (RAG)](/v2/fr/modeles-extraction/optional-features/improving-accuracy.md). Cela permet d'ajouter des consignes à des gabarits spécifiques, ce qui vous permet de cibler les documents problématiques tout en laissant les autres inchangés.

### Précision élevée requise

Lorsque vous avez besoin d'une très grande précision pour tous les documents que vous traitez.

Envisagez d'activer [Score de confiance et exactitude améliorée](/v2/fr/modeles-extraction/optional-features/automation-confidence-score.md). Cela utilise plusieurs modèles pour une précision accrue **et** signale les champs problématiques.

Les champs signalés peuvent être envoyés pour [revue humaine](#end-user-review) ou le document peut être entièrement rejeté, selon les règles métier définies de votre côté.

### Révision par l'utilisateur final

Lorsque vous affichez les documents aux utilisateurs finaux, généralement lorsqu'ils peuvent revoir et corriger les données extraites.

Vous pouvez activer [Polygones (boîtes englobantes)](/v2/fr/modeles-extraction/optional-features/polygons-bounding-boxes.md) afin que l'emplacement des champs extraits puisse être affiché (cette option est toujours activée dans le [Live test](/v2/fr/models/live-test.md)). De cette façon, il sera beaucoup plus facile pour vos utilisateurs de repérer les champs erronés et de les corriger.

C'est encore plus puissant lorsqu'il est combiné avec [scores de confiance](/v2/fr/modeles-extraction/optional-features/automation-confidence-score.md), vous pouvez signaler directement dans vos formulaires les champs nécessitant une attention.

### Avantages combinés

Ces fonctionnalités fonctionnent ensemble pour créer un système qui devient plus précis au fur et à mesure que vous l'utilisez, réduisant les corrections manuelles et améliorant les taux de réussite de l'automatisation.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.mindee.com/v2/fr/modeles-extraction/extraction-models-overview.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
