For the complete documentation index, see llms.txt. This page is also available as Markdown.

Apprentissage continu (RAG)

Améliorez la précision de l’extraction grâce à la génération augmentée par récupération (RAG) à l’aide de vos propres documents.

Aperçu

Lors de l'utilisation d'un modèle Extraction, il arrive parfois que la précision de l'extraction ne soit pas satisfaisante sur un document donné ou un gabarit particulier.

Si vous avez déjà suivi la Bonnes pratiques pour le Schéma de données, et que les résultats ne sont toujours pas satisfaisants, tout n'est pas perdu.

Vous disposez d'un moyen d'améliorer durablement les performances du modèle pour les prochaines prédictions que vous ferez. La solution qu'il vous faut est la fonctionnalité RAG.

Principes de fonctionnement interne de RAG

La génération augmentée par récupération, ou RAG, est une approche de l'intelligence artificielle qui combine les atouts des modèles fondés sur la récupération avec la production de texte par des LLM génératifs.

En substance, RAG exploite une riche base de données de documents sources et d'embeddings pour enrichir la base de connaissances à partir de laquelle il puise ses réponses. Cela signifie que le système récupère des extraits de données spécifiques et contextuels, puis les utilise pour générer des réponses sémantiques et finement ajustées, à la fois créatives et factuellement exactes.

Étapes générales de RAG

  1. L'annotation d'un échantillon donné, ce qui signifie indiquer au modèle l'écart entre les données extraites et la/les valeur(s) attendue(s). Une fois activé, cet exemple sera ajouté à la base de données RAG pour plus tard.

  2. Récupération : lorsqu'un document suivant sera envoyé avec l'option RAG activée, le modèle tentera de rechercher un exemple similaire dans la base de données existante. La question ici est : "Il existe peut-être déjà un exemple dans lequel je dois suivre les consignes afin de ne pas refaire la même erreur." Si aucun exemple n'est trouvé, il n'est pas nécessaire d'enrichir la prédiction. Si un exemple correspond dans la base de données RAG, voici l'étape 3.

  3. Génération augmentée : un document a correspondu dans la base de données RAG. Le modèle utilisera les instructions que vous avez données sur l'échantillon RAG pour réaliser cette fois une meilleure prédiction. La prédiction générée est enrichie par un contexte existant, ce qui aide le modèle à être meilleur cette fois.

RAG process overview

Configurer la base de données RAG

Pour utiliser RAG sur un modèle Extraction donné, vous devrez d'abord configurer la base de données RAG qui contiendra vos documents et données.

Accédez à la base de données en cliquant sur le lien "Apprentissage continu (RAG)" dans la section de configuration du modèle. Vous pouvez ensuite enrichir votre base de données RAG en téléversant des documents présentant un comportement insatisfaisant.

Vous devez annoter le document en cochant les champs que vous souhaitez voir couverts par l'enrichissement RAG sur ce modèle. Vous pouvez également ajouter des consignes supplémentaires en langage courant.

Une fois ce document annoté, veillez à le valider, puis allez dans l'onglet Live test. Vous devriez téléverser un document et laisser cochée l'option "Afficher l'extraction RAG".

Idéalement, choisissez un document avec le même modèle (une autre facture du même fournisseur, par exemple), mais pas exactement celui que vous avez utilisé dans la base de données RAG. Vous verrez les prédictions avant/après et devriez pouvoir vérifier que les instructions supplémentaires ont bien été prises en compte pour enrichir correctement la prédiction. À l'avenir, les documents respectant le même modèle devraient être enrichis, ce qui devrait considérablement améliorer les performances sur ce modèle donné. Pour les autres types de documents, le comportement reste le même, ce qui signifie que RAG améliore le résultat sans régression sur les autres documents.

Pour voir quels documents sont utilisés, dans la base de données, les colonnes "Matched" et "Last Matched" indiquent respectivement combien de fois le document a été utilisé et la dernière fois où il l'a été.

Activer RAG

Pour de meilleurs résultats, veillez à suivre le Bonnes pratiques pour le Schéma de données avant d’activer cette fonctionnalité.

Si le Schéma de données n’est pas optimisé, cette fonctionnalité pourrait ne pas améliorer significativement la précision du modèle.

Activer RAG sur la plateforme

Lorsque vous définissez l'état d'activation d'une fonctionnalité sur la Plateforme, ce sera la valeur par défaut. Tous les appels API utiliseront l'état par défaut, sauf indication contraire explicite lors de l'appel API.

Cela est utile pour les chefs de projet, car cela permet d'activer ou de désactiver une fonctionnalité dans tous les appels API sur ce modèle.

Toute personne disposant d'un accès en écriture au modèle peut définir la valeur par défaut de l'option.

Cliquez sur "Schéma de données", puis sur l'onglet "Fonctionnalités optionnelles". Vous pouvez y activer la fonctionnalité "Traitement RAG".

Activer RAG via des appels API

Si vous avez besoin d’un contrôle plus granulaire sur le moment où la fonctionnalité est utilisée, vous pouvez l’activer ou la désactiver lors de l’exécution d’appels API.

Cela permet de définir dynamiquement l’état d’activation à l’aide de votre logique métier interne ou propre à votre domaine.

Vérifiez le Configuration du client section si vous utilisez notre Bibliothèques clientes / SDK.

Foire aux questions

Comment mes données sont-elles protégées pendant le traitement RAG ?

Vos données restent privées et isolées au sein de votre modèle.

Tous les documents et annotations ajoutés à votre base de données RAG sont chiffrés en transit.

Mes données RAG sont-elles partagées avec d'autres utilisateurs ou vendues à des tiers ?

Non, jamais.

Les données RAG ne sont accessibles qu'aux utilisateurs de l'organisation à laquelle appartient le modèle.

Mindee ne vend jamais de données à des tiers.

Le stockage et la récupération des données RAG s'effectuent sur les serveurs dédiés de Mindee.

Mindee utilise-t-il mes données RAG pour l'entraînement ?

Non, jamais.

Nous n'utilisons les données RAG qu'en interne, avec votre connaissance explicite et votre consentement préalable. Cela se limite à l'utilisation de vos documents pour aider à résoudre un ticket que vous avez ouvert auprès de notre équipe d'assistance.

Que devient ma base de données RAG si je passe à une offre inférieure ?

Nous ne supprimerons aucun des fichiers que vous avez téléversés dans votre base de données de documents RAG si vous passez à une offre inférieure ; en revanche, vous ne pourrez pas les modifier ni les valider.

Les consignes que vous avez données à vos documents RAG seront prises en compte dans vos inférences avec l'offre inférieure, même si cela dépasse les fonctionnalités de l'offre.

Mis à jour

Ce contenu vous a-t-il été utile ?