For the complete documentation index, see llms.txt. This page is also available as Markdown.

Aperçu du modèle OCR de texte brut

Extrayez automatiquement le texte brut de chaque page d’un document à l’aide de l’OCR.

Cas d’utilisation

Lorsque l’intégralité du texte d’un document doit être extraite, ainsi que les informations de position de chaque mot.

Nous utilisons le terme « OCR » au sens littéral, comme acronyme de « Optical Character Recognition ».

Cela signifie que le texte exact est renvoyé en tant que données brutes, et non analysé en données structurées sous forme de champs.

La plupart des utilisateurs qui recherchent un « Mindee OCR » générique ou à « faire de l’OCR sur un document » recherchent probablement Extraction : cconsultez le documentation du modèle d’extraction.

Un fichier envoyé au modèle Raw Text Modèles OCR peut comporter n’importe quel nombre de pages, dans certaines limites.

Différence entre Raw Text Modèle et Raw Text Option

Le modèle d’extraction a la fonctionnalité optionnelle Raw Text qui peut être utilisée dans des cas d’utilisation similaires, selon vos besoins.

Option Raw Text : renvoie l’intégralité du texte de chaque page sous forme d’une seule chaîne.

Modèle Raw Text : en plus de la seule chaîne par page, renvoie également chaque mot de la page. Chaque mot comporte des informations de position et le contenu textuel.

Prise en charge des langues

Presque toutes les langues sont entièrement prises en charge, car seul le système d’écriture intervient dans la détection.

Autrement dit, tant que le système peut reconnaître les glyphes (les lettres d’un alphabet), le texte sera extrait.

Il est beaucoup plus simple et plus court de lister ce qui n’est pas pris en charge :

  • Les langues anciennes sans système d’écriture moderne équivalent, comme le cunéiforme, les hiéroglyphes égyptiens, l’ancien maya, etc.

  • Les langues modernes dotées de systèmes d’écriture peu courants, comme Blackfoot, Cherokee, Inuktitut, etc.

Créer un modèle Raw Text Modèles OCR

Les modèles OCR Raw sont toujours personnalisés, aucun modèle prédéfini n’est disponible dans le catalogue.

Chaque modèle OCR reçoit son propre ID de modèle unique lorsque vous le créez.

  1. Pour créer un modèle OCR, cliquez sur Modèles, puis cliquez sur Créez votre modèle d’IA documentaire.

  2. Faites défiler jusqu’à la Utilitaires de document section, cliquez sur OCR. Cette étape générera également l’ID de modèle unique du modèle.

  3. Vous pouvez maintenant utiliser l’ Live test onglet pour traiter des documents.

Votre modèle OCR est désormais disponible dans votre Modèles onglet :

Voici un tutoriel étape par étape qui vous montre comment créer correctement un utilitaire OCR :

Unexpected error with integration supademo: Integration is not installed on this space

Intégration

Une fois votre modèle OCR créé et testé, la documentation d’intégration est fournie sur la page « Documentation », ou ici : Démarrage rapide OCR

Mis à jour

Ce contenu vous a-t-il été utile ?