Définition du RAG : comment une IA retrouve vos documents pour vous répondre
Le RAG permet à un assistant d’IA de s’appuyer sur vos documents plutôt que sur sa seule mémoire. Ce guide explique son fonctionnement, ses usages en PME, ses limites, les coûts à anticiper et la question des droits d’accès.
Par Enzo Airault, fondateur de Pecora · Mis à jour le
Qu’est-ce que le RAG ?
RAG est l’abréviation de l’anglais retrieval augmented generation, que l’on traduit par génération augmentée par recherche, ou plus simplement recherche augmentée. Le principe tient en une phrase : avant de répondre, le système recherche dans vos documents les passages utiles à la question, puis les transmet au modèle d’IA avec la question.
Le modèle n’est pas réentraîné sur vos documents. Il ne les apprend pas. Il les lit au moment de la question, comme une personne à qui l’on tendrait les bonnes pages d’un classeur avant de lui demander une réponse. C’est la différence essentielle avec l’entraînement d’un modèle, et elle a des conséquences pratiques : un document mis à jour est pris en compte dès qu’il est réindexé, et un document retiré de l’index cesse d’être utilisé.
Un modèle de langage utilisé seul répond à partir de ce qu’il a appris lors de son entraînement. Il ne connaît ni vos procédures, ni vos tarifs, ni vos fiches produits. Le RAG lui donne accès à cette connaissance, dans les limites que vous fixez.
Comment fonctionne le RAG, étape par étape ?
Un système RAG repose sur deux temps : la préparation des documents, faite une fois puis tenue à jour, et la réponse à chaque question.
- Découpage : chaque document autorisé est découpé en passages de quelques paragraphes.
- Indexation : chaque passage est converti en une représentation numérique, appelée embedding, qui permet de retrouver les passages proches par le sens, et pas seulement par les mots exacts.
- Recherche : quand une question arrive, le système sélectionne les passages les plus pertinents parmi ceux que la personne a le droit de consulter.
- Génération : le modèle reçoit la question, les passages retenus et des consignes, par exemple ne répondre qu’à partir des sources fournies.
- Citation : la réponse indique les documents et les passages sur lesquels elle s’appuie, pour que la personne puisse vérifier.
Il existe d’autres façons de donner accès à vos documents. La première consiste à interroger directement vos logiciels documentaires sous l’identité de l’utilisateur, sans construire d’index séparé : les documents restent à leur place et chaque logiciel continue d’appliquer ses propres droits. La seconde repose sur les espaces de recherche proposés par certains fournisseurs d’IA : plus simples à mettre en place, ils ajoutent un lieu où vos contenus sont conservés, dont il faut vérifier les conditions. Le choix dépend de vos outils, du volume de documents et du niveau de contrôle attendu.
Quand utiliser le RAG dans une PME ?
Le RAG est utile lorsque la réponse existe déjà quelque part dans vos documents, mais que la retrouver prend du temps ou dépend de la bonne personne. Quelques situations types :
- retrouver une procédure interne, une consigne de sécurité ou une règle de gestion ;
- répondre à une question technique à partir des fiches produits et des notices ;
- préparer un brouillon de réponse client à partir des conditions générales et des informations autorisées ;
- aider une personne qui arrive dans l’entreprise à trouver les documents de référence.
Le RAG est moins adapté lorsque l’information n’existe pas par écrit, lorsqu’elle change en permanence (un stock, un solde, un statut de commande) ou lorsque la réponse exige un calcul exact. Dans ces cas, une requête directe dans le logiciel qui fait foi est plus fiable qu’une recherche dans des documents. Le guide « Automatisation ou IA » détaille ce choix.
À retenir
Un RAG retrouve et cite vos documents. Il ne garantit pas que la réponse soit exacte.
Quelles sont les limites du RAG ?
Même avec des documents de qualité, quatre erreurs restent possibles. Les connaître permet de les prévoir dans l’architecture plutôt que de les découvrir en production.
- Mauvaise récupération : le bon document existe, mais la recherche ne le trouve pas ou le classe trop loin.
- Document obsolète : le système retrouve une ancienne grille, une procédure remplacée ou un tarif périmé.
- Sources contradictoires : deux documents donnent deux réponses différentes, et le modèle risque d’en choisir une sans le dire.
- Invention : le modèle complète sa réponse avec une information plausible qui ne figure dans aucune source.
Chaque limite a une parade. Un catalogue des sources, avec un propriétaire et une date de validité par document, réduit le risque d’obsolescence. Une hiérarchie des sources, par exemple la base officielle avant la fiche validée et la fiche validée avant le document commercial, règle une partie des contradictions ; les autres sont signalées à la personne responsable. Une consigne explicite oblige le système à répondre « information manquante » plutôt qu’à estimer. Enfin, un jeu de questions de test, avec les réponses attendues, mesure la qualité avant la mise en service et après chaque changement important. Le guide sur les hallucinations détaille cette méthode.
Quels coûts prévoir pour un système RAG ?
Le coût d’un RAG ne se limite pas à l’abonnement d’un outil. Pour comparer des propositions, il faut distinguer plusieurs lignes :
- la préparation des sources : tri, mise à jour, classification et désignation des propriétaires, souvent le poste le plus sous-estimé ;
- la mise en place : architecture, connexion aux logiciels documentaires, gestion des droits, tests ;
- l’hébergement de l’index et les consommations du modèle, qui varient avec le nombre de documents et de questions ;
- le temps de vos équipes : entretiens, relecture des réponses de test, validation ;
- la maintenance : réindexation, suivi de la qualité, évolution des sources et des droits.
Dans une mission Pecora, les outils et les consommations sont souscrits à votre nom et payés directement par vous ; Pecora facture l’étude, la mise en place, la documentation et l’accompagnement. Cette séparation rend les coûts lisibles et vous laisse maître du système.
Comment un RAG respecte-t-il les droits d’accès ?
C’est le point le plus important, et le plus souvent négligé. Si une personne du service commercial n’a pas accès aux dossiers de la direction financière, l’assistant ne doit pas lui permettre d’y accéder indirectement en posant la bonne question.
Le filtrage doit intervenir avant l’envoi au modèle, pas après. Concrètement, le système identifie la personne, détermine les documents qu’elle a le droit de consulter, recherche uniquement parmi ceux-ci, puis transmet les passages au modèle. Masquer une réponse après coup ne suffit pas : l’information a déjà été lue par le modèle et peut réapparaître sous une autre forme.
Les droits évoluent. Quand une personne change de service, quand un document est supprimé ou reclassé, l’index doit le refléter : les passages et leurs représentations numériques doivent disparaître aussi. Enfin, transformer un document en embeddings ne le rend pas anonyme. Un index construit sur des documents internes reste une donnée interne, avec les mêmes règles de protection et de suppression que les originaux.
Une dernière précaution : ne pas brancher toute la documentation « pour voir ». Chaque source connectée doit avoir un propriétaire, une classification, des droits et une règle de suppression. Le guide sur la sécurité des données détaille les questions à poser aux fournisseurs.
Par où commencer un projet de RAG ?
Un premier projet gagne à rester étroit. L’objectif n’est pas de tout rendre interrogeable, mais de prouver sur un usage précis que les réponses sont justes, sourcées et utiles.
- Choisir un usage : une question que vos équipes posent souvent et dont la réponse existe par écrit.
- Délimiter un corpus : les documents nécessaires à cet usage, à jour, avec un propriétaire pour chacun.
- Écrire les questions de test : des questions réelles, avec la réponse attendue et le document qui la justifie, y compris des questions sans réponse dans le corpus.
- Mesurer : faire passer ces questions, relever les erreurs et leurs causes, corriger les sources ou l’architecture.
- Élargir ensuite : ajouter des sources ou des usages seulement quand le premier périmètre donne des résultats mesurés et acceptés par ceux qui l’utilisent.