Larssen Consulting
Agents et outils

RAG

génération augmentée par récupération

Le RAG, ou génération augmentée par récupération, consiste à rechercher les passages utiles dans une base de documents, puis à les fournir au modèle de langage pour qu’il rédige sa réponse à partir d’eux.

  • Lecture : 3 minutes
  • Mis à jour le 8 octobre 2026
  • 3 sources

En clair

Un modèle de langage répond de mémoire. Cette mémoire s’arrête à la fin de son entraînement et ne contient ni vos contrats, ni vos procédures, ni les chiffres du mois dernier. Le RAG change la règle du jeu : avant chaque réponse, le système cherche dans une base de documents les extraits qui se rapportent à la question, puis les glisse sous les yeux du modèle.

L’image la plus juste est celle de l’examen à livre ouvert. Sans RAG, l’élève répond de tête, avec le risque d’inventer quand il ne sait plus. Avec RAG, il a le droit de consulter le manuel, à condition qu’on lui ouvre la bonne page. Tout l’enjeu est là : si la recherche ramène le mauvais passage, la réponse sera fausse, même avec un excellent modèle.

Le modèle lui-même n’est pas modifié. On ne lui apprend rien de nouveau : on lui prête des documents le temps d’une réponse. Pour mettre à jour ce qu’il sait, il suffit donc de mettre à jour la base documentaire, sans toucher au modèle ni attendre la sortie d’une nouvelle version.

Un exemple

Une mutuelle met à disposition de ses conseillers un assistant interne. Un conseiller demande : « Quel est le délai de carence pour l’orthodontie sur le contrat Famille Plus ? ». Le système retrouve les trois paragraphes concernés dans les conditions générales en vigueur, les transmet au modèle, et celui-ci répond en indiquant l’article d’où vient l’information.

Le conseiller peut ouvrir le passage cité et vérifier en dix secondes. Quand le contrat change, il suffit de remplacer le document dans la base : aucun réentraînement n’est nécessaire.

Niveau technique

Comment ça marche

Le terme vient d’un article publié en 2020 par Lewis et ses coauteurs 1. Ils y associent une mémoire « paramétrique », le modèle génératif, à une mémoire « non paramétrique » : un index vectoriel de Wikipédia interrogé par un module de recherche neuronal. Ce module reprend la recherche dense de passages, proposée la même année 2, qui représente questions et passages par des vecteurs comparables entre eux.

  1. IndexerLes documents sont découpés en fragments, puis convertis en vecteurs.
  2. ChercherLa question sert à retrouver les fragments les plus proches.
  3. AugmenterCes fragments sont ajoutés au prompt, avec la question.
  4. GénérerLe modèle rédige sa réponse en s’appuyant sur eux.

L’indexation se fait une fois, puis à chaque mise à jour des documents ; les trois autres étapes ont lieu à chaque question.

En pratique, un système de RAG comporte deux temps. Hors ligne, les documents sont découpés en fragments (chunks), chaque fragment est converti en vecteur par un modèle d’embedding, et le tout est rangé dans une base vectorielle. En ligne, la question est convertie de la même façon, les fragments les plus proches sont récupérés, puis insérés dans le prompt avec la consigne de s’appuyer sur eux.

Les systèmes actuels ajoutent plusieurs raffinements, recensés dans une synthèse de 2023 3 : recherche hybride qui combine vecteurs et mots-clés, reclassement des résultats par un second modèle (reranking), reformulation de la question, ou recherche en plusieurs tours pilotée par un agent. La qualité se mesure séparément sur les deux maillons : la recherche a-t-elle ramené le bon passage, et la réponse lui est-elle fidèle ?

Ce que ça change pour une entreprise

Le RAG est la voie la plus courante pour faire travailler un modèle sur les connaissances d’une entreprise : base documentaire, support client, recherche juridique, assistance technique. Il coûte beaucoup moins cher qu’un affinage du modèle, permet de citer les sources et se met à jour en changeant les documents. Il permet aussi de respecter les droits d’accès, si la recherche ne ramène que ce que l’utilisateur a le droit de voir.

Ses limites sont connues. La qualité dépend d’abord des documents : doublons, versions périmées et fichiers mal numérisés donnent de mauvaises réponses. Le RAG convient mal aux questions de synthèse globale, du type « quels sont les thèmes récurrents de nos 5 000 réclamations ? », car il ne lit que quelques extraits. Et il réduit les hallucinations sans les supprimer : le modèle peut mal lire un bon passage. Il faut donc prévoir un budget pour la préparation des données et l’évaluation.

Idées reçues

  • « Avec le RAG, plus d’hallucinations. »

    Le risque baisse, il ne disparaît pas. Si la recherche ramène un passage hors sujet, ou si le modèle l’interprète mal, la réponse reste fausse, et elle paraît d’autant plus crédible qu’elle est accompagnée d’une source.

  • « Le RAG entraîne le modèle sur nos données. »

    Non. Le modèle n’est pas modifié : les documents lui sont fournis au moment de la question, puis oubliés.

  • « Les grandes fenêtres de contexte rendent le RAG inutile. »

    Fournir tous les documents à chaque question coûte cher, ralentit la réponse et dilue l’information utile. Choisir ce qu’on montre au modèle reste nécessaire.

Sources

  1. Lewis et al., « Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks », 2020
  2. Karpukhin et al., « Dense Passage Retrieval for Open-Domain Question Answering », 2020
  3. Gao et al., « Retrieval-Augmented Generation for Large Language Models: A Survey », 2023

Voir aussi