03 Connaissance 16 min d'exploration Accessible

RAG — Donner une bibliothèque à l'IA sans la réentraîner

La question

Comment une IA peut-elle répondre sur des informations sur lesquelles elle n'a jamais été entraînée ?

03 / 05Connaissance

La question à laquelle il ne peut pas répondre

Reprenons l’agent du chapitre précédent. Il sait agir. Posez-lui maintenant une question de chez vous :

Notre politique de voyage autorise-t-elle la classe affaires ?

Il ne sait pas. Il ne peut pas savoir : ce document n’existait pas dans ses données d’entraînement, ou bien il existait dans une version que vous avez remplacée depuis. Et le pire n’est pas qu’il l’ignore — c’est qu’il peut répondre quand même, avec la même assurance que pour la capitale de la France.

Deux voies s’ouvrent. Réentraîner le modèle sur vos documents : long, coûteux, à refaire à chaque mise à jour, et sans garantie qu’il restitue exactement ce qui est écrit. Ou bien lui donner le passage utile au moment où il répond.

C’est la seconde qu’on appelle RAG.

Un document ne s'utilise pas entier

Un modèle a une fenêtre de contexte finie, et y verser une politique de quarante pages pour répondre à une question sur les vols long-courriers noie la réponse. On découpe donc les documents en fragments.

La taille du fragment est le premier arbitrage, et il n’a pas de bonne réponse universelle.

Découpage

Document Politique de voyage v4.2 — extrait §7

Choisissez une taille

  1. La classe affaires est autorisée sur les vols de plus de six heures. Une dérogation du responsable de service est requise en deçà.
  2. Les vols intérieurs sont réservés en classe économique. Les surclassements payés à titre personnel ne sont pas remboursés.
La règle et sa condition voyagent ensemble, ce qui suffit à répondre correctement.
Un fragment contient déjà des phrases sans rapport avec la question posée.

Trois découpages du même passage. Chacun annonce ce qu'il gagne et ce qu'il perd.

Version textuelle

Le même extrait découpé de trois façons. En petits fragments, chaque phrase est isolée : la recherche vise juste, mais la règle et son exception se séparent. En fragments moyens, la règle et sa condition restent ensemble. En un seul grand fragment, rien n’est séparé mais le fragment ressemble à toutes les questions de voyage à la fois.

Aucune de ces tailles n’est la bonne. Le découpage se règle contre les questions qu’on attend, et il se re-règle quand elles changent.

Question et fragments dans le même espace

Comment retrouver le bon fragment sans que la question contienne ses mots exacts ? En les plaçant tous dans l’espace de représentation du chapitre 01.

Un fragment devient un vecteur. La question aussi. Retrouver le passage utile devient alors une opération géométrique : chercher les points les plus proches.

Fragments et question

Sélectionnez « question »

question §7.3 classe §7.4 dérogation §7.1 intérieurs §9 hôtels §12 notes de frais §3 congés §2 horaires §15 matériel §1 objet

question Fragments les plus proches

  1. 1 §7.3 classe
  2. 2 §7.4 dérogation
  3. 3 §7.1 intérieurs

La question est un point comme les autres. Sélectionnez-la : ses voisins sont les fragments qui lui ressemblent.

Représentation conceptuelle. Même remarque qu'au chapitre 01 : les représentations réelles ont des centaines de dimensions et aucun axe ne porte de nom. Ce plan met en scène la seule propriété qui compte — que la proximité veut dire quelque chose.

Version textuelle

La question se place près de §7.3 classe, §7.4 dérogation et §7.1 intérieurs — les trois passages qui traitent des vols. Les fragments sur les hôtels, les congés ou le matériel sont loin, alors qu’aucun mot de la question ne dit explicitement « §7 ».

C’est ce qui fait tenir l’ensemble : on ne cherche pas des mots, on cherche une proximité de sens. Une question sur « la business » retrouve un paragraphe qui parle de « classe affaires ».

Combien de fragments donner ?

La recherche renvoie les fragments classés par proximité. Reste à décider combien on en garde — la valeur qu’on appelle k.

Recherche des k plus proches

Question Puis-je voyager en classe affaires pour Tokyo ?

k =
  1. Politique voyages v4.2 · §7.3 La classe affaires est autorisée sur les vols de plus de six heures. 0.89
  2. Politique voyages v4.2 · §7.4 Une dérogation du responsable de service est requise pour les vols plus courts. 0.81
  3. Politique voyages v4.2 · §7.1 Les vols intérieurs sont réservés en classe économique. 0.74
  4. Politique voyages v3.1 · §7.3 La classe affaires est autorisée sur tous les vols internationaux. 0.71
  5. Note de service 2025-14 Les déplacements vers l'Asie font l'objet d'un suivi budgétaire trimestriel. 0.58
  6. Politique voyages v4.2 · §9 Les nuitées d'hôtel suivent le barème annexé. 0.41
  7. Politique voyages v4.2 · §12 Les notes de frais sont déposées sous quinze jours. 0.33
  8. Guide arrivée · §4 Le badge d'accès est remis le premier jour. 0.27
  9. Politique voyages v4.2 · §15 Le matériel informatique reste sous la responsabilité du collaborateur. 0.22
  10. Règlement intérieur · §3 Les congés sont posés via l'outil des ressources humaines. 0.18

À k = 1, la dérogation disparaît et la réponse devient fausse par omission. À k = 10, le modèle reçoit huit passages hors sujet et un passage périmé — dont il ne sait pas qu'il est périmé.

Changez k. L'ordre ne bouge jamais : augmenter k n'améliore pas les premiers résultats, cela en ajoute de moins bons.

Représentation conceptuelle. Les scores affichés sont illustratifs. Ce qui est fidèle, c'est leur décroissance et le fait qu'un fragment puisse marquer un score élevé tout en répondant à une autre question.

Version textuelle

Les fragments sont classés par proximité : §7.3 (0,89), §7.4 (0,81), §7.1 (0,74), puis une version périmée du même §7.3 tirée de la v3.1 (0,71), qui affirme l’inverse. À k = 3 la réponse est correcte ; à k = 1 la dérogation manque ; à k = 5 le passage périmé entre dans le contexte, avec un score presque aussi élevé que les bons.

Regardez le quatrième résultat. Il marque 0,71 — un très bon score — et il dit l’inverse du premier, parce qu’il vient d’une version que vous avez remplacée. Rien dans le score ne le signale. La proximité de sens ne mesure pas la vérité, elle mesure la ressemblance.

Ce qui est réellement envoyé

Les fragments retenus ne sont pas « chargés dans le modèle ». Ils sont recopiés dans le texte qu’on lui soumet, à côté des instructions et de la question.

Prompt augmenté

Instructions

  1. Réponds uniquement à partir du contexte fourni.
  2. Si le contexte ne permet pas de répondre, dis-le.
  3. Cite les références des passages utilisés.

Question

  1. Puis-je voyager en classe affaires pour Tokyo ?

Contexte retrouvé

  1. [§7.3] La classe affaires est autorisée sur les vols de plus de six heures.
  2. [§7.4] Une dérogation du responsable de service est requise pour les vols plus courts.
  3. [§7.1] Les vols intérieurs sont réservés en classe économique.

Rien ici n'est un canal privilégié : les instructions, la question et les documents arrivent dans la même entrée. C'est ce qui rend le pipeline simple — et c'est aussi pourquoi un document hostile est un problème réel et non théorique.

Trois zones, un seul texte. C'est là qu'est le « A » de Retrieval-Augmented Generation.

Version textuelle

Le texte soumis au modèle contient trois blocs : des instructions (« réponds uniquement à partir du contexte », « dis-le si tu ne peux pas », « cite tes références »), la question, et les trois fragments retrouvés précédés de leur référence. Tout arrive dans la même entrée.

Notez la deuxième instruction. Elle demande au modèle de dire quand il ne sait pas — et le chapitre 01 a montré pourquoi c’est une demande, pas une garantie.

Et avec les grands contextes ?

Les fenêtres de contexte des grands modèles se comptent désormais en centaines de milliers de tokens. Une objection honnête s’impose donc : si la politique de voyage entière tient dans le contexte, pourquoi la découper ?

Réponse : ne la découpez pas. Quand le corpus tient dans le contexte, versez-le en entier — zéro raté de recherche, zéro fragment orphelin, zéro version périmée retrouvée par ressemblance. Le pipeline de ce chapitre n’a d’intérêt que lorsque quelque chose doit sélectionner, et un grand contexte a aussi ses propres défaillances : le rappel se dégrade au milieu des très longs contextes, le hors-sujet distrait, et chaque requête paie le volume entier. Un contexte court et pertinent bat souvent un contexte énorme et bruyant.

Quand le corpus ne tient pas — et un fonds documentaire d’entreprise ne tient jamais —, la sélection change de forme plutôt que de disparaître. Chez les systèmes agentiques récents, elle devient un outil que l’agent appelle : il cherche, lit, constate qu’il n’a pas trouvé, reformule et recommence. C’est plus fiable qu’un top-k figé avant génération, précisément parce que la boucle du chapitre 02 s’applique à la recherche elle-même. Le serveur qui répond à cet outil contient d’ailleurs souvent l’index de ce chapitre — le pipeline n’est pas mort, il est passé derrière une interface d’outil. C’est l’objet du chapitre suivant.

Et sur des modèles locaux à contexte réduit — quelques dizaines de milliers de tokens, comme les modèles quantifiés qu’on exécute sur son propre matériel — la sélection serrée décrite ici n’est pas une option d’architecture : c’est la condition pour que la réponse existe.

La réponse, et d'où elle vient

Le modèle génère. Ce qui change tout, c’est ce qu’on affiche à côté.

Réponse et provenance

Question Puis-je voyager en classe affaires pour Tokyo ?

Choisissez ce qui cloche

Réponse générée

Oui. Le vol vers Tokyo dépasse six heures, et la classe affaires est autorisée sur les vols de plus de six heures. En deçà de ce seuil, une dérogation du responsable de service serait nécessaire.

Provenance

  • Politique de voyage v4.2 — §7.3
  • Politique de voyage v4.2 — §7.4

La réponse est exacte, et surtout elle est vérifiable : deux clics suffisent à contrôler qu'elle dit bien ce que dit le document.

Sélectionnez un cas. Le premier est le cas nominal ; les cinq autres sont les façons dont ce pipeline produit une réponse fausse sans jamais baisser d'assurance.

Représentation conceptuelle. Réponses reconstituées pour l'exposé, à partir des fragments de la scène précédente.

Version textuelle

Six cas pour la même question. Cas nominal : réponse exacte, appuyée sur §7.3 et §7.4. Document périmé : réponse fidèle à une version remplacée. Mauvaise recherche : passage authentique mais hors sujet. Document absent : le modèle répond depuis ses paramètres, avec un seuil plausible et faux. Sources contradictoires : deux versions retrouvées, additionnées au lieu d’être arbitrées. Contenu hostile : un document contenant des instructions arrive dans la même entrée que les vraies instructions.

Ce qui peut mal tourner

RAG est un pipeline, pas une garantie

Chacun des cinq cas ci-dessus se produit avec un modèle qui fonctionne parfaitement. Aucun ne se corrige en changeant de modèle.

Ils se corrigent — partiellement — ailleurs : dans ce qu’on indexe, dans la fraîcheur de l’index, dans l’arbitrage entre versions, dans le contrôle de ce qui entre dans la base. Autrement dit dans le pipeline, pas dans l’IA.

Et il reste, après tout cela, un écart irréductible entre « le passage était dans le contexte » et « la réponse dit ce que dit le passage ». La provenance ne le supprime pas. Elle le rend contrôlable, ce qui n’est pas la même chose et vaut largement l’effort.

Un meilleur contexte réduit l’incertitude. Il ne l’élimine pas.

L'agent peut savoir.

Il a des outils, une boucle, et maintenant l’accès à ce que votre organisation a écrit. Il peut répondre sur votre politique de voyage en citant le paragraphe exact.

Mais relisez la réponse du cas nominal : « la classe affaires est autorisée ». Le système a dit ce qui est permis. Il n’a réservé aucun vol.

Entre savoir quoi faire et le faire, il y a un pas — et il se franchit par un appel à un système extérieur. Le chapitre suivant porte sur la manière dont on tend cette main sans réinventer un branchement par outil.

Un agent informé

  • Boucle
  • Recherche

Protocole

Capacités découvertes

Un agent branché

  • Boucle
  • Recherche
  • Protocole
  • Capacités découvertes

Il cite le paragraphe exact de votre politique — et il n'a réservé aucun vol. Entre dire ce qui est permis et le faire, il manque un branchement.

Vous êtes ici

  1. 01 Modèle
  2. 02 Agent
  3. 03 Connaissance
  4. 04 Action
  5. 05 Contrôle

L'agent peut savoir. Mais savoir quoi faire et le faire sont deux choses différentes.