Glossaire

RAG

Une architecture qui permet à un modèle de langage de construire sa réponse à partir de documents extraits d'une base de données, plutôt que de sa seule connaissance générale.

Synonymes

Retrieval-Augmented Generation, génération augmentée par la recherche

Comment fonctionne le RAG

RAG signifie Retrieval-Augmented Generation. Lorsqu'une question est posée, le système commence par interroger une base documentaire pour en extraire les passages les plus pertinents, puis les transmet au modèle avec la question. Le modèle formule sa réponse en s'appuyant sur ces passages, pas uniquement sur ses données d'entraînement générales.

La base documentaire est indexée sous forme de vecteurs numériques, ce qui permet une recherche par proximité sémantique. Un document parlant de « contrat de prestation » et une question posée sur « accord de service » peuvent être reliés par ce mécanisme, là où une recherche par mots exacts échouerait.

Cette architecture réduit les erreurs du modèle sur des sujets spécialisés, parce que la réponse est ancrée dans un corpus défini. Elle ne les élimine pas : le modèle peut mal interpréter un document, et la qualité des réponses dépend directement de la qualité et de la fraîcheur de la base documentaire.

RAG dans un projet

Le RAG convient quand le système doit répondre à des questions sur un corpus que le modèle ne connaît pas : documentation interne, catalogue produit, base de connaissances, historique de tickets de support. La base doit être mise à jour régulièrement pour que les réponses restent exactes.

Deux décisions structurantes se prennent au cadrage. La granularité des documents indexés : un document découpé trop finement perd son contexte, trop grossièrement noie l'information pertinente dans le bruit. La règle de validation : la réponse est présentée comme une proposition, et une personne la confirme avant qu'elle soit utilisée dans un processus.

Un RAG mal paramétré produit des réponses dont rien dans l'interface ne signale visuellement l'inexactitude. La vérification humaine n'est pas une précaution ajoutée, c'est le mécanisme de sécurité du système.

Sur le plan technique, le dispositif comprend au minimum une base vectorielle, un processus d'indexation des documents et un module d'appel au modèle. Ces éléments s'intègrent dans le logiciel existant via des API.

Le RAG ne convient pas à tous les cas. Pour une extraction d'informations dans un document unique transmis à chaque appel, le document peut être passé directement au modèle sans base vectorielle intermédiaire. La pertinence du RAG dépend du volume documentaire, de la fréquence de mise à jour de la base et du délai acceptable entre la publication d'un document et sa prise en compte dans les réponses. Ces critères se vérifient au cadrage. Un projet qui démarre par un prototype simple, puis qui constate que la connaissance générale du modèle ne suffit pas, est un bon candidat à l'évolution vers une architecture RAG.