RAG (Génération augmentée par récupération)
Définition courte
Le RAG permet à un modèle d'IA de puiser l'information dans des documents fiables avant de rédiger sa réponse, plutôt que de se fier à sa seule mémoire.
Le RAG, génération augmentée par récupération, fait consulter à un modèle de langage un document ou une base de données précis au moment même de la requête, plutôt que de s'appuyer uniquement sur ce qu'il a appris pendant son entraînement. Il recherche d'abord la source pertinente, puis rédige une réponse ancrée dedans.
Cette méthode réduit la tendance du modèle à inventer, halluciner, sur un sujet qu'il ne connaît pas ou connaît de façon dépassée, car la réponse provient désormais d'une source montrée plutôt que de motifs généraux.
Une entreprise peut connecter son propre catalogue de produits, ses textes de FAQ ou ses documents de politique à un système RAG, afin qu'un assistant client ne parle qu'à partir de ses propres données exactes.
Le RAG est souvent confondu avec le réajustement du modèle, ou fine-tuning, pourtant le RAG laisse le modèle inchangé et lui montre simplement un document pertinent au moment de la requête, alors que le fine-tuning réentraîne les poids du modèle. En pratique, vous reconnaissez un système RAG à la présence d'une source ou d'une référence de page dans la réponse ; son absence signale que le modèle s'appuie sur son entraînement d'origine.
Pourquoi c'est important
Mettre en place un RAG garantit qu'un assistant IA parle à partir des données exactes propres à l'entreprise plutôt que d'un savoir général tiré d'internet. Cela réduit fortement le risque d'annoncer un prix erroné ou une politique inexacte.
Exemple illustratif
Un prestataire de terminal de paiement virtuel a relié son assistant support à sa propre documentation technique via le RAG, il ne suggère plus d'étapes d'intégration obsolètes.
