Une base de connaissances d'entreprise fondée sur RAG
Comment le RAG permet à une IA de répondre à partir de vos propres documents d'entreprise, quelles données y entrent et où se situent les risques.
Équipe rabbitclipPublié: 6 min de lecture
En bref
Le RAG, retrieval augmented generation, désigne un modèle d'IA qui va chercher les passages pertinents des documents propres à une entreprise avant de répondre, puis fonde sa réponse sur ces passages. Un modèle de conversation général ne connaît pas les procédures internes, la liste de prix ou le manuel technique d'une entreprise ; le RAG comble cet écart sans réentraîner le modèle. Le système trouve les sections de document les plus proches de la question posée, les montre au modèle, qui rédige sa réponse en s'appuyant uniquement sur ces sections.
Chez un fabricant de générateurs, l'équipe de service technique pouvait poser une question en langage courant et trouver la bonne page d'un manuel de plusieurs centaines de pages en quelques secondes, au lieu de le parcourir page par page ; le système n'inventait rien en dehors du manuel, parce que la mise en place était construite pour l'exclure.
En quoi le RAG diffère-t-il d'un modèle de conversation général ?
Un modèle de conversation général répond à partir du texte large sur lequel il a été entraîné ; il n'a jamais vu le document propre à l'entreprise. Le RAG recherche dans les documents de l'entreprise dès qu'une question arrive, trouve les passages les plus pertinents, puis les envoie au modèle avec la consigne de répondre uniquement à partir d'eux.
La différence apparaît ici : au lieu de deviner sur un sujet qu'il ne connaît pas, le modèle résume ou cite le document placé devant lui. Si la réponse ne figure pas dans le document, le système devrait le signaler plutôt que d'en inventer une ; ce comportement est spécifiquement testé lors de la mise en place.
Le résultat pratique est qu'un système RAG reste exact avant comme après une mise à jour de document, car il consulte le document à chaque question. Un modèle général, lui, travaille avec des connaissances figées à sa date d'entraînement.
Quels documents deviennent une base de connaissances ?
Manuels produits, procédures internes, FAQ, liste de prix, fiches techniques, anciens dossiers de devis ; tout document écrit et raisonnablement organisé est candidat. Son format, PDF, Word, tableur, est transformé en une forme lisible par le système ; cette étape s'appelle la préparation des données.
Des documents dispersés, contradictoires ou obsolètes ne doivent pas entrer tels quels. Chez un fabricant de vêtements de travail, trois services tenaient chacun leur propre version du même tableau de prix ; ce tableau a été fusionné avant d'approcher le système, sinon il n'aurait pas su quelle version était juste.
Les documents qui changent souvent, la liste de prix en premier lieu, devraient rester dans une catégorie à part ; si le système est configuré pour les retraiter automatiquement à chaque mise à jour, le risque de répondre à partir d'un prix périmé chute nettement.
Quelles sont les étapes de la mise en place ?
La mise en place suit quatre étapes principales, chacune dépendant de l'exactitude de la précédente.
- Rassemblez les documents à intégrer, et retirez ceux qui sont contradictoires ou obsolètes
- Découpez les documents en fragments interrogeables et chargez-les dans une base vectorielle
- Construisez le flux question-réponse : recherche, sélection du fragment, réponse du modèle
- Préparez un jeu de test qui confirme que les réponses reposent uniquement sur le document trouvé
- Définissez les droits d'accès : qui peut interroger quel document
- Fixez un calendrier de mise à jour du système à chaque changement de document
Pourquoi le contrôle d'accès est-il une question à part ?
Une base de connaissances peut aussi contenir les documents les plus sensibles d'une entreprise : données de salaire, contrat fournisseur, plan produit non encore annoncé. La mise en place doit définir clairement qui peut atteindre quel document ; sinon l'assistant pourrait résumer un document sensible pour quelqu'un qui n'aurait jamais dû le voir.
Cela fait de la mise en place du RAG autant un projet de contrôle d'accès qu'un projet technique. Un accès séparé par service, au moins au premier lancement, est plus sûr qu'un système ouvert à toute l'entreprise.
Quand le système se trompe-t-il, et comment s'en apercevoir ?
L'erreur la plus courante survient quand le modèle tente de combler, avec ses propres connaissances générales, un vide que le document ne couvre pas. La réponse paraît fluide mais n'a pas de vraie source ; la mise en place devrait montrer sur quelle section de document chaque réponse s'appuie, et l'utilisateur devrait pouvoir voir cette source.
Chez une chaîne de spas, l'assistant a un jour répondu à partir d'une liste de prix obsolète qui n'avait pas été retraitée ; sans source visible, cette erreur aurait pu passer inaperçue pendant des semaines. Montrer la source est la seule preuve concrète de la fiabilité du système.
Faut-il un entretien, et qui doit s'en charger ?
Une base de connaissances n'est pas un système que l'on installe puis abandonne ; c'est une structure vivante qui doit être retraitée à chaque changement de document. La responsabilité devrait généralement revenir au service qui produit le document ; l'équipe technique se contente de maintenir le système en marche.
Une vérification mensuelle montre quel document est devenu obsolète et quel nouveau mérite d'y entrer. Sauter cette vérification laisse la précision du système dériver, entraînant la confiance des utilisateurs avec elle.
Laisser la responsabilité floue laisse une base de connaissances vieillir en silence, sans que personne ne remarque les erreurs s'accumuler. Désigner une personne clairement responsable de la mise à jour est plus efficace que n'importe quelle solution technique.
Le RAG est la façon la plus maîtrisée de faire entrer le savoir propre d'une entreprise dans un modèle d'IA ; il ne demande aucun réentraînement, et se met à jour dès qu'un document change. La partie difficile de la mise en place n'est pas la technologie, c'est de décider quels documents méritent confiance et de bien tracer les limites d'accès. Lors d'un échange de découverte avec rabbitclip, nous pouvons déterminer ensemble lesquels de vos documents sont prêts à devenir une base de connaissances.
Questions fréquentes
Le RAG réentraîne-t-il le modèle ?
Non, le modèle reste tel quel ; le système lui montre seulement le document pertinent avant qu'il ne réponde.
Un système RAG a-t-il besoin d'une connexion internet ?
Pas nécessairement ; les documents peuvent rester dans l'environnement propre de l'entreprise et n'être ouverts qu'aux personnes autorisées, selon la configuration choisie.
Une petite entreprise a-t-elle besoin d'une base de connaissances ?
Cela devient utile quand le nombre de documents et de questions internes répétées augmente ; un guide de quelques pages n'en a généralement pas besoin.
Que se passe-t-il si le système répond de travers ?
Comme la source est montrée, on voit de quel document elle vient ; le document est corrigé ou retiré, puis la réponse est testée à nouveau.
