RAG-Wissensdatenbank im Unternehmen: So funktioniert sie
Wie RAG (Retrieval Augmented Generation) einer KI erlaubt, aus den eigenen Firmendokumenten zu antworten, welche Daten hinein dürfen und wo Risiken liegen.
rabbitclip-TeamVeröffentlicht: 5 Min. Lesezeit
Kurz gesagt
RAG, ausgeschrieben Retrieval Augmented Generation, bedeutet, dass ein KI-Modell vor der Antwort erst die passenden Abschnitte aus den eigenen Firmendokumenten holt und die Antwort darauf stützt. Ein allgemeines Sprachmodell kennt die internen Abläufe, die Preisliste oder das technische Handbuch eines Unternehmens nicht; RAG schließt diese Lücke, ohne das Modell neu zu trainieren. Das System sucht die zur Frage passendsten Dokumentabschnitte, zeigt sie dem Modell, und das Modell formuliert seine Antwort nur auf dieser Grundlage.
Beim technischen Service eines Generatorherstellers konnte das Team eine Frage in normaler Sprache stellen und die passende Seite eines hunderte Seiten starken Handbuchs binnen Sekunden finden, statt seitenweise zu suchen; das System erfand nichts außerhalb des Handbuchs, weil die Einrichtung genau das ausschließen sollte.
Wie unterscheidet sich RAG von einem allgemeinen Sprachmodell?
Ein allgemeines Sprachmodell antwortet aus dem breiten Text, mit dem es trainiert wurde; das eigene Dokument des Unternehmens hat es nie gesehen. RAG durchsucht bei einer Frage die Firmendokumente, findet die relevantesten Abschnitte und schickt sie mit der Anweisung an das Modell, nur darauf basierend zu antworten.
Der Unterschied zeigt sich hier: Statt bei einem unbekannten Thema zu raten, fasst das Modell das vorgelegte Dokument zusammen oder zitiert daraus. Steht die Antwort nicht im Dokument, sollte das System das sagen, statt etwas zu erfinden; genau dieses Verhalten wird bei der Einrichtung eigens getestet.
Das praktische Ergebnis: Ein RAG-System bleibt vor und nach einer Dokumentaktualisierung gleichermaßen korrekt, weil es bei jeder Frage neu nachschaut. Ein allgemeines Modell dagegen arbeitet mit Wissen, das am Trainingsdatum eingefroren wurde.
Welche Dokumente werden zu einer Wissensdatenbank?
Produkthandbücher, interne Abläufe, häufige Fragen, eine Preisliste, technische Spezifikationen, alte Angebotsunterlagen; jedes geschriebene, einigermaßen geordnete Dokument kommt infrage. Das Format, PDF, Word, eine Tabelle, wird in eine Form gebracht, die das System lesen kann; dieser Schritt heißt Datenaufbereitung.
Verstreute, widersprüchliche oder veraltete Dokumente sollten nicht unverändert einfließen. Bei einem Arbeitsschutzkleidung-Hersteller führten drei Abteilungen jeweils eine eigene Version derselben Preistabelle; diese wurde zusammengeführt, bevor sie in die Nähe des Systems kam, sonst hätte niemand gewusst, welche Version stimmt.
Sich häufig ändernde Dokumente, vor allem eine Preisliste, sollten in einer eigenen Kategorie liegen; ist das System so eingerichtet, dass es diese bei jeder Aktualisierung automatisch neu verarbeitet, sinkt das Risiko veralteter Antworten deutlich.
Welche Schritte umfasst die Einrichtung?
Die Einrichtung läuft über vier Hauptschritte, jeder hängt von der Genauigkeit des vorherigen ab.
- Sammeln Sie die einzuspeisenden Dokumente und entfernen Sie widersprüchliche oder veraltete
- Teilen Sie die Dokumente in durchsuchbare Abschnitte und laden Sie sie in eine Vektordatenbank
- Bauen Sie den Frage-Antwort-Ablauf: Suche, Auswahl des Abschnitts, Antwort des Modells
- Erstellen Sie ein Testset, das bestätigt, dass Antworten nur auf dem gefundenen Dokument beruhen
- Legen Sie die Zugriffsrechte fest: Wer darf zu welchem Dokument Fragen stellen
- Setzen Sie einen Zeitplan, nach dem das System bei jeder Dokumentänderung aktualisiert wird
Warum ist die Zugriffskontrolle ein eigenes Thema?
Eine Wissensdatenbank kann auch die sensibelsten Dokumente eines Unternehmens enthalten: Gehaltsdaten, einen Lieferantenvertrag, einen noch unveröffentlichten Produktplan. Bei der Einrichtung muss klar festgelegt sein, wer welches Dokument erreichen darf; sonst könnte der Assistent ein sensibles Dokument für jemanden zusammenfassen, der es nie hätte sehen sollen.
Damit ist die RAG-Einrichtung ebenso sehr ein Zugriffskontrollprojekt wie ein technisches. Ein nach Abteilung getrennter Zugriff ist, zumindest beim ersten Start, sicherer als ein System, das dem ganzen Unternehmen offensteht.
Wann liegt das System falsch, und wie merkt man es?
Der häufigste Fehler entsteht, wenn das Modell versucht, eine Lücke, die das Dokument nicht abdeckt, mit eigenem allgemeinem Wissen zu füllen. Die Antwort liest sich flüssig, hat aber keine echte Quelle; die Einrichtung sollte zeigen, auf welchen Dokumentabschnitt sich jede Antwort stützt, und der Nutzer sollte diese Quelle sehen können.
Bei einer Spa-Kette antwortete der Assistent einmal aus einer veralteten, nicht neu verarbeiteten Preisliste; ohne sichtbare Quelle hätte dieser Fehler wochenlang unbemerkt bleiben können. Die Quellenanzeige ist der einzige echte Beweis für die Vertrauenswürdigkeit des Systems.
Braucht es Pflege, und wer ist dafür zuständig?
Eine Wissensdatenbank ist kein System, das man einrichtet und sich selbst überlässt; sie ist eine lebendige Struktur, die bei jeder Dokumentänderung neu verarbeitet werden muss. Die Zuständigkeit sollte meist bei der Abteilung liegen, die das Dokument erstellt; das technische Team hält das System nur am Laufen.
Eine monatliche Prüfung zeigt, welches Dokument veraltet ist und welches neue eine Aufnahme verdient. Wird diese Prüfung übersprungen, driftet die Genauigkeit des Systems ab, und mit ihr das Vertrauen der Nutzer.
Bleibt die Zuständigkeit unklar, veraltet eine Wissensdatenbank still, ohne dass jemand die sich häufenden Fehler bemerkt. Eine Person namentlich für die Aktualisierung verantwortlich zu machen, ist wirksamer als jede technische Lösung.
RAG ist der kontrollierteste Weg, das eigene Wissen eines Unternehmens in ein KI-Modell zu bringen; es braucht kein neues Training, und es aktualisiert sich selbst, sobald sich ein Dokument ändert. Der schwierige Teil der Einrichtung ist nicht die Technik, sondern die Entscheidung, welchen Dokumenten man vertrauen kann, und die richtige Ziehung der Zugriffsgrenzen. In einem Erstgespräch mit rabbitclip können wir herausarbeiten, welche Ihrer Dokumente bereit sind, zu einer Wissensdatenbank zu werden.
Häufige Fragen
Wird das Modell durch RAG neu trainiert?
Nein, das Modell bleibt unverändert; das System zeigt ihm vor der Antwort nur das passende Dokument.
Braucht ein RAG-System eine Internetverbindung?
Nicht zwingend; die Dokumente können in der eigenen Umgebung des Unternehmens bleiben und nur für berechtigte Personen geöffnet werden, je nach gewählter Einrichtung.
Braucht ein kleines Unternehmen eine Wissensdatenbank?
Sie lohnt sich, sobald Dokumentenzahl und wiederkehrende interne Fragen zunehmen; für einen Leitfaden von wenigen Seiten braucht es meist keine.
Was passiert, wenn das System falsch antwortet?
Da die Quelle angezeigt wird, sieht man, aus welchem Dokument die Antwort stammt; das Dokument wird korrigiert oder entfernt, die Antwort erneut getestet.
