Was RAG ist und wie es in Enterprise-Chatbots funktioniert
RAG für Unternehmen erklärt: wie das Modell aus Ihren eigenen Dokumenten antwortet, wann es dem Fine-Tuning überlegen ist und was über die Qualität entscheidet.

RAG (Retrieval-Augmented Generation) ist eine Architektur, die es einem KI-Modell erlaubt, aus konkreten Unternehmensdaten zu antworten statt nur aus dem allgemeinen Wissen, mit dem es trainiert wurde. Statt dass der Chatbot rät oder mit veralteten Informationen antwortet, sucht das System bei jeder Frage zuerst die relevanten Passagen in Ihrer eigenen Datenbasis, und erst danach erzeugt das Modell eine Antwort. Das Ergebnis ist ein Chatbot, der präzise und aktuell antwortet und auf eine echte Quelle verweist.
Wie RAG Schritt für Schritt funktioniert
- Indexierung – Unternehmensdokumente (PDFs, Wiki-Seiten, Datenbanken, interne Handbücher) werden in kleinere Abschnitte zerlegt und in Vektordarstellungen (Embeddings) überführt, die die Bedeutung des Textes erfassen.
- Ablage in einer Vektordatenbank – diese Vektoren kommen in eine Datenbank, die schnelle Suche nach inhaltlicher Ähnlichkeit erlaubt, nicht nur nach Stichwörtern.
- Retrieval – stellt eine Nutzerin eine Frage, wird sie genauso umgewandelt, und das System findet die relevantesten Dokumentabschnitte.
- Generierung – die gefundenen Passagen gehen zusammen mit der Frage an das Modell, das daraus die Antwort formuliert.
Warum Enterprise-Chatbots RAG brauchen
Ein gewöhnlicher Chatbot ohne RAG hat drei Grenzen, die RAG auflöst:
| Problem ohne RAG | Was RAG ändert |
|---|---|
| Das Modell kennt interne Unternehmensdaten nicht | Es antwortet direkt aus Ihrer Wissensbasis |
| Informationen sind veraltet, festgelegt beim Training | Daten werden ohne Neutraining aktualisiert |
| Das Modell erfindet Fakten (Halluzination) | Jede Antwort ist durch ein konkretes Quelldokument belegt |
| Die Quelle einer Antwort ist nicht prüfbar | Das System nennt das Dokument, aus dem die Antwort stammt |
Der letzte Punkt ist der Grund, warum RAG im Unternehmen brauchbar ist und ein reiner Chatbot oft nicht. Eine Antwort mit Quelle lässt sich prüfen. Einer Antwort ohne Quelle muss man glauben.
RAG oder Fine-Tuning: wann was
Unternehmen verwechseln RAG oft mit Fine-Tuning, also dem Nachtrainieren des Modells auf eigenen Daten. Das sind unterschiedliche Ansätze:
- RAG passt, wenn sich die Unternehmensdaten häufig ändern (Preise, Produkte, Prozesse, Dokumentation) und das Modell aus dem aktuellen Stand antworten soll, ohne neu trainiert zu werden.
- Fine-Tuning passt, wenn Sie Verhalten oder Stil des Modells ändern wollen, etwa Tonfall oder Antwortformat, nicht aber faktisches Wissen ergänzen.
Die meisten Enterprise-Einsätze kombinieren in der Praxis beides, doch RAG ist die Grundschicht für die Arbeit mit Unternehmenswissen.
Anwendungsfälle im B2B-Umfeld
- Interner Unternehmensassistent – Mitarbeitende fragen nach Richtlinien, Prozessen oder Dokumentation und erhalten Antworten mit Quellenangabe.
- Kundensupport – der Bot antwortet aus aktuellen Produktdaten und Preislisten statt aus einer statischen FAQ-Seite.
- Recht und Compliance – Suche und Auslegung von Verträgen, Vorschriften oder internen Richtlinien. Ausführlicher dazu der Artikel über KI-Automatisierung für Anwaltskanzleien.
- Onboarding und Weiterbildung – neue Mitarbeitende fragen das Unternehmensmaterial direkt, statt Dutzende Dokumente zu durchsuchen.
Was über die Qualität eines RAG-Systems entscheidet
Nicht jede Implementierung funktioniert gleich gut. In den meisten gescheiterten Einsätzen versagt nicht das Modell, sondern die Suche:
- Chunking – zu große oder zu kleine Textabschnitte senken die Präzision. Wird eine Tabelle mittendrin zerschnitten, bekommt das Modell eine halbe Zeile und erzeugt Unsinn, der richtig klingt.
- Qualität des Embedding-Modells – sie bestimmt, wie genau das System die inhaltliche Nähe zwischen Frage und Dokumenten erfasst.
- Aktualisierungsmechanismus – wie oft und auf welchem Weg die Daten erneuert werden und wie Überholtes aus dem Index verschwindet.
- Metadata-Filtering – die Möglichkeit, die Suche nach Abteilung, Dokumenttyp oder Zugriffsstufe einzugrenzen. Bei mehreren Mandanten in einem System ist das zwingend; dazu der Artikel über die Multi-Tenant-Vektordatenbank.
Die Qualität eines RAG-Systems richtet sich nicht nach der Qualität des Modells. Sie richtet sich nach der Ordnung in Ihren Dokumenten.
Wann RAG nicht die richtige Antwort ist
Wenn es wenige Fragen gibt und die Antworten sich kaum ändern, genügt eine gut geschriebene FAQ-Seite. Wenn Sie rechnen statt suchen müssen, brauchen Sie eine Datenbankabfrage. Und wenn das System etwas tun soll statt zu antworten, suchen Sie eher einen Agenten als einen Chatbot. Zum Budget eines solchen Einsatzes siehe woraus sich der Preis eines KI-Agenten zusammensetzt.
Häufige Fragen
- Ist RAG für sensible Unternehmensdaten sicher?
- Ja, bei sauberer Umsetzung. Die Daten bleiben in Ihrer eigenen oder EU-gehosteten Infrastruktur, und das Modell greift nur im Moment der Antworterzeugung darauf zu. Entscheidend ist, Zugriffsrechte in der Suchschicht durchzusetzen, nicht erst in der Anwendung.
- Lässt sich RAG ohne externe Cloud-Dienste betreiben?
- Ja. Eine RAG-Architektur lässt sich vollständig on-premise oder EU-gehostet aufbauen, einschließlich selbst gehosteter Vektordatenbank und lokal laufendem oder EU-konformem Modell. Das ist vor allem für Gesundheitswesen, Rechtsbranche und Finanzinstitute relevant.
- Wie lange dauert die Einführung eines RAG-Systems?
- Eine Basisimplementierung für eine einzelne Datenquelle dauert in der Regel vier bis acht Wochen. Komplexere Systeme mit mehreren Integrationen dauern länger, abhängig von Zahl und Vielfalt der Datenquellen.
- Worin unterscheidet sich RAG von einfacher Stichwortsuche?
- Klassische Suche sucht die exakte Wortübereinstimmung. RAG nutzt vektorbasierte, also semantische Suche, die die Bedeutung der Frage auch dann erfasst, wenn die verwendeten Wörter nicht mit denen im Dokument übereinstimmen.
- Warum antwortet RAG falsch, obwohl die richtigen Dokumente vorliegen?
- Meist, weil die Suche die falschen Passagen gefunden hat oder das Dokument an ungeeigneter Stelle geteilt wurde. Der Fehler liegt in der Regel in der Suchschicht, nicht im Modell.
Verwandte Artikel

Was ein KI-Agent ist und worin er sich von einem Chatbot unterscheidet
Ein Chatbot beantwortet die Frage, ein Agent erledigt die Aufgabe. Der Unterschied in der Architektur, drei Stufen der Autonomie und wann was genügt.
Artikel lesen
Wie eine Multi-Tenant-Vektordatenbank mehrere Kunden zugleich bedient
Eine KI-Infrastruktur für Dutzende Kunden, ohne dass sich deren Daten vermischen: Metadaten-Filterung, die wesentlichen Architekturentscheidungen und die Isolationstests.
Artikel lesen
Sicherheitsrisiken beim Einsatz von LLMs in Unternehmensprozessen
Sechs Risiken, die nicht aus dem Modell stammen, sondern aus der Architektur darum herum: Datenabfluss, Prompt Injection, Rechtetrennung, Agentenhandeln, Halluzination und Audit.
Artikel lesen
conusweb
conusweb