conuswebconusweb
Projekt starten

Was RAG ist und wie es in Enterprise-Chatbots funktioniert

RAG für Unternehmen erklärt: wie das Modell aus Ihren eigenen Dokumenten antwortet, wann es dem Fine-Tuning überlegen ist und was über die Qualität entscheidet.

RAG (Retrieval-Augmented Generation) ist eine Architektur, die es einem KI-Modell erlaubt, aus konkreten Unternehmensdaten zu antworten statt nur aus dem allgemeinen Wissen, mit dem es trainiert wurde. Statt dass der Chatbot rät oder mit veralteten Informationen antwortet, sucht das System bei jeder Frage zuerst die relevanten Passagen in Ihrer eigenen Datenbasis, und erst danach erzeugt das Modell eine Antwort. Das Ergebnis ist ein Chatbot, der präzise und aktuell antwortet und auf eine echte Quelle verweist.

Wie RAG Schritt für Schritt funktioniert

  1. Indexierung – Unternehmensdokumente (PDFs, Wiki-Seiten, Datenbanken, interne Handbücher) werden in kleinere Abschnitte zerlegt und in Vektordarstellungen (Embeddings) überführt, die die Bedeutung des Textes erfassen.
  2. Ablage in einer Vektordatenbank – diese Vektoren kommen in eine Datenbank, die schnelle Suche nach inhaltlicher Ähnlichkeit erlaubt, nicht nur nach Stichwörtern.
  3. Retrieval – stellt eine Nutzerin eine Frage, wird sie genauso umgewandelt, und das System findet die relevantesten Dokumentabschnitte.
  4. Generierung – die gefundenen Passagen gehen zusammen mit der Frage an das Modell, das daraus die Antwort formuliert.

Warum Enterprise-Chatbots RAG brauchen

Ein gewöhnlicher Chatbot ohne RAG hat drei Grenzen, die RAG auflöst:

Problem ohne RAGWas RAG ändert
Das Modell kennt interne Unternehmensdaten nichtEs antwortet direkt aus Ihrer Wissensbasis
Informationen sind veraltet, festgelegt beim TrainingDaten werden ohne Neutraining aktualisiert
Das Modell erfindet Fakten (Halluzination)Jede Antwort ist durch ein konkretes Quelldokument belegt
Die Quelle einer Antwort ist nicht prüfbarDas System nennt das Dokument, aus dem die Antwort stammt

Der letzte Punkt ist der Grund, warum RAG im Unternehmen brauchbar ist und ein reiner Chatbot oft nicht. Eine Antwort mit Quelle lässt sich prüfen. Einer Antwort ohne Quelle muss man glauben.

RAG oder Fine-Tuning: wann was

Unternehmen verwechseln RAG oft mit Fine-Tuning, also dem Nachtrainieren des Modells auf eigenen Daten. Das sind unterschiedliche Ansätze:

  • RAG passt, wenn sich die Unternehmensdaten häufig ändern (Preise, Produkte, Prozesse, Dokumentation) und das Modell aus dem aktuellen Stand antworten soll, ohne neu trainiert zu werden.
  • Fine-Tuning passt, wenn Sie Verhalten oder Stil des Modells ändern wollen, etwa Tonfall oder Antwortformat, nicht aber faktisches Wissen ergänzen.

Die meisten Enterprise-Einsätze kombinieren in der Praxis beides, doch RAG ist die Grundschicht für die Arbeit mit Unternehmenswissen.

Anwendungsfälle im B2B-Umfeld

  • Interner Unternehmensassistent – Mitarbeitende fragen nach Richtlinien, Prozessen oder Dokumentation und erhalten Antworten mit Quellenangabe.
  • Kundensupport – der Bot antwortet aus aktuellen Produktdaten und Preislisten statt aus einer statischen FAQ-Seite.
  • Recht und Compliance – Suche und Auslegung von Verträgen, Vorschriften oder internen Richtlinien. Ausführlicher dazu der Artikel über KI-Automatisierung für Anwaltskanzleien.
  • Onboarding und Weiterbildung – neue Mitarbeitende fragen das Unternehmensmaterial direkt, statt Dutzende Dokumente zu durchsuchen.

Was über die Qualität eines RAG-Systems entscheidet

Nicht jede Implementierung funktioniert gleich gut. In den meisten gescheiterten Einsätzen versagt nicht das Modell, sondern die Suche:

  • Chunking – zu große oder zu kleine Textabschnitte senken die Präzision. Wird eine Tabelle mittendrin zerschnitten, bekommt das Modell eine halbe Zeile und erzeugt Unsinn, der richtig klingt.
  • Qualität des Embedding-Modells – sie bestimmt, wie genau das System die inhaltliche Nähe zwischen Frage und Dokumenten erfasst.
  • Aktualisierungsmechanismus – wie oft und auf welchem Weg die Daten erneuert werden und wie Überholtes aus dem Index verschwindet.
  • Metadata-Filtering – die Möglichkeit, die Suche nach Abteilung, Dokumenttyp oder Zugriffsstufe einzugrenzen. Bei mehreren Mandanten in einem System ist das zwingend; dazu der Artikel über die Multi-Tenant-Vektordatenbank.
Die Qualität eines RAG-Systems richtet sich nicht nach der Qualität des Modells. Sie richtet sich nach der Ordnung in Ihren Dokumenten.

Wann RAG nicht die richtige Antwort ist

Wenn es wenige Fragen gibt und die Antworten sich kaum ändern, genügt eine gut geschriebene FAQ-Seite. Wenn Sie rechnen statt suchen müssen, brauchen Sie eine Datenbankabfrage. Und wenn das System etwas tun soll statt zu antworten, suchen Sie eher einen Agenten als einen Chatbot. Zum Budget eines solchen Einsatzes siehe woraus sich der Preis eines KI-Agenten zusammensetzt.

Häufige Fragen

Ist RAG für sensible Unternehmensdaten sicher?
Ja, bei sauberer Umsetzung. Die Daten bleiben in Ihrer eigenen oder EU-gehosteten Infrastruktur, und das Modell greift nur im Moment der Antworterzeugung darauf zu. Entscheidend ist, Zugriffsrechte in der Suchschicht durchzusetzen, nicht erst in der Anwendung.
Lässt sich RAG ohne externe Cloud-Dienste betreiben?
Ja. Eine RAG-Architektur lässt sich vollständig on-premise oder EU-gehostet aufbauen, einschließlich selbst gehosteter Vektordatenbank und lokal laufendem oder EU-konformem Modell. Das ist vor allem für Gesundheitswesen, Rechtsbranche und Finanzinstitute relevant.
Wie lange dauert die Einführung eines RAG-Systems?
Eine Basisimplementierung für eine einzelne Datenquelle dauert in der Regel vier bis acht Wochen. Komplexere Systeme mit mehreren Integrationen dauern länger, abhängig von Zahl und Vielfalt der Datenquellen.
Worin unterscheidet sich RAG von einfacher Stichwortsuche?
Klassische Suche sucht die exakte Wortübereinstimmung. RAG nutzt vektorbasierte, also semantische Suche, die die Bedeutung der Frage auch dann erfasst, wenn die verwendeten Wörter nicht mit denen im Dokument übereinstimmen.
Warum antwortet RAG falsch, obwohl die richtigen Dokumente vorliegen?
Meist, weil die Suche die falschen Passagen gefunden hat oder das Dokument an ungeeigneter Stelle geteilt wurde. Der Fehler liegt in der Regel in der Suchschicht, nicht im Modell.

Läuft in Ihrem Unternehmen etwas langsam oder von Hand?

Erzählen Sie uns davon. Meist reicht ein Gespräch, um zu wissen, ob wir helfen können. Wir antworten innerhalb eines Werktags.

Projekt starten