RAG-System erklärt: Aufbau, Kosten & Praxis
Zuletzt aktualisiert am 13. August 2026 um 16:36 Uhr.Ein RAG-System – Retrieval Augmented Generation – verbindet ein großes Sprachmodell (LLM) mit unternehmenseigenen Daten, indem es relevante Dokumente zur Laufzeit abruft und als Kontext an das Modell übergibt. Statt das Modell mit internem Wissen nachzutrainieren, liefert RAG die Fakten bei jeder Anfrage frisch aus einer indexierten Wissensbasis. Der Enterprise-RAG-Markt erreichte 2025 ein Volumen von 1,94 Milliarden US-Dollar und wächst laut MarketsandMarkets mit einer jährlichen Rate von 38,4 Prozent. Dieser Artikel beschreibt die Mechanik hinter RAG, zeigt die Bausteine von der Datenaufbereitung bis zur Vektordatenbank und benennt die Kostenfaktoren, die über Erfolg oder Scheitern entscheiden.

Warum ein Sprachmodell allein nicht reicht
Sprachmodelle wissen nur, was in ihren Trainingsdaten steckt. Unternehmenswissen – Verträge, Produktdokumentation, interne Prozesse, Preislisten – fehlt dort vollständig. Wer das Modell trotzdem nach internen Sachverhalten fragt, bekommt plausibel klingende Antworten ohne Substanz. RAG löst dieses Problem, indem es die Wissensbasis vom Modell trennt und bei jeder Anfrage die passenden Quellen nachliefert.
Ist ein Angebot komplex, erklärungsbedürftig oder hochpreisig, reicht ein einzelnes Format selten aus. Eine Übersicht der passenden Content-Arten zeigt, mit welchen Inhalten sich ein solches Ziel erreichen lässt – geordnet danach, welche Aufgabe der jeweilige Baustein im Kaufprozess übernimmt.
RAG und Fine-Tuning: Zwei verschiedene Werkzeuge
Fine-Tuning verändert die Modellparameter selbst. Das kostet pro Trainingslauf mehrere Hundert bis mehrere Tausend US-Dollar, liefert keine Quellenangaben und kann keine nutzerspezifischen Berechtigungen abbilden. RAG dagegen lässt das Modell unangetastet, aktualisiert Wissen durch Re-Indexierung und liefert Zitate mit. Die beiden Ansätze schließen sich nicht aus – manche Produktivsysteme kombinieren Fine-Tuning für Tonalität mit RAG für Fakten. Für die meisten Unternehmensfälle ist RAG jedoch der bessere Startpunkt.
| Kriterium | RAG | Fine-Tuning |
|---|---|---|
| Wissens-Aktualisierung | Re-Indexierung, Minuten bis Stunden | Neutraining, Tage bis Wochen |
| Quellenangaben | Ja, nativ | Nein |
| Kosten pro Update | Gering (Embedding-Kosten) | Hoch (GPU-Stunden, Datenaufbereitung) |
Typische Einsatzzwecke
RAG eignet sich überall dort, wo Antworten auf unternehmenseigenen Dokumenten basieren müssen: interner Helpdesk, Vertragsprüfung, Onboarding-Assistenten, technische Dokumentation und Wissensmanagement über Abteilungsgrenzen hinweg.
Funktionsweise im Überblick: Fünf Schritte vom Dokument zur Antwort
Ein RAG-System durchläuft bei jeder Nutzeranfrage eine feste Kette:
- Indexierung wandelt Dokumente in durchsuchbare Vektoren um.
- Retrieval findet die passenden Textpassagen zur Anfrage.
- Augmentation reichert den Prompt mit diesen Passagen an.
- Generation erzeugt die Antwort auf Basis des angereicherten Kontexts.
- Citation verknüpft jede Aussage mit ihrer Quelle.
Die Qualität jedes einzelnen Schritts bestimmt die Qualität des Gesamtsystems. Ohne den letzten Schritt – die Quellenverknüpfung – ist das System nicht überprüfbar. Ein nicht überprüfbares System ist im Unternehmenskontext wertlos.
Datenaufbereitung: Wo RAG steht und fällt
Die Aufbereitung der Wissensbasis entscheidet über die Retrieval-Qualität stärker als die Wahl des Sprachmodells.
Chunking-Strategien bestimmen die Trefferqualität
Chunking bedeutet, Dokumente in Abschnitte zu zerlegen, die groß genug für Kontext und klein genug für präzises Retrieval sind. Die Chunk-Größe liegt in der Praxis zwischen 256 und 1.024 Token, mit 10 bis 20 Prozent Überlappung zwischen benachbarten Chunks.
| Strategie | Stärke | Schwäche |
|---|---|---|
| Rekursives Splitting | Einfach, deterministisch | Ignoriert semantische Grenzen |
| Semantisches Chunking | Kontexterhalt an Themenwechseln | Rechenintensiver |
| Hierarchisches Chunking | Eltern-Kind-Kontext zwischen Abschnitten | Komplexere Indexstruktur |
Metadaten und Aktualisierung
Jeder Chunk braucht Metadaten: Dokumenttitel, Erstellungsdatum, Autor, Abteilung, Berechtigungsstufe. Diese Metadaten ermöglichen späteres Filtern und Berechtigungsmanagement. Die Aktualisierung der Wissensbasis muss geplant sein – ein RAG-System mit veralteten Dokumenten liefert veraltete Antworten. Kontinuierliche Synchronisation mit den Quellsystemen ist der Produktionsstandard.
Vektordatenbanken: Das Gedächtnis des Systems
Eine Vektordatenbank speichert Dokumente nicht als Text, sondern als hochdimensionale numerische Repräsentationen – sogenannte Embeddings. Ein Embedding-Modell wandelt Text in einen Vektor um, der die semantische Bedeutung kodiert. Bei einer Anfrage wird die Frage ebenfalls in einen Vektor umgewandelt und per Ähnlichkeitssuche mit den gespeicherten Vektoren verglichen.
Auswahlkriterien und Hosting
Gängige Lösungen sind Pinecone (managed, serverless), Weaviate (Open Source, Hybrid Search nativ), Qdrant (performant, self-hosted), OpenSearch (oft in Plattformen integriert) und pgvector (PostgreSQL-Erweiterung für Teams mit bestehender Infrastruktur). Die Entscheidung hängt an drei Faktoren:
- Skalierungsanforderung: Millionen vs. Milliarden Vektoren
- Hosting-Präferenz: Managed vs. Self-Hosted
- Hybrid-Search-Fähigkeit: Vektor plus Keyword-Suche in einem Index
Laut VentureBeat hat sich die Absicht zur Nutzung hybrider Retrieval-Verfahren (Vektor plus BM25) im ersten Quartal 2025 von 10,3 auf 33,3 Prozent verdreifacht. Das deutet darauf hin, dass reine Vektorsuche allein für viele Produktionsszenarien nicht ausreicht.
Abruf und Relevanz: Hybride Suche als Produktionsstandard
Reine Vektorsuche scheitert an Akronymen, Produktnummern und exakten Phrasen. Der Produktionsstandard kombiniert deshalb Dense Retrieval (semantische Ähnlichkeit) mit Sparse Retrieval (BM25-Keyword-Suche) und fusioniert die Ergebnislisten per Reciprocal Rank Fusion. Danach ordnet ein Reranker – ein kleineres, spezialisiertes Modell – die Top-Kandidaten nach tieferer Relevanz neu. Databricks berichtet von einer messbaren Verbesserung der Retrieval-Genauigkeit nach Einführung eines Rerankers.
Qualität messen
Retrieval-Qualität lässt sich mit drei Metriken bewerten:
- Precision: Wie viele abgerufene Chunks sind tatsächlich relevant?
- Recall: Wie viele relevante Chunks wurden gefunden?
- Answer Faithfulness: Stimmt die Antwort mit der Quelle überein?
Frameworks wie RAGAS automatisieren diese Evaluation. Ohne Messung bleibt jede Optimierung spekulativ.
Integration in bestehende Workflows
RAG ist kein isoliertes Chatfenster, sondern ein Baustein in einer Orchestrierung. In der Praxis bedeutet das: Anbindung an Ticketsysteme, CRM, Dokumentenmanagement und interne Tools über Konnektoren.
Wer Inhalte in der Geschwindigkeit produzieren will, die KI heute erlaubt, ohne dass am Ende jeder Text nach Maschine klingt, findet in agentengestützten Content Operations einen Ansatz, bei dem Repurposing, Executive Ghostwriting und Qualitätssicherung entlang der eigenen Brand Voice orchestriert werden.
Berechtigungen und Skalierung
Permission-Aware Retrieval ist die technische Pflicht: Das System muss bei jeder Anfrage prüfen, welche Dokumente der anfragende Nutzer sehen darf. Die Berechtigungen werden aus den Quellsystemen synchronisiert und beim Retrieval durchgesetzt – nicht erst in der Oberfläche. Caching häufiger Anfragen reduziert Latenz und Kosten. Skalierung erfolgt über horizontale Verteilung der Vektordatenbank und Load Balancing der Inference-Schicht.
| Faktor | Maßnahme | Wirkung |
|---|---|---|
| Latenz | Caching, Reranker-Optimierung | Niedrigere Antwortzeiten |
| Kosten | Chunk-Größe optimieren, günstigere Embedding-Modelle evaluieren | Reduzierte Inference- und Indexierungskosten |
| Sicherheit | ACL-Sync aus Quellsystemen | Kein Datenleck über RAG-Antworten |
Halluzinationen reduzieren: Quellenbindung als Konstruktionsprinzip
RAG eliminiert Halluzinationen nicht vollständig. Die Stanford-RegLab-Studie (2024) fand, dass produktive juristische RAG-Systeme bei 17 bis 33 Prozent der Anfragen halluzinierten – besser als ein nacktes LLM, aber nicht fehlerfrei.
Drei Hebel reduzieren das Risiko:
- Der Prompt weist das Modell explizit an, bei fehlendem Kontext mit „Ich weiß es nicht" zu antworten, statt zu spekulieren.
- Jede Aussage wird mit der Quell-Chunk-ID verknüpft, damit Nutzer die Herkunft prüfen können.
- Automatisierte Evaluation über Hallucination-Detection-Modelle bewertet, ob eine Antwort durch den Kontext gedeckt ist. Feedback-Schleifen – Nutzer markieren falsche Antworten – fließen in die Optimierung von Chunking, Retrieval und Prompts zurück.
Bevor ein Unternehmen teure Software beschafft, deren Nutzen sich erst nach Monaten zeigt, lohnt der Blick auf Rapid Prototyping mit KI-Tools: vom Briefing zum klickbaren Prototyp in Tagen statt Monaten. Interne Tools, Dashboards und Mockups entstehen früh genug, um sie im Feld zu testen.
Betrieb und Kosten: Was ein RAG-System wirklich kostet
Die Kostenfaktoren bei RAG verteilen sich auf vier Ebenen:
- Embedding-Berechnung: Einmalig bei Indexierung plus bei jedem Update der Wissensbasis.
- Vektordatenbank-Hosting: Abhängig von Indexgröße und Abfragevolumen.
- LLM-Inference: Pro generierter Antwort, abhängig von Modell und Token-Anzahl.
- Engineering-Betrieb: Monitoring, Wartung, Connector-Pflege, Personalkosten.
Eine grobe Orientierung: Bei einem Deployment mit 200 Nutzern, die jeweils 20 Anfragen pro Tag stellen, fallen monatlich rund 120.000 Anfragen an. Bei einem Modellpreis von 3 USD pro Million Input-Token (z. B. GPT-4o) und durchschnittlich 2.000 Token Kontext pro Anfrage ergeben sich allein für die Inference rund 720 USD pro Monat. Hinzu kommen Vektordatenbank-Hosting (ab ca. 100 USD/Monat für Managed-Lösungen bis mehrere Tausend USD bei großen Indizes), Embedding-Kosten bei Updates und vor allem Personalkosten für Betrieb und Weiterentwicklung. Die Gesamtkosten variieren je nach Architektur, Modellwahl und Teamgröße erheblich.
Datenschutz ist eine Architekturentscheidung. Wer personenbezogene Daten indexiert, muss Löschpflichten im Index abbilden. Wer regulierte Branchen bedient, braucht Self-Hosting oder Air-Gapped-Deployment ohne Datenabfluss an Dritte. Die Wahl zwischen Managed Cloud und Self-Hosted folgt den Compliance-Anforderungen.
MITs GenAI-Divide-Report (2025) fand, dass 95 Prozent der generativen KI-Pilotprojekte in Unternehmen keinen messbaren P&L-Impact erreichen. Die Zahlen sagen nicht, dass Eigenbau falsch ist – sie zeigen, dass Pilotprojekte ohne klare Erfolgskriterien und Produktionsplanung scheitern.
Ausblick
RAG ist keine neue Idee. Das Paper von Lewis et al. stammt aus 2020. Die Mechanik – Wissen extern halten, zur Laufzeit abrufen, dem Modell als Kontext geben – wird bleiben, auch wenn der Begriff irgendwann einem neuen weicht. Was sich ändert, sind die Werkzeuge: bessere Embedding-Modelle, schnellere Reranker, günstigere Inference. Was sich nicht ändert, ist die Grundanforderung: Jede Antwort muss auf ihre Quelle zurückführbar sein. Ohne diese Rückverfolgbarkeit hat ein Unternehmen kein Wissenssystem, sondern ein Risiko.
Quellen
MarketsandMarkets (2025): Retrieval-Augmented Generation (RAG) Market Report. URL: https://www.marketsandmarkets.com/Market-Reports/retrieval-augmented-generation-rag-market-135976317.html
Stanford RegLab / Journal of Empirical Legal Studies (2024): Hallucination Rates in Production Legal RAG Systems. URL: https://onlinelibrary.wiley.com/doi/full/10.1111/jels.12413
Fortune / MIT (2025): MIT Report – 95 Percent of Generative AI Pilots Failing. URL: https://fortune.com/2025/08/18/mit-report-95-percent-generative-ai-pilots-at-companies-failing-cfo/
VentureBeat (2025): The Retrieval Rebuild – Why Hybrid Retrieval Intent Tripled. URL: https://venturebeat.com/data/the-retrieval-rebuild-why-hybrid-retrieval-intent-tripled-as-enterprise-rag-programs-hit-the-scale-wall
Databricks (2025): Reranking in Mosaic AI Vector Search – Faster, Smarter Retrieval for RAG Agents. URL: https://www.databricks.com/blog/reranking-mosaic-ai-vector-search-faster-smarter-retrieval-rag-agents
Lewis, P. et al. (2020): Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020. URL: https://arxiv.org/abs/2005.11401
Pinecone (2025): Chunking Strategies for LLM Applications. URL: https://www.pinecone.io/learn/chunking-strategies/
Gerrit Grunert
Gerrit Grunert ist Gründer und CEO von Crispy Content®. 2019 veröffentlichter er das bei Springer Gabler erschienene Standard-Werk "Methodisches Content Marketing" sowie die Online-Kurs-Serie "Making Content". Privat ist Gerrit ein leidenschaftlicher Gitarren-Sammler, liest gern Bücher von Stefan Zweig und hört Musik von vorgestern.