Zum Inhalt springen

Was ist RAG (Retrieval-Augmented Generation)?

Ein LLM kennt nur seine Trainingsdaten, nicht die internen Firmendokumente eines Kunden. Ohne Anbindung an aktuelle oder unternehmensspezifische Quellen entstehen Halluzinationen oder veraltete Antworten.

RAG kombiniert Retrieval (Suche) mit Generation (Antworterstellung) in drei Schritten:

  1. Suche (Retrieval): Mit Embeddings werden semantisch passende Passagen aus einer Vektor-DB gefunden.
  2. Reranking (optional): Ein Reranker sortiert die Treffer nach echter Relevanz.
  3. Anfrage an LLM mit Kontext: Frage + gefundener Kontext werden an das LLM gesendet, das daraus die Antwort generiert.
  • Aktuelles Wissen ohne erneutes Training
  • Quellen nachvollziehbar
  • Günstiger als Fine-Tuning
RAG-Komponentenoris ModellAufgabe
EmbeddingHarrier OSS v1 0.6BText → Vektoren für semantische Suche
RerankerBGE Reranker v2 M3, Jina Reranker v2Sortiert Ergebnisse nach Relevanz
LLM (Generation)Gemma 4, GPT-OSS, GLM 5.2, Qwen 3.6Generiert Antwort aus Frage + Kontext

Eine praktische Schritt-für-Schritt-Anleitung finden Sie unter RAG-Pipeline.