Zum Inhalt springen
Alle Artikel

·4 Min. Lesezeit

RAG, Fine-Tuning oder einfach ein besserer Prompt? So wählen Sie den richtigen Ansatz

„ChatGPT, aber mit unseren Daten" kann drei sehr verschiedene Dinge bedeuten. Ein praktischer Leitfaden zu Prompting, RAG und Fine-Tuning: was jeder Ansatz löst, was er kostet und in welcher Reihenfolge man ihn testet.

#ai#rag#architecture

„Wir wollen ChatGPT, aber mit unseren Daten." So beginnt fast jedes KI-Gespräch mit Unternehmen. Hinter dem Satz stecken drei sehr unterschiedliche technische Ansätze: ein guter Prompt, Retrieval-Augmented Generation (RAG) und Fine-Tuning. Sie unterscheiden sich in Kosten, Aufwand und darin, was sie tatsächlich lösen. Die falsche Wahl ist der häufigste Grund, warum KI-Piloten stecken bleiben.

Mit der Frage beginnen, nicht mit der Technik

Schreiben Sie vor der Entscheidung auf, was das Modell heute falsch macht. Die Antwort fällt meist in eine von drei Kategorien:

  • Es weiß etwas nicht (Ihre Produkte, Verträge, internen Prozesse) → ein Wissensproblem.
  • Es weiß es, antwortet aber in der falschen Form (Ton, Struktur, Länge, Format) → ein Verhaltensproblem.
  • Es versteht die Aufgabe nicht → meist ein Prompt-Problem.

Wissensprobleme löst man mit RAG. Verhaltensprobleme lassen sich mit Fine-Tuning lösen. Und erstaunlich viele Probleme verschwinden mit einem besseren Prompt.

Stufe 1: ein besserer Prompt

Klare Anweisungen, ein paar gute Beispiele und ein definiertes Ausgabeformat (zum Beispiel JSON) kosten nichts und dauern Stunden statt Wochen. Moderne Modelle folgen Anweisungen gut. Bevor Sie in etwas anderes investieren, bauen Sie ein kleines Testset mit 20–50 echten Fragen und erwarteten Antworten und prüfen Sie, wie weit Prompting Sie bringt.

Gut für: Klassifizierung, Extraktion, Umformulieren, Zusammenfassungen – alle Aufgaben, bei denen das nötige Wissen in der Eingabe steckt. Grenze: Das Modell kann nur nutzen, was in den Kontext passt. Ihr Dokumentenarchiv mit 4.000 Seiten kennt es nicht.

Stufe 2: RAG – dem Modell die richtigen Seiten geben

Bei RAG werden Ihre Dokumente in Abschnitte zerlegt und indexiert. Für jede Frage sucht das System die relevantesten Abschnitte und fügt sie in den Prompt ein. Das Modell antwortet auf Basis dieser Quellen und kann sie zitieren.

Gut für: interne Wissensassistenten, Support-Bots, Fragen zu Verträgen und Richtlinien, Produktkataloge – alles, wo Antworten auf Dokumenten beruhen müssen, die sich ändern.

Warum es meist die richtige Wahl ist:

  • Aktuell: Ein neues Dokument ist Minuten nach dem Upload durchsuchbar. Kein Neutraining.
  • Nachvollziehbar: Jede Antwort kann ihre Quelle zeigen. Das zählt für Vertrauen, Audits und die Transparenzerwartungen des EU AI Act.
  • Berechtigungen: Die Suche kann berücksichtigen, wer welches Dokument sehen darf. Ein feinjustiertes Modell kann Daten nicht für einzelne Nutzer „vergessen".
  • Funktioniert mit lokalen Modellen: RAG läuft gut mit Open-Source-Modellen auf eigener Hardware – die Daten verlassen Ihr Netzwerk nie.

Der größte Aufwand bei RAG ist nicht die KI, sondern die Daten: PDFs bereinigen, Dokumente sinnvoll aufteilen, den Index synchron halten und messen, ob die richtigen Abschnitte gefunden werden. Die Suchqualität entscheidet über die Antwortqualität.

Stufe 3: Fine-Tuning – das Verhalten des Modells ändern

Beim Fine-Tuning wird ein Modell mit Ihren eigenen Beispielen weitertrainiert (meist Hunderte bis Tausende Ein-/Ausgabe-Paare). Es eignet sich gut, um Stil und Format beizubringen: Ihre Tonalität, eine strikte Berichtsstruktur, fachspezifische Klassifikationen – oder ein kleines, günstiges Modell eine eng umrissene Aufgabe so gut erledigen zu lassen wie ein großes.

Für Fakten ist es ein schlechter Weg. Das Modell merkt sich Details aus Trainingsdaten nicht zuverlässig, kann keine Quellen nennen, und jede Änderung Ihres Wissens bedeutet einen neuen Trainingslauf. Außerdem braucht es saubere, repräsentative Trainingsdaten – oft der schwierigste Teil.

Gut für: konsistente Formate bei hohem Volumen, enge wiederkehrende Aufgaben, Kosten und Latenz senken durch ein kleineres Modell.

Kurze Entscheidungshilfe

Situation Ansatz
Antworten müssen aus Ihren Dokumenten kommen RAG
Dokumente ändern sich wöchentlich RAG
Nutzer müssen die Quelle sehen RAG
Ausgabeformat oder Ton ist inkonsistent Erst Prompt, dann Fine-Tuning
Gleiche enge Aufgabe, sehr hohes Volumen Fine-Tuning (kleineres Modell)
Daten müssen on-premise bleiben RAG oder Fine-Tuning mit lokalem Modell

In der Praxis ist die Antwort oft eine Kombination: ein gut gestalteter Prompt, RAG für das Wissen und erst später Fine-Tuning, um einen bewährten Ablauf günstiger oder konsistenter zu machen.

Was es ungefähr kostet

Eine Prompt-basierte Lösung mit Testset kann in wenigen Tagen live sein. Ein produktives RAG-System (Dokumenten-Pipeline, Suche, Berechtigungen, Evaluierung, Oberfläche) bedeutet typischerweise einige Wochen Arbeit. Fine-Tuning kommt mit Datenaufbereitung, Trainingsläufen und laufendem Neutraining dazu – lohnt sich erst, wenn genau feststeht, welche Aufgabe optimiert werden soll.

Die Reihenfolge, die funktioniert

  1. 20–50 echte Fragen mit guten Antworten aufschreiben.
  2. Einen starken Prompt testen und messen.
  3. Fehlt Wissen, RAG ergänzen und erneut messen.
  4. Stimmt das Verhalten im großen Maßstab immer noch nicht, Fine-Tuning prüfen.

Schritt 1 zu überspringen ist der teuerste Fehler: Ohne Testset können Sie nicht erkennen, ob eine Änderung etwas verbessert hat.

Wenn Sie unsicher sind, welche Stufe Ihr Anwendungsfall braucht, schaue ich ihn mir gern in einem kostenlosen 30-Minuten-Gespräch mit Ihnen an – meist reicht das, um den Ansatz und ein realistisches Budget zu benennen.

Holen Sie sich die KI-Readiness-Checkliste

10 Fragen, die Sie vor einem KI-Projekt beantworten sollten, plus gelegentliche Notizen zu angewandter KI und SaaS. Kostenlos.

Double-Opt-in, jederzeit mit einem Klick abmeldbar. Details in der Datenschutzerklärung.

Weitere Artikel