Weiter zum Inhalt

Was ist RAFT? RAG und Fine-Tuning kombinieren, um LLMs an spezialisierte Domänen anzupassen

RAFT kombiniert Retrieval-Augmented Generation (RAG) und Fine-Tuning, um die Leistung großer Sprachmodelle in spezialisierten Domänen zu steigern
Aktualisiert 18. Sept. 2026  · 11 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Mit dem rasanten Fortschritt im Bereich Natural Language Processing (NLP) sind große Sprachmodelle (LLMs) zu äußerst leistungsfähigen Werkzeugen geworden, die immer mehr Aufgaben bewältigen. Eine zentrale Herausforderung bleibt jedoch, diese allgemeinen Modelle an hochspezialisierte Bereiche wie medizinische Fachliteratur oder Softwaredokumentation anzupassen.

Genau hier setzt Retrieval-Augmented Fine-Tuning (RAFT) an – eine neue Technik, die domänenspezifisches NLP grundlegend verändern könnte. RAFT vereint die Stärken von Retrieval-Augmented Generation (RAG), also der Kombination von LLMs mit externen Datenquellen, und Fine-Tuning. So lernen Modelle nicht nur domänenspezifisches Wissen, sondern auch, wie sie externen Kontext gezielt auffinden und verstehen, um Aufgaben präzise zu lösen.

In diesem Artikel schauen wir uns an, wie RAFT im Inneren funktioniert, welche Vorteile es bietet und wie diese Technik unser Vorgehen bei domänenspezifischen NLP-Aufgaben revolutionieren könnte. Zum Einstieg empfehlen wir Ressourcen zu RAG wie unsere Einführung in RAG und praktische Anwendungsbeispiele für RAG.

Was ist Retrieval Augmented Fine-Tuning (RAFT)

Retrieval Augmented Fine-Tuning (RAFT) ist ein neuartiger Ansatz für Sprachmodelle, der die Vorteile von RAG und Fine-Tuning kombiniert. Die Technik passt Sprachmodelle an spezifische Domänen an, indem sie die Fähigkeit der Modelle stärkt, domänenspezifisches Wissen zu verstehen und zu nutzen – und zugleich robust gegenüber ungenauen Retrievals zu bleiben.

RAFT wurde speziell entwickelt, um die Herausforderungen bei der Anpassung von LLMs an spezialisierte Domänen zu adressieren. In solchen Kontexten ist allgemeines Weltwissen weniger entscheidend; im Vordergrund steht maximale Genauigkeit bezogen auf einen vordefinierten Korpus domänenspezifischer Dokumente.

RAG vs. Fine-Tuning verstehen

Was ist RAG?

Retrieval-Augmented Generation (RAG) erweitert Sprachmodelle um ein Retrieval-Modul, das passende Informationen aus externen Wissensquellen bezieht.

Dieses Modul sucht auf Basis der Eingabeanfrage relevante Dokumente. Das Sprachmodell nutzt den zusätzlichen Kontext anschließend zur Generierung der Ausgabe.

RAG folgt dem Prinzip „abrufen und lesen“ und hat sich in vielen NLP-Aufgaben bewährt, etwa beim Sprachmodellieren oder beim Open-Domain-Question-Answering.

Allerdings wurden diese Sprachmodelle nicht darauf trainiert, präzise domänenspezifische Dokumente zu retrieven, sondern verfügen vor allem über allgemeines Domänenwissen aus dem Pre-Training.

Wie im Originalpapier beschrieben, ähneln bestehende In-Context-Retrieval-Methoden einer Open-Book-Prüfung, bei der man nicht weiß, welche Dokumente für die Antwort tatsächlich relevant sind.

Mehr zu RAG findest du hier: Wie sich RAG mit GPT und Milvus für Question Answering einsetzen lässt.

Was ist Fine-Tuning?

Fine-Tuning ist ein verbreiteter Ansatz, um vortrainierte LLMs für nachgelagerte Aufgaben anzupassen. Das Modell wird dafür mit aufgaben­spezifischen Daten weitertrainiert, lernt Muster und richtet sich am gewünschten Ausgabeformat aus.

Fine-Tuning war in vielen NLP-Anwendungen erfolgreich, etwa beim Zusammenfassen, beim Question Answering oder in der Dialoggenerierung. Klassische Fine-Tuning-Verfahren tun sich jedoch schwer damit, externes domänenspezifisches Wissen zu nutzen oder bei der Inferenz mit unvollkommenen Retrievals umzugehen.

Um im Bild zu bleiben: Fine-Tuning entspricht dem Auswendiglernen von Dokumenten und dem Beantworten von Fragen, ohne während der Prüfung in die Unterlagen zu schauen. Das Problem: Fine-Tuning kann teuer sein, das erlernte Wissen veraltet schnell, und die Verfahren reagieren weniger flexibel als RAG-basierte Methoden.

Wenn du tiefer einsteigen willst, gibt es hier eine Einführung ins Fine-Tuning von LLMs.

Warum nicht beides? RAG und Fine-Tuning mit RAFT kombinieren

Die Grundidee hinter RAFT

RAFT erkennt die Grenzen bestehender Ansätze und kombiniert gezielt die Stärken von RAG und Fine-Tuning. Durch die Einbindung domänenspezifischer Dokumente während des Fine-Tunings lernt das Modell domänentypische Muster – und verbessert zugleich seine Fähigkeit, externen Kontext effektiv zu verstehen und zu nutzen.

Auf hoher Ebene besteht das Trainingsmaterial bei RAFT aus Fragen, Dokumenten (sowohl relevanten als auch irrelevanten) und dazugehörigen Chain-of-Thought-Antworten, die aus den relevanten Dokumenten abgeleitet sind. Das Modell wird darauf trainiert, Fragen auf Basis der bereitgestellten Dokumente zu beantworten, einschließlich Ablenkdokumenten ohne relevante Information. So lernt es, Relevantes zu erkennen und zu priorisieren und Irrelevantes auszublenden.

Zentrale Bausteine von RAFT

Werfen wir einen genaueren Blick auf die Mechanik von Retrieval-Augmented Fine-Tuning. RAFT schlägt eine neuartige Methode zur Aufbereitung der Fine-Tuning-Daten vor, um In-Domain-RAG-Answering-Modelle zu trainieren. In RAFT besteht jeder Datenpunkt im Trainingsdatensatz aus:

  1. Einer Frage (Q)
  2. Einem Dokumentset (Dk), unterteilt in zwei Typen:
    1. „Oracle“-Dokumente — Dokumente, die die Antwort enthalten. Für eine Frage kann es mehrere Oracle-Dokumente geben.
    2. „Distractor“-Dokumente — Dokumente ohne relevante Informationen für die Beantwortung.
  3. Einer Chain-of-Thought-Antwort (A*): Eine aus den Oracle-Dokumenten abgeleitete Antwort mit detailliertem Begründungspfad.

Im RAFT-Fine-Tuning-Datensatz ist jede Frage einem Set aus Dokumenten zugeordnet – teils mit Antworten, teils ohne – plus einer Chain-of-Thought-Antwort. Diese Struktur eignet sich besonders, um das Modell darin zu schulen, bei der Ableitung der Antwort Nützliches von Unnützem zu trennen.

Zur weiteren Vertiefung mischt der RAFT-Datensatz unterschiedliche Fragetypen:

  • Fragen mit Oracle- und Distractor-Dokumenten: Ein Anteil 𝑃 der Fragen enthält sowohl Oracle- als auch Distractor-Dokumente. So lernt das Modell, Relevantes zu erkennen und zu priorisieren.
  • Fragen nur mit Distractor-Dokumenten: Die restlichen 1−𝑃 der Fragen enthalten ausschließlich Distractor-Dokumente. Das ahmt klassisches Fine-Tuning nach und trainiert das Modell, Fragen auch ohne externe Dokumente zu beantworten.

Die Chain-of-Thought-Antworten enthalten schließlich Auszüge aus den Oracle-Dokumenten sowie einen detaillierten Argumentationspfad. Auf diese Weise lernt das Modell, mithilfe relevanter Segmente aus dem Originalkontext eine konsistente Begründungskette zu bilden und dadurch genauer zu antworten.

RAFT-Aufforderung zur Generierung von Chain-of-Thought-Antworten

Bildquelle: RAFT: Adapting Language Model to Domain Specific RAG

Fine-Tuning-Prozess

Sobald die Trainingsdaten vorbereitet sind, umfasst der Fine-Tuning-Prozess:

  • Training des Modells: Per überwachtem Lernen wird das Modell darauf trainiert, aus dem gegebenen Kontext – Fragen und Dokumentsets – Chain-of-Thought-Antworten zu generieren.
  • Zielsetzung: Das Modell soll lernen, relevante Informationen aus Oracle-Dokumenten zu erkennen und zu priorisieren und zugleich Distractor-Dokumente zu ignorieren.

Inferenz

In der Inferenzphase erhält das feinabgestimmte Modell eine Frage und die Top-K-Dokumente, die durch die RAG-Pipeline gefunden wurden. Wichtig: Das Retriever-Modul arbeitet unabhängig von RAFT.

Ergebnisse mit RAFT

Um zu zeigen, dass RAFT relevante Informationen aus In-Domain-Dokumenten besonders gut extrahiert und Fragen beantwortet, vergleicht das Originalpapier den RAFT-Ansatz mit einem General-Purpose-Modell mit RAG sowie mit domänenspezifisch feinabgestimmten Modellen. Konkret wurde Llama-2 per RAFT-Methode feinabgestimmt (RAFT 7B) und verglichen mit:

  1. Llama-2 mit 0-Shot-Prompting
  2. Llama-2 mit RAG
  3. Domain-specific Fine-Tuning (DSF) von Llama-2 (klassisches überwachtes Fine-Tuning)
  4. DSF + RAG (domänenspezifisch feinabgestimmtes Llama-2 mit RAG)
  5. GPT-3.5 + RAG

Die Modelle wurden auf drei Datensatztypen evaluiert, um die RAFT-Performance über verschiedene Domänen hinweg zu messen:

  1. Allgemeinwissens-Datensätze — darunter Natural Questions, Trivia QA und HotpotQA, mit Fokus auf Common-Knowledge-Fragen.
  2. Softwaredokumentation (APIs) — darunter HuggingFace, Torch Hub und TensorFlow Hub, mit Fokus auf korrekte ausführbare API-Aufrufe auf Basis der Doku.
  3. Domänenspezifische Datensätze — darunter PubMedQA, mit Fokus auf biomedizinische und biologische Forschungsfragen.

Insgesamt zeigte sich: RAFT übertraf die überwachten Fine-Tuning-Methoden konsistent – mit und ohne RAG – in PubMed, HotpotQA und den API-Datensätzen.

Im direkten Vergleich mit domänenspezifischem Fine-Tuning (DSF) lag RAFT deutlich vorn. Bemerkenswert: DSF mit RAG brachte keine besseren Ergebnisse – im Gegenteil, die Performance verschlechterte sich.

Das legt nahe, dass DSF relevante Informationen aus bereitgestellten Dokumenten nicht effektiv extrahieren kann. Mit RAFT hingegen trainieren wir das Modell darauf, Dokumente korrekt zu verarbeiten und im passenden Stil zu antworten.

Der RAFT-Ansatz übertraf sogar GPT-3.5 mit RAG – obwohl dieses deutlich größer ist. Das unterstreicht die Wirksamkeit von RAFT.

Ergebnisvergleich von RAFT vs. Basismodellen

Bildquelle: RAFT: Adapting Language Model to Domain Specific RAG

Ablationsstudien

Zusätzlich zu den Hauptexperimenten führten die Autorinnen und Autoren mehrere Ablationsstudien durch, um den Einfluss einzelner Komponenten auf die RAFT-Performance zu verstehen:

  1. Einfluss von Chain-of-Thought — In den meisten Fällen war RAFT mit Chain-of-Thought (CoT) besser als RAFT ohne CoT.
  2. Anteil der Oracle-Dokumente — Welcher Anteil an Oracle-Dokumenten ist im Training optimal? Die Studie zeigt: Der ideale Prozentsatz variiert je nach Datensatz; 80% liefern konsistent starke Ergebnisse über Datensätze hinweg.
  3. Anzahl der Distractor-Dokumente — Optimal ist ein Trainings-Setup mit einem Oracle-Dokument und vier Distractor-Dokumenten. So lernt das Modell, Relevantes zu priorisieren, ohne von Irrelevantem überfrachtet zu werden.

So experimentierst du mit RAFT

Für die Umsetzung können Forschende und Praktiker den Schritten aus dem Paper folgen: Chain-of-Thought-Antworten aus relevanten Dokumenten generieren, Distractor-Dokumente ins Training einbeziehen und das Modell per überwachtem Lernen feinabstimmen. Der Code ist als Open Source verfügbar, inklusive Demo, um Experimente und die Anwendung von RAFT zu erleichtern.

Mehr zu RAG und Fine-Tuning

RAFT ist ein bedeutender Schritt im domänenspezifischen Sprachmodellieren und bietet eine starke Lösung, um LLMs an spezialisierte Domänen anzupassen. Durch die Kombination der Stärken von RAG und Fine-Tuning können Sprachmodelle domänenspezifisches Wissen effektiv nutzen – und bleiben zugleich robust gegenüber Retrieval-Ungenauigkeiten.

Wenn du tiefer in RAG und Fine-Tuning eintauchen möchtest, empfehlen wir folgende Ressourcen:

Da die Nachfrage nach domänenspezifischen Sprachmodellen weiter steigt, werden Techniken wie RAFT entscheidend sein, um in unterschiedlichsten Branchen präzise und verlässliche NLP-Anwendungen zu ermöglichen.


Ryan Ong's photo
Author
Ryan Ong
LinkedIn
Twitter

Ryan ist ein führender Datenwissenschaftler, der sich auf die Entwicklung von KI-Anwendungen mit LLMs spezialisiert hat. Er ist Doktorand für natürliche Sprachverarbeitung und Wissensgraphen am Imperial College London, wo er auch seinen Master in Informatik gemacht hat. Außerhalb der Datenwissenschaft schreibt er einen wöchentlichen Substack-Newsletter, The Limitless Playbook, in dem er eine umsetzbare Idee von den besten Denkern der Welt teilt und gelegentlich über zentrale KI-Konzepte schreibt.

Themen
Deep Learning

Starte noch heute mit deiner KI-Lernreise!

Kurs

Konzepte großer Sprachmodelle (LLMs)

2 Std.
110.3K
Entdecken Sie das volle Potenzial von LLMs mit unserem Kurs zu Anwendungen, Training, Ethik und Forschung.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow