Weiter zum Inhalt

LlaMA-Factory WebUI: Einsteiger-Guide zum Fine-Tuning von LLMs

Lerne, wie du LLMs auf eigenen Datensätzen feinabstimmst, die Performance bewertest und Modelle nahtlos exportierst und bereitstellst – mit dem Low-/No-Code-Framework von LLaMA-Factory.
Aktualisiert 18. Sept. 2026  · 12 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

In diesem Tutorial zeigen wir dir, wie du das Llama-3-8B-Modell mit der LlaMA-Factory WebUI auf dem Wikipedia-Q&A-Datensatz feinabstimmst. Wir starten mit einer kurzen Einführung in die LlaMA-Factory WebUI und richten sie anschließend in Google Colab ein. Nach der Einrichtung gehen wir Schritt für Schritt durch das Fine-Tuning des Llama-3-8B-Modells auf dem Datensatz und bewerten anschließend die Modellleistung in der Chat-Oberfläche.

Im weiteren Verlauf lernst du außerdem, wie du eigene Datensätze lädst, Modelle zusammenführst und zu Hugging Face exportierst. Zum Schluss zeigen wir, wie du das feinabgestimmte Modell bereitstellst und über die OpenAI API zugänglich machst.

Praxisnahes Wissen zu aktuellen KI-Themen wie ChatGPT, Large Language Models, Generative KI und mehr erhältst du im AI Fundamentals Lernpfad. 

Fine-Tuning von LLMs mit der LlaMA-Factory WebUI – Titelbild

Bild: Autor | Canva

Was ist LlaMA-Factory?

hiyouga/LLaMA-Factory ist ein Open-Source-Projekt, mit dem du über eine WebUI mehr als 100 Large Language Models (LLMs) feinabstimmen kannst. Es stellt ein umfangreiches Set an Tools und Skripten für Fine-Tuning, Chatbot, Serving und Benchmarking von LLMs bereit. 

LLaMA-Factory richtet sich speziell an Einsteigerinnen und Einsteiger sowie nicht-technische Profis, die Open-Source-LLMs auf eigenen Datensätzen feinabstimmen möchten, ohne komplexe KI-Konzepte zu lernen. Du wählst einfach ein Modell, fügst deinen Datensatz hinzu und passt ein paar Parameter an, um das Training zu starten. 

Nach Abschluss des Trainings kannst du im selben Webtool das Modell testen und anschließend zu Hugging Face exportieren oder lokal speichern. So kannst du LLMs schnell und effizient lokal feinabstimmen.

KI-Anwendungen entwickeln

Lerne, wie man KI-Anwendungen mit der OpenAI API erstellt.
Start Upskilling for Free

Erste Schritte mit der LlaMA-Factory WebUI

In diesem Abschnitt lernst du, wie du die LlaMA-Factory WebUI in Google Colab und unter Microsoft Windows installierst und startest. 

Google Colab stellt kostenlose GPUs bereit. Falls dein Laptop keine GPU oder kein CUDA hat, empfiehlt es sich, mit einem Colab-Notebook zu starten. 

  1. Starte das Google-Colab-Notebook mit dem Laufzeittyp „T4 GPU“. 
  2. Tippe in eine Codezelle den folgenden Befehl, um das LLaMA-Factory-GitHub-Repository zu klonen und alle benötigten Python-Pakete zu installieren. 
%cd /content/
%rm -rf LLaMA-Factory
!git clone https://github.com/hiyouga/LLaMA-Factory.git
%cd LLaMA-Factory
%ls
%pip install -e .[torch,bitsandbytes]
  1. Um auf Modelle und Datensätze zuzugreifen, musst du dich in der Hugging-Face-CLI anmelden. Erstelle dazu in den Hugging-Face-Einstellungen unter „Access Tokens“ ein neues Token für Google Colab.

Neues Hugging Face Access Token erzeugen

  1. Lege die Hugging-Face-Umgebungsvariable über die Colab-„Secrets“-Funktion an, mit der sich Variablen sicher im Notebook verfügbar machen lassen.

Setzen der Umgebungsvariablen in Google Colab mit Secrets.

  1. Melde dich mit dem Access Token am Hugging Face Hub an. 
from huggingface_hub import login
from google.colab import userdata
hf_token = userdata.get("HUGGINGFACE_TOKEN")
login(token = hf_token)
  1. Starte die LLaMA-Factory WebUI mit der llamafactory-cli. Wir setzen GRADIO_SHARE=1, um einen öffentlichen Link für den Zugriff auf die Web-App zu generieren. 
%cd /content/LLaMA-Factory/
!GRADIO_SHARE=1 llamafactory-cli webui
  1. Klicke auf die öffentliche URL, um die WebUI in einem neuen Tab zu öffnen. 

Llama Factory WebUI – öffentlicher Link

Die LLAMA-Factory WebUI wirkt schlicht, bietet aber zahlreiche Optionen und Tabs. Diese sehen wir uns im nächsten Abschnitt an. 

LlaMA-Factory WebUI in Google Colab

Wenn du Probleme beim Starten deiner eigenen LlaMA-Factory WebUI hast, wirf einen Blick ins Google-Colab-Notebook.

LlaMA-Factory WebUI unter Windows ausführen

Wenn du die LlaMA-Factory WebUI lokal unter Windows betreiben möchtest, installiere eine vorgebaute Version der bitsandbytes-Bibliothek. Sie unterstützt CUDA 11.1 bis 12.2 – wähle also die passende Release-Version entsprechend deiner CUDA-Version.

  1. Öffne das Windows-Terminal und klone das LLaMA-Factory-GitHub-Repository per Git-Befehl.
  2. Installiere alle benötigten Python-Pakete.
  3. Installiere die bitsandbytes-Bibliothek für Windows.
$ git clone https://github.com/hiyouga/LLaMA-Factory.git

$ cd LLaMA-Factory

$ pip install -e .[torch,bitsandbytes]

$ pip install https://github.com/jllllll/bitsandbytes-windows-webui/releases/download/wheels/bitsandbytes-0.41.2.post2-py3-none-win_amd64.whl
  1. Starte die LLaMA-Factory WebUI.
$ llamafactory-cli webui
  1. Vergiss nicht, dich per CLI bei Hugging Face mit einem Access Token anzumelden. 
$ huggingface-cli login

LlaMA-3 8B Chat mit der LlaMA-Factory WebUI feinabstimmen

In diesem Abschnitt wird nicht programmiert. Wir wählen Modell und Datensatz fürs Fine-Tuning, passen einige Parameter an und starten mit wenigen Klicks ein schnelles Training. 

Die Theorie hinter dem Fine-Tuning großer Sprachmodelle findest du in diesem umfassenden Leitfaden: Fine-Tuning Large Language Models.

Datensatz und Modell auswählen

Wir stimmen das unsloth/llama-3-8b-bnb-4bit Modell auf dem Microsoft/wiki_qa Datensatz ab. Der Datensatz enthält mehrere Spalten, wie unten gezeigt. Für das Fine-Tuning nutzen wir die Spalten „question“ und „answer“. 

Wiki_QA Datensatz-Repository auf dem Hugging Face Hub.

Quelle: microsoft/wiki_qa | Wiki Question Answering Korpus von Microsoft

In der kostenlosen Version von Google Colab lässt sich das vollständige LLaMA-3-8B-Instruct-Modell nicht laden. Stattdessen nutzen wir die 4-Bit-quantisierte Version desselben Modells von Unsloth. 

Wähle dazu als Modellnamen „Custom“ und füge den Repository-Link „unsloth/llama-3-8b-bnb-4bit“ im Modellpfad ein.

Modell und Datensatz in der LlaMA-Factory WebUI einstellen

Du kannst mehrere Datensätze für das Fine-Tuning auswählen. Für dieses Tutorial verwenden wir jedoch ausschließlich den Datensatz „Wikiqa“, den du wie oben gezeigt bequem aus den vordefinierten Datensätzen auswählen kannst. 

Trainingsparameter anpassen 

Passe die Trainingsargumente des Modells an, indem du nach unten scrollst. Wir setzen folgende Parameter:

  • Learning Rate auf 4e-5
  • Epochen auf 1,0
  • Max Samples auf 1000, um das Training zu beschleunigen

Die übrigen Argumente belassen wir bei den Standardwerten. Sie können angepasst werden, um das Verhalten des feinabgestimmten Modells zu verändern. 

Trainingsparameter in der LlaMA-Factory WebUI einstellen

Optional kannst du auch den LoRA-Rang und weitere LoRA-bezogene Konfigurationen ändern. Für dieses Tutorial bleiben alle anderen Einstellungen auf Standard.

LoRA-Konfigurationen in der LlaMA-Factory WebUI einstellen

Training starten

Scrolle weiter nach unten zur Trainingskonfiguration. Gib das Ausgabeverzeichnis und den Pfad zur Konfiguration an und klicke auf „Start“. Die Loss-Grafik benötigt etwas Zeit, da LlaMA-Factory zunächst Modell und Datensatz herunterlädt und lädt – das kann mindestens 5 Minuten dauern.

Training in der LlaMA-Factory WebUI starten

Sobald das Modell vollständig geladen ist und das Training startet, erscheinen Visualisierungen in der Loss-Grafik. Wie zu sehen ist, sinkt der Loss mit zunehmenden Schritten – sehr gut.

Training halb abgeschlossen in der LlaMA-Factory WebUI

Nach Abschluss des Trainings erscheint unten links eine Abschlussmeldung. Wie zu sehen ist, hat sich der Loss nach und nach verringert und nach 45 Schritten eingepegelt.

Fine-Tuning abgeschlossen in der LlaMA-Factory WebUI

Wenn du Data Scientist oder Developer bist, kannst du dein Modell auch ganz einfach in Python feinabstimmen. 

Für technisch Versierte haben wir hier eine ausführliche Anleitung zum Training von LlaMA-3: Fine-Tuning Llama 3 and Using It Locally: A Step-by-Step Guide.

Das feinabgestimmte Modell evaluieren

Wechsle zur Bewertung des feinabgestimmten Modells im Menü von „Train“ zu „Chat“. Gehe dann zum „Checkpoint path“ und lade den gespeicherten feinabgestimmten Adapter. 

Checkpoint-Pfad in der LlaMA-Factory WebUI setzen

Klicke anschließend auf „Load model“ und warte ein paar Sekunden, bis das Modell geladen ist. 

Das gespeicherte feinabgestimmte Modell laden

Scrolle nach unten zum Chat-Eingabefeld und stelle eine allgemeine Frage zu einem Gebirge. 

Eingabe einer einfachen Frage im Chatfeld.

Als Antwort erhältst du eine schlichte, präzise Ausgabe – ähnlich dem „wiki_qa“-Datensatz.

Antwort des feinabgestimmten Llama-3-Modells

Stellen wir noch eine Frage. Man sieht: Das Modell liefert starke Ergebnisse. Innerhalb von 30 Minuten haben wir ein Fine-Tuning geschafft, das mit der Transformers-Bibliothek über 4 Stunden gedauert hätte. Sehr beeindruckend. 

Antwort des feinabgestimmten Llama-3-Modells

Manchmal ist Fine-Tuning nicht die Lösung für alle LLM-Probleme. Lies deshalb RAG vs Fine-Tuning: A Comprehensive Tutorial with Practical Examples und finde heraus, was für dich am besten funktioniert.

Weitere Funktionen der LlaMA-Factory WebUI

Über das Fine-Tuning und Testen hinaus bietet das LLaMA-Factory-Ökosystem weitere Kernfunktionen: Fine-Tuning mit eigenen Daten, Zusammenführen und Exportieren von Modellen sowie Deployment der feinabgestimmten Modelle mit vLLM. 

Eigener Datensatz

Um einen eigenen Datensatz hinzuzufügen, bearbeite einfach die Datei data/dataset_info.json – danach ist er in der LLaMA-Factory WebUI verfügbar. 

Details zum erforderlichen Dateiformat und zur Anpassung der dataset_info.json findest du in der Dokumentation data/README.md

Du kannst Datensätze aus den Hubs von Hugging Face oder ModelScope nutzen oder einen Datensatz von deiner lokalen Festplatte laden.

dataset_info.json in Google Colab geöffnet.

Vorschau der Datei data/dataset_info.json

Modell zusammenführen und exportieren 

Du kannst den feinabgestimmten LoRA-Adapter ganz einfach mit dem vollständigen Modell zusammenführen und über den Tab „Export“ zum Hugging Face Hub hochladen. 

Passe die maximale Shard-Größe an, setze den Exportpfad und gib die Repository-ID im Hugging Face Hub sowie das Exportgerät an. Das Zusammenführen und Hochladen aller Modelldateien dauert ein paar Minuten.

Hinweis: Die kostenlose Colab-Version bietet nur 12 GB RAM. Das Zusammenführen der LoRA eines 8-Milliarden-Parameter-Modells erfordert jedoch mindestens 16 GB RAM. Diese Operation ist daher in der kostenlosen Colab-Version nicht möglich.

Modell zusammenführen und zum Hugging Face Hub exportieren

Zusammenführen und Export des feinabgestimmten Modells zum Hugging Face Hub

Bereitstellen mit OpenAI-ähnlicher API und vLLM

LlaMA-Factory bringt das vLLM-Framework für Serving und Deployment mit. Mit dem folgenden Befehl können wir das Llama-3-8B-Instruct-Modell bereitstellen und per OpenAI-Python-API oder REST-API darauf zugreifen. 

$ API_PORT=8000 llamafactory-cli api examples/inference/llama3_vllm.yaml

Du kannst die Datei anpassen oder eine eigene .yaml-Datei erstellen, um dein feinabgestimmtes Modell produktiv zu serven. Gib dafür einfach den Pfad zum Modellordner lokal oder im Hugging Face Hub an. 

Inhalt der Datei llama3_vllm.yaml.

Quelle: hiyouga/LLaMA-Factory (github.com)

Wenn du eine ähnliche Low-Code-Lösung suchst, um LLMs – speziell das proprietäre GPT-4o – zu fine-tunen, haben wir eine ausführliche Anleitung für dich. Hier geht’s zur Schritt-für-Schritt-Anleitung: Fine-Tuning OpenAI's GPT-4: A Step-by-Step Guide.

Fazit

Die LLaMA-Factory WebUI macht den Prozess für Einsteiger und Profis gleichermaßen einfach. Du passt nur wenige Parameter an, um ein Modell auf einem eigenen Datensatz zu feinabstimmen. In derselben Oberfläche kannst du das Modell testen und zu Hugging Face exportieren oder lokal speichern. So lässt es sich später mit dem LLaMA-Factory-CLI-Befehl api produktiv bereitstellen. So unkompliziert ist das. 

Statt hunderte Zeilen Code zu schreiben und Fine-Tuning-Probleme zu debuggen, kommst du mit wenigen Klicks zum Ziel.

In diesem Tutorial haben wir die LLaMA-Factory WebUI kennengelernt und gezeigt, wie du das LLaMA-3-8B-Instruct-Modell mit einem Wikipedia-Q&A-Datensatz in diesem Framework feinabstimmst. Außerdem haben wir das feinabgestimmte Modell über das integrierte Chatbot-Menü getestet und zusätzliche Funktionen von LLaMA-Factory erkundet.

Lerne, wie du LLMs mit Python feinabstimmst – melde dich kostenlos zum kommenden Webinar an: Fine-Tuning Your Own Llama 3 Model.

Verdiene eine Top-KI-Zertifizierung

Zeige, dass du KI effektiv und verantwortungsbewusst einsetzen kannst.

Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Als zertifizierter Data Scientist ist es meine Leidenschaft, modernste Technologien zu nutzen, um innovative Machine Learning-Anwendungen zu entwickeln. Mit meinem fundierten Hintergrund in den Bereichen Spracherkennung, Datenanalyse und Reporting, MLOps, KI und NLP habe ich meine Fähigkeiten bei der Entwicklung intelligenter Systeme verfeinert, die wirklich etwas bewirken können. Neben meinem technischen Fachwissen bin ich auch ein geschickter Kommunikator mit dem Talent, komplexe Konzepte in eine klare und prägnante Sprache zu fassen. Das hat dazu geführt, dass ich ein gefragter Blogger zum Thema Datenwissenschaft geworden bin und meine Erkenntnisse und Erfahrungen mit einer wachsenden Gemeinschaft von Datenexperten teile. Zurzeit konzentriere ich mich auf die Erstellung und Bearbeitung von Inhalten und arbeite mit großen Sprachmodellen, um aussagekräftige und ansprechende Inhalte zu entwickeln, die sowohl Unternehmen als auch Privatpersonen helfen, das Beste aus ihren Daten zu machen.

Themen
Künstliche Intelligenz
Große Sprachmodelle

Top DataCamp LLM-Kurse

Kurs

Entwickeln von LLM-Anwendungen mit LangChain

3 Std.
50.6K
Erstelle KI-gestützte Anwendungen mithilfe von LLMs, Prompts, Verkettungen und Agents in LangChain.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow