Kurs
Du hast wahrscheinlich schon von Unsloth gehört. Sie sind bekannt dafür, schnell quantisierte Versionen neuer offener Modelle zu veröffentlichen, die sich einfacher herunterladen, laden und in lokalen Inferenz-Setups ausführen lassen. Außerdem haben sie sich mit praxisnahen Anleitungen einen Namen gemacht, wie man die neuesten Open-Modelle ohne Setup-Frust ausführt und feinabstimmt.
Mit Unsloth Studio bringen sie vieles davon inzwischen in eine Oberfläche: eine lokale Web-UI zum Ausführen und Trainieren von Modellen, mit Support für GGUF und Safetensors, Side-by-Side-Modellvergleich, automatischem Tuning der Inferenzparameter, Tool-Calling und einer OpenAI-kompatiblen API.
In diesem Tutorial zeige ich dir, wie du die Umgebung für Unsloth Studio vorbereitest, es lokal installierst, die Oberfläche startest und ein Modell direkt in der UI testest. Kein unübersichtlicher manueller Pipeline-Zirkus, kein Hin- und Herwechseln zwischen fünf Tools und kein zusätzlicher Inferenzcode nur für den Einstieg.
Schau dir außerdem unseren Guide zum Feintuning mit Unsloth Studio sowie unseren ursprünglichen Unsloth-Guide an, um mehr zu erfahren.
Was ist Unsloth Studio?
Unsloth Studio ist Unsloths neue Open-Source-Weboberfläche für das lokale Ausführen, Trainieren und Exportieren offener Modelle an einem Ort. Statt separater Tools für Inferenz, Feintuning und Tests bündelt sie alles in einem Setup, das du auf deinem eigenen Rechner laufen lassen kannst.
Unsloth Studio unterstützt GGUF- und Safetensors-Modelle, läuft auf Mac, Windows und Linux und macht lokale Modellexperimente deutlich einfacher für alle, die lieber visuell arbeiten, statt Skripte von Hand zusammenzustückeln.
Wichtige Funktionen von Unsloth Studio
Mehrere Funktionen machen das Tool besonders spannend, darunter:
- Modelle in einer Oberfläche suchen, herunterladen und lokal ausführen
- Zwei Modelle nebeneinander vergleichen
- Self-Healing-Tool-Calling und integrierte Websuche nutzen
- Inferenz-Einstellungen automatisch optimieren lassen
- Chat-Templates leicht bearbeiten
- OpenAI-kompatible APIs ansprechen
- Modelle mit No-Code-Workflow feinabstimmen
- Datensätze automatisch aus Dateien wie PDF, CSV, JSON, DOCX und TXT erstellen
- Modelle in Formate wie GGUF und 16-bit Safetensors exportieren
Voraussetzungen für Unsloth Studio
Bevor du mit der Installation beginnst, stell sicher, dass dein System die Basistools für den lokalen Betrieb von Unsloth Studio mitbringt. Das Setup ist gut machbar, aber wenn du Modelle feinabstimmen willst und nicht nur chatten, brauchst du eine vollständige GPU-Umgebung.
- Python: Version 3.11 bis 3.13
- Git: Zum Klonen und Verwalten des Repos
- CMake: Für den lokalen Build von Komponenten im Setup erforderlich
- macOS-Tools: Homebrew und OpenSSL können auf macOS nötig sein
- NVIDIA-GPU: Erforderlich, wenn du Modelle lokal feinabstimmen willst
- Aktuelle NVIDIA-Treiber: Empfohlen, um Setup-, CUDA- oder Trainingsprobleme zu vermeiden
Kurz gesagt: Einfaches lokales Chatten bekommst du auch auf einer CPU gut ans Laufen, für Feintuning brauchst du jedoch passende NVIDIA-Hardware und aktuelle Treiber zusätzlich zu den Standardtools.
RunPod-Umgebung einrichten
Für dieses Tutorial verwenden wir eine RunPod-A40-Maschine. Ich hätte alles auch auf meinem Laptop laufen lassen können, aber mir fehlt der Speicherplatz und meine Internetverbindung ist zu langsam, um große Modelle und Abhängigkeiten entspannt herunterzuladen.
Statt langer Downloads, zäher Builds und dem Risiko, mein System zuzumüllen, nutze ich deshalb RunPod als einfache Cloud-Option, die für diesen Workflow deutlich schneller eingerichtet ist.
- Erstelle zunächst einen neuen A40-Pod und wähle das aktuelle PyTorch-2.8.0-Template.
- Bearbeite vor dem Deployment die Pod-Einstellungen und setze die Container-Disk auf 50 GB und die Volume-Disk auf 100 GB, damit du genug Platz für Installation und Modell-Downloads hast.
- Öffne außerdem den HTTP-Port 8888 für Jupyter Notebook und Port 8910 für Unsloth Studio.
- Deinen Hugging-Face-Token als Umgebungsvariable hinzuzufügen ist optional, beschleunigt aber oft Downloads und vereinfacht den Zugriff auf Modelle mit Gate.

Wenn alles passt, speichere die Änderungen, prüfe die Pod-Zusammenfassung und deploye den Pod.

Unsloth Studio installieren
Nach etwa einer Minute siehst du im RunPod-Dashboard einen Link zu JupyterLab. Öffne es und starte dann ein Terminal. Du kannst auch per SSH arbeiten oder das Web-Terminal nutzen, aber für dieses Setup ist das JupyterLab-Terminal besonders angenehm: schnell zugänglich, leicht zu managen und mit mehreren parallelen Terminals ohne Probleme.

Aktualisiere zuerst pip und installiere uv.
pip install --upgrade pip && pip install uv

Lege als Nächstes einen neuen Projektordner an und wechsle hinein.
mkdir Unsloth-Studio && cd Unsloth-Studio
Erstelle danach mit uv eine virtuelle Umgebung.
uv venv
Du solltest eine ähnliche Ausgabe sehen, die bestätigt, dass die virtuelle Umgebung erfolgreich erstellt wurde.
Using CPython 3.12.3 interpreter at: /usr/local/bin/python
Creating virtual environment at: .venv
Activate with: source .venv/bin/activate
Aktiviere nun die virtuelle Umgebung.
source .venv/bin/activate
Sobald die Umgebung aktiv ist, installiere Unsloth mit uv.
uv pip install unsloth --torch-backend=auto

Führe zum Schluss den Studio-Setup-Befehl aus. Dieser Schritt übernimmt die aufwendigeren Teile für dich, darunter die Installation von Node.js, npm, den Build von llama.cpp sowie die zusätzlichen Python-Pakete für diesen Run.
unsloth studio setup

Sobald das Setup abgeschlossen ist, siehst du den Befehl, mit dem du Unsloth Studio lokal startest.
Unsloth Studio lokal starten
Erinnere dich: Zu Beginn haben wir beim Bearbeiten des RunPod-Templates Port 8910 freigegeben.
Jetzt starten wir Unsloth Studio auf genau diesem Port, damit wir es direkt über den RunPod-Link erreichen können und nicht nur per localhost innerhalb der Maschine.
Führe folgenden Befehl im Terminal aus, um die Web-Inferenz von Unsloth Studio zu starten.
unsloth studio -H 0.0.0.0 -p 8910
Nach dem Start solltest du sehen, dass die A40-GPU erkannt wurde, zusammen mit den Standard-Admin-Zugangsdaten und dem Standardmodell, das bereits heruntergeladen und einsatzbereit ist. In den meisten Fällen ist standardmäßig ein quantisiertes Qwen3.5 4B verfügbar, sodass du das Studio sofort testen kannst, ohne zuerst ein anderes Modell zu laden.

Klicke statt auf den im Terminal gezeigten localhost-Link zurück ins RunPod-Dashboard und öffne den Tab Connect. Dort findest du den Link zu Port 8910, über den du die Unsloth-Studio-Weboberfläche öffnest.

Beim ersten Öffnen fordert dich Studio auf, ein neues Passwort zu setzen. Vergib eines, damit die Instanz geschützt ist und nicht über den öffentlichen Link von anderen genutzt werden kann.

Anschließend landest du im Onboarding-Flow, den du bei Bedarf überspringen kannst. Er ist hilfreich für einen schnellen Rundgang durch Oberfläche, Buttons und Hauptbereiche, aber nicht zwingend nötig.

Danach landest du im Unsloth-Studio-Dashboard. Die Oberfläche ist in vier Haupt-Tabs gegliedert.
Studio ist für das Feintuning, unter Recipes erstellst du Datensätze aus PDFs, CSVs und Co., Export speichert feinabgestimmte Modelle in Formaten wie GGUF oder 16-bit Safetensors, und im Chat interagierst du direkt mit dem Modell.

Die Chat-Oberfläche von Unsloth Studio testen
Klicke auf den Tab Chat und dann oben links auf Modell auswählen. Wie im Screenshot zu sehen, ist Qwen3.5 4B bereits heruntergeladen. Klicke darauf, wähle die installierte quantisierte Version – und los geht’s. Das Laden in den GPU-Speicher dauert ein paar Sekunden.

Zum Testen haben wir eine Matheaufgabe gestellt – die Antwort kam erstaunlich schnell, flüssig und schlüssig.

Du kannst außerdem die Websuche aktivieren und nach aktuellen Themen fragen. Ist diese Option aktiv, führt Unsloth Studio zuerst eine Websuche aus und übergibt die gefundenen Informationen an das Modell, damit die Antwort fundierter ausfällt.

Wie du siehst, kamen die Top fünf News-Ergebnisse großer Publikationen zum Aktienmarkt zurück.

Du kannst auch nach beliebigen Modellen auf Hugging Face suchen und sie direkt in der Oberfläche herunterladen. Im Beispiel haben wir Qwen3.5 9B 4‑bit quantisiert geladen.

Nach dem Klick auf das Modell startet der Download. Je nach Modellgröße und Internetgeschwindigkeit kann das eine Weile dauern.

Sobald der Download fertig ist, kannst du das neue Modell laden. Innerhalb weniger Sekunden wechselt Unsloth Studio vom bisherigen auf das neue Modell – und du arbeitest mit einer stärkeren Variante.

Anschließend haben wir das neue Modell gebeten, SVG-Art eines Faultiers zu generieren.

Das Modell hat die Aufgabe zunächst durchdacht, dann den SVG-Code erzeugt und schließlich die Faultier-Grafik direkt in der Oberfläche angezeigt.

Es sah definitiv nach einem Faultier aus – wenn auch keinem besonders beeindruckenden. Mit einem größeren und stärkeren Modell bekommst du in der Regel deutlich bessere Ergebnisse, vor allem mit einer leistungsfähigeren GPU und ausreichend RAM.

Die Chat-Oberfläche von Unsloth Studio bietet außerdem diverse Konfigurationsoptionen. Du kannst Generierungsparameter anpassen, einen Systemprompt hinzufügen, das Chat-Template modifizieren und freier mit dem Modellverhalten experimentieren.

Fazit
Insgesamt habe ich Unsloth Studio sehr gern genutzt. Das Setup lief nicht ganz so reibungslos wie erwartet und es gab ein paar Stolpersteine, aber sobald alles lief, hat sich das Erlebnis komplett gewandelt.
Der größte Knackpunkt war der Schritt unsloth studio setup. Auf dem Papier klingt es simpel, in der Praxis dauerte die Komplettinstallation jedoch fast 15 bis 20 Minuten. Vermutlich hätte ich manches manuell schneller erledigt.
Selbst in den Docs ist eher von 5 bis 10 Minuten die Rede, bei mir hat es aber spürbar länger gedauert.
Der zweite Schmerzpunkt war der Speicherbedarf. Ich dachte zunächst, dass moderater Platz ausreicht, am Ende belegte das vollständige Setup jedoch nahezu 100 GB – deutlich mehr als erwartet. Ich bin nicht ganz sicher, wohin der ganze Speicher ging.
Mögliche Ursachen: die virtuelle Umgebung, geladene Abhängigkeiten, Modellfiles, Build-Artefakte oder Tools, die während des Setups globaler installiert wurden. Das war nicht sehr transparent.
Trotzdem: Sobald Unsloth Studio lief, war ich wirklich überzeugt. Die Oberfläche wirkt ausgereift, schnell und überraschend einfach zu bedienen.
Alles ist an einem Ort, der Workflow fühlt sich rund an und lokale Modellexperimente werden deutlich zugänglicher. Das Setup kann die Geduld etwas strapazieren, aber das tatsächliche Produkterlebnis macht das wett.
Als zertifizierter Data Scientist ist es meine Leidenschaft, modernste Technologien zu nutzen, um innovative Machine Learning-Anwendungen zu entwickeln. Mit meinem fundierten Hintergrund in den Bereichen Spracherkennung, Datenanalyse und Reporting, MLOps, KI und NLP habe ich meine Fähigkeiten bei der Entwicklung intelligenter Systeme verfeinert, die wirklich etwas bewirken können. Neben meinem technischen Fachwissen bin ich auch ein geschickter Kommunikator mit dem Talent, komplexe Konzepte in eine klare und prägnante Sprache zu fassen. Das hat dazu geführt, dass ich ein gefragter Blogger zum Thema Datenwissenschaft geworden bin und meine Erkenntnisse und Erfahrungen mit einer wachsenden Gemeinschaft von Datenexperten teile. Zurzeit konzentriere ich mich auf die Erstellung und Bearbeitung von Inhalten und arbeite mit großen Sprachmodellen, um aussagekräftige und ansprechende Inhalte zu entwickeln, die sowohl Unternehmen als auch Privatpersonen helfen, das Beste aus ihren Daten zu machen.
