Weiter zum Inhalt

Unsloth Studio lokal ausführen: Schritt-für-Schritt-Anleitung

Lerne, wie du Unsloth Studio lokal auf einer GPU-Maschine installierst und startest, die Chat-Oberfläche testest und Funktionen erkundest.
Aktualisiert 18. Sept. 2026  · 8 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Du hast wahrscheinlich schon von Unsloth gehört. Sie sind bekannt dafür, schnell quantisierte Versionen neuer offener Modelle zu veröffentlichen, die sich einfacher herunterladen, laden und in lokalen Inferenz-Setups ausführen lassen. Außerdem haben sie sich mit praxisnahen Anleitungen einen Namen gemacht, wie man die neuesten Open-Modelle ohne Setup-Frust ausführt und feinabstimmt. 

Mit Unsloth Studio bringen sie vieles davon inzwischen in eine Oberfläche: eine lokale Web-UI zum Ausführen und Trainieren von Modellen, mit Support für GGUF und Safetensors, Side-by-Side-Modellvergleich, automatischem Tuning der Inferenzparameter, Tool-Calling und einer OpenAI-kompatiblen API.

In diesem Tutorial zeige ich dir, wie du die Umgebung für Unsloth Studio vorbereitest, es lokal installierst, die Oberfläche startest und ein Modell direkt in der UI testest. Kein unübersichtlicher manueller Pipeline-Zirkus, kein Hin- und Herwechseln zwischen fünf Tools und kein zusätzlicher Inferenzcode nur für den Einstieg. 

Schau dir außerdem unseren Guide zum Feintuning mit Unsloth Studio sowie unseren ursprünglichen Unsloth-Guide an, um mehr zu erfahren. 

Was ist Unsloth Studio?

Unsloth Studio ist Unsloths neue Open-Source-Weboberfläche für das lokale Ausführen, Trainieren und Exportieren offener Modelle an einem Ort. Statt separater Tools für Inferenz, Feintuning und Tests bündelt sie alles in einem Setup, das du auf deinem eigenen Rechner laufen lassen kannst. 

Unsloth Studio unterstützt GGUF- und Safetensors-Modelle, läuft auf Mac, Windows und Linux und macht lokale Modellexperimente deutlich einfacher für alle, die lieber visuell arbeiten, statt Skripte von Hand zusammenzustückeln.

Wichtige Funktionen von Unsloth Studio

Mehrere Funktionen machen das Tool besonders spannend, darunter:

  • Modelle in einer Oberfläche suchen, herunterladen und lokal ausführen
  • Zwei Modelle nebeneinander vergleichen
  • Self-Healing-Tool-Calling und integrierte Websuche nutzen
  • Inferenz-Einstellungen automatisch optimieren lassen
  • Chat-Templates leicht bearbeiten
  • OpenAI-kompatible APIs ansprechen
  • Modelle mit No-Code-Workflow feinabstimmen
  • Datensätze automatisch aus Dateien wie PDF, CSV, JSON, DOCX und TXT erstellen
  • Modelle in Formate wie GGUF und 16-bit Safetensors exportieren

Voraussetzungen für Unsloth Studio

Bevor du mit der Installation beginnst, stell sicher, dass dein System die Basistools für den lokalen Betrieb von Unsloth Studio mitbringt. Das Setup ist gut machbar, aber wenn du Modelle feinabstimmen willst und nicht nur chatten, brauchst du eine vollständige GPU-Umgebung.

  • Python: Version 3.11 bis 3.13
  • Git: Zum Klonen und Verwalten des Repos
  • CMake: Für den lokalen Build von Komponenten im Setup erforderlich
  • macOS-Tools: Homebrew und OpenSSL können auf macOS nötig sein
  • NVIDIA-GPU: Erforderlich, wenn du Modelle lokal feinabstimmen willst
  • Aktuelle NVIDIA-Treiber: Empfohlen, um Setup-, CUDA- oder Trainingsprobleme zu vermeiden

Kurz gesagt: Einfaches lokales Chatten bekommst du auch auf einer CPU gut ans Laufen, für Feintuning brauchst du jedoch passende NVIDIA-Hardware und aktuelle Treiber zusätzlich zu den Standardtools.

RunPod-Umgebung einrichten

Für dieses Tutorial verwenden wir eine RunPod-A40-Maschine. Ich hätte alles auch auf meinem Laptop laufen lassen können, aber mir fehlt der Speicherplatz und meine Internetverbindung ist zu langsam, um große Modelle und Abhängigkeiten entspannt herunterzuladen. 

Statt langer Downloads, zäher Builds und dem Risiko, mein System zuzumüllen, nutze ich deshalb RunPod als einfache Cloud-Option, die für diesen Workflow deutlich schneller eingerichtet ist.

  • Erstelle zunächst einen neuen A40-Pod und wähle das aktuelle PyTorch-2.8.0-Template
  • Bearbeite vor dem Deployment die Pod-Einstellungen und setze die Container-Disk auf 50 GB und die Volume-Disk auf 100 GB, damit du genug Platz für Installation und Modell-Downloads hast. 
  • Öffne außerdem den HTTP-Port 8888 für Jupyter Notebook und Port 8910 für Unsloth Studio. 
  • Deinen Hugging-Face-Token als Umgebungsvariable hinzuzufügen ist optional, beschleunigt aber oft Downloads und vereinfacht den Zugriff auf Modelle mit Gate.

Editing Runpod template

Wenn alles passt, speichere die Änderungen, prüfe die Pod-Zusammenfassung und deploye den Pod.

Runpod Pod Summary

Unsloth Studio installieren

Nach etwa einer Minute siehst du im RunPod-Dashboard einen Link zu JupyterLab. Öffne es und starte dann ein Terminal. Du kannst auch per SSH arbeiten oder das Web-Terminal nutzen, aber für dieses Setup ist das JupyterLab-Terminal besonders angenehm: schnell zugänglich, leicht zu managen und mit mehreren parallelen Terminals ohne Probleme.

JupyterLab on Runpod

Aktualisiere zuerst pip und installiere uv

pip install --upgrade pip && pip install uv

JupyterLab's terminal on Runpod

Lege als Nächstes einen neuen Projektordner an und wechsle hinein.

mkdir Unsloth-Studio && cd Unsloth-Studio

Erstelle danach mit uv eine virtuelle Umgebung.

uv venv

Du solltest eine ähnliche Ausgabe sehen, die bestätigt, dass die virtuelle Umgebung erfolgreich erstellt wurde.

Using CPython 3.12.3 interpreter at: /usr/local/bin/python
Creating virtual environment at: .venv
Activate with: source .venv/bin/activate

Aktiviere nun die virtuelle Umgebung.

source .venv/bin/activate

Sobald die Umgebung aktiv ist, installiere Unsloth mit uv.

uv pip install unsloth --torch-backend=auto

Installing Python Dependencies for the unsloth

Führe zum Schluss den Studio-Setup-Befehl aus. Dieser Schritt übernimmt die aufwendigeren Teile für dich, darunter die Installation von Node.js, npm, den Build von llama.cpp sowie die zusätzlichen Python-Pakete für diesen Run.

unsloth studio setup

Setup script run for the Unsloth Studio

Sobald das Setup abgeschlossen ist, siehst du den Befehl, mit dem du Unsloth Studio lokal startest.

Unsloth Studio lokal starten

Erinnere dich: Zu Beginn haben wir beim Bearbeiten des RunPod-Templates Port 8910 freigegeben. 

Jetzt starten wir Unsloth Studio auf genau diesem Port, damit wir es direkt über den RunPod-Link erreichen können und nicht nur per localhost innerhalb der Maschine.

Führe folgenden Befehl im Terminal aus, um die Web-Inferenz von Unsloth Studio zu starten.

unsloth studio -H 0.0.0.0 -p 8910

Nach dem Start solltest du sehen, dass die A40-GPU erkannt wurde, zusammen mit den Standard-Admin-Zugangsdaten und dem Standardmodell, das bereits heruntergeladen und einsatzbereit ist. In den meisten Fällen ist standardmäßig ein quantisiertes Qwen3.5 4B verfügbar, sodass du das Studio sofort testen kannst, ohne zuerst ein anderes Modell zu laden.

running the unsloth studio locally

Klicke statt auf den im Terminal gezeigten localhost-Link zurück ins RunPod-Dashboard und öffne den Tab Connect. Dort findest du den Link zu Port 8910, über den du die Unsloth-Studio-Weboberfläche öffnest.

accessing the Unsloth Studio web interface form Runpod dashboard

Beim ersten Öffnen fordert dich Studio auf, ein neues Passwort zu setzen. Vergib eines, damit die Instanz geschützt ist und nicht über den öffentlichen Link von anderen genutzt werden kann.

Unsloth Studio account setup

Anschließend landest du im Onboarding-Flow, den du bei Bedarf überspringen kannst. Er ist hilfreich für einen schnellen Rundgang durch Oberfläche, Buttons und Hauptbereiche, aber nicht zwingend nötig.

Unsloth Studio onboarding

Danach landest du im Unsloth-Studio-Dashboard. Die Oberfläche ist in vier Haupt-Tabs gegliedert. 

Studio ist für das Feintuning, unter Recipes erstellst du Datensätze aus PDFs, CSVs und Co., Export speichert feinabgestimmte Modelle in Formaten wie GGUF oder 16-bit Safetensors, und im Chat interagierst du direkt mit dem Modell.

Unsloth Studio dashboard

Die Chat-Oberfläche von Unsloth Studio testen

Klicke auf den Tab Chat und dann oben links auf Modell auswählen. Wie im Screenshot zu sehen, ist Qwen3.5 4B bereits heruntergeladen. Klicke darauf, wähle die installierte quantisierte Version – und los geht’s. Das Laden in den GPU-Speicher dauert ein paar Sekunden.

Unsloth Studio chat interface

Zum Testen haben wir eine Matheaufgabe gestellt – die Antwort kam erstaunlich schnell, flüssig und schlüssig.

using Unsloth Studio chat

Du kannst außerdem die Websuche aktivieren und nach aktuellen Themen fragen. Ist diese Option aktiv, führt Unsloth Studio zuerst eine Websuche aus und übergibt die gefundenen Informationen an das Modell, damit die Antwort fundierter ausfällt.

Testing Unsloth Studio web search feature

Wie du siehst, kamen die Top fünf News-Ergebnisse großer Publikationen zum Aktienmarkt zurück.

Unsloth Studio web search results

Du kannst auch nach beliebigen Modellen auf Hugging Face suchen und sie direkt in der Oberfläche herunterladen. Im Beispiel haben wir Qwen3.5 9B 4‑bit quantisiert geladen.

downloading the new model in the Unsloth Studio

Nach dem Klick auf das Modell startet der Download. Je nach Modellgröße und Internetgeschwindigkeit kann das eine Weile dauern.

downloading the model in the Unsloth Studio

Sobald der Download fertig ist, kannst du das neue Modell laden. Innerhalb weniger Sekunden wechselt Unsloth Studio vom bisherigen auf das neue Modell – und du arbeitest mit einer stärkeren Variante.

selecting the downloaded model in the Unsloth Studio

Anschließend haben wir das neue Modell gebeten, SVG-Art eines Faultiers zu generieren.

Unsloth Studio chat interface thinking on the tsk.

Das Modell hat die Aufgabe zunächst durchdacht, dann den SVG-Code erzeugt und schließlich die Faultier-Grafik direkt in der Oberfläche angezeigt.

Unsloth Studio generated the response, with svg code,

Es sah definitiv nach einem Faultier aus – wenn auch keinem besonders beeindruckenden. Mit einem größeren und stärkeren Modell bekommst du in der Regel deutlich bessere Ergebnisse, vor allem mit einer leistungsfähigeren GPU und ausreichend RAM.

SVG image of the cute sloth

Die Chat-Oberfläche von Unsloth Studio bietet außerdem diverse Konfigurationsoptionen. Du kannst Generierungsparameter anpassen, einen Systemprompt hinzufügen, das Chat-Template modifizieren und freier mit dem Modellverhalten experimentieren.

Unsloth Studio Chat configuration settings

Fazit

Insgesamt habe ich Unsloth Studio sehr gern genutzt. Das Setup lief nicht ganz so reibungslos wie erwartet und es gab ein paar Stolpersteine, aber sobald alles lief, hat sich das Erlebnis komplett gewandelt. 

Der größte Knackpunkt war der Schritt unsloth studio setup. Auf dem Papier klingt es simpel, in der Praxis dauerte die Komplettinstallation jedoch fast 15 bis 20 Minuten. Vermutlich hätte ich manches manuell schneller erledigt. 

Selbst in den Docs ist eher von 5 bis 10 Minuten die Rede, bei mir hat es aber spürbar länger gedauert.

Der zweite Schmerzpunkt war der Speicherbedarf. Ich dachte zunächst, dass moderater Platz ausreicht, am Ende belegte das vollständige Setup jedoch nahezu 100 GB – deutlich mehr als erwartet. Ich bin nicht ganz sicher, wohin der ganze Speicher ging. 

Mögliche Ursachen: die virtuelle Umgebung, geladene Abhängigkeiten, Modellfiles, Build-Artefakte oder Tools, die während des Setups globaler installiert wurden. Das war nicht sehr transparent. 

Trotzdem: Sobald Unsloth Studio lief, war ich wirklich überzeugt. Die Oberfläche wirkt ausgereift, schnell und überraschend einfach zu bedienen. 

Alles ist an einem Ort, der Workflow fühlt sich rund an und lokale Modellexperimente werden deutlich zugänglicher. Das Setup kann die Geduld etwas strapazieren, aber das tatsächliche Produkterlebnis macht das wett.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Als zertifizierter Data Scientist ist es meine Leidenschaft, modernste Technologien zu nutzen, um innovative Machine Learning-Anwendungen zu entwickeln. Mit meinem fundierten Hintergrund in den Bereichen Spracherkennung, Datenanalyse und Reporting, MLOps, KI und NLP habe ich meine Fähigkeiten bei der Entwicklung intelligenter Systeme verfeinert, die wirklich etwas bewirken können. Neben meinem technischen Fachwissen bin ich auch ein geschickter Kommunikator mit dem Talent, komplexe Konzepte in eine klare und prägnante Sprache zu fassen. Das hat dazu geführt, dass ich ein gefragter Blogger zum Thema Datenwissenschaft geworden bin und meine Erkenntnisse und Erfahrungen mit einer wachsenden Gemeinschaft von Datenexperten teile. Zurzeit konzentriere ich mich auf die Erstellung und Bearbeitung von Inhalten und arbeite mit großen Sprachmodellen, um aussagekräftige und ansprechende Inhalte zu entwickeln, die sowohl Unternehmen als auch Privatpersonen helfen, das Beste aus ihren Daten zu machen.

Themen
Künstliche Intelligenz
KI-Agenten

Top-DataCamp-Kurse

Kurs

Feinabstimmung mit Llama 3

2 Std.
4K
Optimiere Llama mit TorchTune für deine eigenen Aufgaben und lerne Techniken für effizientes Fine-Tuning, wie zum Beispiel Quantisierung.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow