Kurs
Unsloth Studio hat mit Unsloth Desktop ein großes Upgrade bekommen. Damit lässt sich alles lokal als Desktop-App ausführen. Das ist besonders praktisch, wenn du keine Zeit mit Paketinstallationen, Tool-Konfigurationen oder ständigen Terminal-Befehlen verbringen willst.
Unsloth Desktop ist im Grunde eine All-in-one-Lösung für lokale KI-Workflows. Du kannst LLMs ausführen und feinabstimmen, Vision-Modelle testen, Bilder und Videos generieren, Bildmodelle trainieren, mit Audio arbeiten, KI-Coding-Tools nutzen, Modelle verwalten und eine lokale API bereitstellen – alles in einer Anwendung.
In dieser Anleitung installieren wir Unsloth Desktop unter Linux, führen lokale LLMs aus, verbinden es mit OpenCode und nutzen ein lokales Modell, um ein Python-Projekt zu bauen. Außerdem schauen wir uns weitere Funktionen an und prüfen, wie viel sich lokal in einer einzigen App erledigen lässt.
1. Prüfe deine NVIDIA-GPU
Bevor du Unsloth Desktop installierst, empfiehlt es sich, kurz zu prüfen, ob deine NVIDIA-GPU erkannt wird und CUDA korrekt funktioniert. So vermeidest du spätere Probleme beim lokalen Ausführen oder Feintunen von Modellen.
Öffne zuerst das Terminal und führe aus:
nvidia-smi

Die Ausgabe sollte deine NVIDIA-GPU, Treiberversion, verfügbaren GPU-Speicher und CUDA-Kompatibilitätsinfos anzeigen.
Als Nächstes prüfst du den auf deinem System installierten CUDA-Compiler:
nvcc --version
Du solltest eine ähnliche Ausgabe sehen:
nvcc: NVIDIA (R) Cuda compiler driver
Copyright (c) 2005-2025 NVIDIA Corporation
Built on Tue_May_27_02:21:03_PDT_2025
Cuda compilation tools, release 12.9, V12.9.86
Build cuda_12.9.r12.9/compiler.36037853_0
Wenn beide Befehle funktionieren und deine GPU korrekt erkannt wird, ist dein System bereit für Unsloth Desktop.
2. Unsloth Desktop herunterladen und installieren
Gehe als Nächstes auf die offizielle Unsloth-Website und lade Unsloth Desktop herunter. Achte darauf, das passende Paket für dein Betriebssystem zu wählen.

Quelle: Unsloth Desktop für Linux herunterladen
Nach dem Download installierst du das Paket wie jede andere Desktop-App. Unter Linux ist das je nach Distribution z. B. ein .deb-Paket.

Sobald die Installation abgeschlossen ist, starte Unsloth Desktop. Die Anwendung sollte deine Hardware automatisch erkennen und dir Zugriff auf die Hauptoberfläche geben.

Von hier aus kannst du Modelle durchsuchen und herunterladen, LLMs lokal ausführen, Modelle feinabstimmen, mit Bildern und weiteren Modalitäten arbeiten, deine lokalen Modelle verwalten und auf weitere Tools in Unsloth Desktop zugreifen.
3. Ein LLM in Unsloth Desktop herunterladen und ausführen
Öffne in Unsloth Desktop den Model Hub und suche nach dem gewünschten Modell. Für diesen Test habe ich eines meiner Lieblings-„Small Models“ verwendet:
empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF · Hugging Face

Nach dem Download kannst du das Modell laden und direkt in Unsloth Desktop damit chatten. Auf meinem System lag die Geschwindigkeit im Schnitt bei rund 102 Tokens pro Sekunde, teils sogar bei etwa 125 Tokens pro Sekunde bei Coding-Fragen.
Ich habe außerdem Webzugriff aktiviert und das Modell zu aktuellen Börsennews befragt. Das macht den lokalen Chat deutlich nützlicher, wenn du Informationen jenseits des Modellwissens brauchst.

Als Nächstes wollte ich sehen, ob es auch etwas bauen kann statt nur Fragen zu beantworten. Ich habe es gebeten, eine Website zu erstellen. Es generierte den Code und zeigte die Seite neben dem Chat an – so kann man bequem weiter ändern und direkt das Ergebnis sehen.

4. Ein Vision-Modell testen
Unsloth Desktop unterstützt auch Vision-Language-Modelle. Du kannst also ein Bild direkt in den Chat hochladen und Fragen dazu stellen.
Für meinen Test wurde der erforderliche Vision-Encoder beim Modelldownload automatisch installiert. Ich habe nur ein Bild hochgeladen, eine Frage gestellt und nach wenigen Sekunden eine sehr präzise Antwort erhalten.

Vision-Support ist besonders nützlich beim Arbeiten mit Coding-Agenten. Du kannst etwa einen Screenshot einer Website hochladen und auf ein Problem hinweisen, ein Design zeigen, das du nachbauen möchtest, oder eine vorhandene Oberfläche als visuelle Referenz für deine eigene App verwenden.
5. Unsloth Desktop mit OpenCode nutzen
Kleinere Modelle sind super zum Testen und für leichtes agentisches Coding. Wenn du jedoch einen ernstzunehmenden lokalen Coding-Agenten für größere Projekte willst, brauchst du ein stärkeres Modell, das trotzdem in den VRAM deiner GPU passt.
In meinem Fall nutze ich eine RTX 3090 mit 24 GB VRAM und habe daher die Q4-Version von Muse Glimmer 30B heruntergeladen.
Öffne in Unsloth Desktop den Tab Models, suche das Modell und lade die Version UD-Q4_K_XL herunter. Nach ein paar Minuten sollte das Modell geladen sein.

Standardmäßig war das Kontextfenster auf ca. 4K gesetzt – zu klein für einen Coding-Agenten, der über mehrere Dateien arbeitet. Öffne das rechte Seitenpanel in Unsloth Desktop, stelle die Kontextlänge auf 64K, scrolle nach unten und lade das Modell neu.

Nach dem Neuladen des Modells gehe zu Settings → System und prüfe die VRAM-Auslastung. Bei mir belegte das Modell etwa 22 GB VRAM, sodass rund 2 GB für den KV-Cache übrig blieben. Für meine Tests war das ausreichend – der verfügbare Speicher hängt aber von deiner GPU und der Last ab.

Öffne anschließend Settings → Agents und wähle OpenCode als Coding-Agent. Unsloth Desktop generiert automatisch den Startbefehl.

Lege zuerst per Terminal ein Projektverzeichnis an:
mkdir unsloth-project
cd unsloth-project
Starte dann OpenCode:
unsloth start opencode \
--model unsloth/Muse-Glimmer-30B-GGUF:UD-Q4_K_XL \
--context-length 64000
Achte darauf, die Kontextlänge im Befehl mitzugeben. Andernfalls startet OpenCode eventuell mit dem kleineren Standardfenster.
Der Befehl installiert OpenCode bei Bedarf und startet dann das Terminal-Interface – bereit mit deinem lokalen Unsloth-Modell.

6. Ein Projekt mit OpenCode bauen
Jetzt, wo alles verbunden ist, wollte ich den lokalen Coding-Agenten richtig testen. Statt nur ein kleines Snippet zu generieren, habe ich ihn gebeten, ein komplettes Mario-ähnliches Spiel in Python von Grund auf zu bauen.
Ich habe dieses Prompt verwendet:
Create a simple Mario-style 2D platform game in Python using Pygame.
Add left/right movement, jumping, platforms, coins, enemies, a score counter, and a finish flag.
Use simple built-in shapes instead of external assets. Create the files, install dependencies, test the game, and tell me how to run it.
OpenCode hat zunächst eine To-do-Liste erstellt und das Projekt dann Schritt für Schritt umgesetzt. Es hat die Dateien angelegt, die Spiellogik geschrieben, die Abhängigkeiten installiert und mir am Ende den Startbefehl gegeben.

Das fertige Spiel lief, auch wenn es noch etwas buggy war. Die Q4-Version von Muse Glimmer lieferte für diese größere Coding-Aufgabe nicht ganz die erhoffte Performance. Wenn du genug VRAM hast, empfehle ich die Q8-Version für bessere Coding-Ergebnisse.

7. Weitere wichtige Funktionen von Unsloth Desktop
Bisher haben wir Unsloth Desktop vor allem für LLMs und Coding-Agenten genutzt, aber es kann deutlich mehr. Die Idee ist, die meisten lokalen KI-Workflows in einer Anwendung zu bündeln, statt für jede Aufgabe ein separates Tool einzurichten.

LLM-Feintuning
Du kannst LLMs lokal mit Methoden wie LoRA und QLoRA feinabstimmen. Das No-Code-Interface erleichtert Datenauswahl, Trainingseinstellungen, Start des Laufs und Export des finalen Modells, ohne dass du selbst eine komplette Trainingspipeline bauen musst.
Bildgenerierung und -bearbeitung
Du kannst unterstützte Diffusionsmodelle herunterladen und Bilder lokal per Text-Prompts generieren. Außerdem lassen sich vorhandene Bilder hochladen, gewünschte Änderungen beschreiben und die unterstützten Modelle für die Bildbearbeitung nutzen.
Image-LoRA-Training
Wenn du über die Bildgenerierung hinausgehen willst, kannst du auch Image-LoRAs auf deinem eigenen Datensatz trainieren. So lässt sich einem Modell ein bestimmtes Motiv, ein Charakter, ein Produkt oder ein visueller Stil beibringen und später wiederverwenden.
Videogenerierung
Unsloth Desktop unterstützt auch lokale Videogenerierungs-Workflows mit Diffusionsmodellen. Du kannst also Bild- und Videogenerierung in derselben Anwendung ausprobieren, statt eine separate Umgebung aufzusetzen.
Sprach- und Audiomodelle
Du kannst mit Speech-to-Text, Text-to-Speech und weiteren unterstützten Audiomodellen arbeiten. So transkribierst du Audio, generierst Sprache und experimentierst mit verschiedenen Audio-KI-Workflows lokal.
Data Recipes
Data Recipes helfen, Dateien wie PDFs und CSVs in Datensätze zu verwandeln, die du prüfen, bearbeiten und fürs Training vorbereiten kannst. Das ist besonders nützlich, wenn du eigene Daten hast, aber den Datensatz nicht manuell von Grund auf bauen willst.
Modellspeicher und -verwaltung
Wenn du mehr Modelle herunterlädst und eigene trainierst, wird das Management schnell unübersichtlich. Unsloth Desktop bietet einen zentralen Ort, um heruntergeladene Modelle, Datensätze, Adapter, Trainingsläufe und andere lokale Assets zu verwalten.
Modelle exportieren
Unsloth Studio unterstützt offiziell den Export von Safetensors/LoRA-Modellen nach GGUF und in andere Formate. llama.cpp wird explizit zum Ausführen exportierter Modelle unterstützt.
Lokale API
Zum Schluss kann Unsloth Desktop dein lokales Modell über eine OpenAI-kompatible API bereitstellen. So verbindest du lokal laufende Modelle einfach mit anderen Anwendungen, Coding-Tools oder KI-Projekten – ohne von einer gehosteten Modell-API abhängig zu sein.
Fazit
Unsloth Desktop entwickelt sich in eine spannende Richtung. LLMs, Feintuning, Bild- und Videogenerierung, Coding-Agenten, Datensätze und lokale APIs in einer Desktop-App zu bündeln, macht lokale KI deutlich zugänglicher – besonders für alle, die nicht jede Komponente manuell konfigurieren wollen.
Allerdings wirkt noch nicht alles ausgereift. Auf älteren GPUs oder Systemen mit veralteten CUDA-Treibern kann es nötig sein, Abhängigkeiten zu beheben und unter Linux oder Windows manuell nachzuinstallieren. Ich hatte zudem Probleme mit der Bildgenerierung, den Kontexteinstellungen und den Coding-Agenten. Erhöhst du etwa das Modellkontextfenster in Unsloth Desktop, musst du dieselbe Kontextlänge manchmal auch explizit beim Start des Coding-Agenten setzen. Einige Website-Generierungen und Canvas-Workflows liefen ebenfalls nicht immer wie erwartet.
Unsloth hat in kurzer Zeit extrem viele Features hinzugefügt, aber noch wirkt nicht alles vollständig stabil. Ich gehe davon aus, dass sich vieles verbessert, wenn Desktop weiter optimiert und reift.
Wenn es mir aktuell nur darum geht, ein lokales LLM für einen KI-Coding-Agenten oder eine andere Anwendung bereitzustellen, bevorzuge ich weiterhin llama.cpp. Damit habe ich deutlich mehr Kontrolle über Modell, Kontext, GPU-Offloading, Speichernutzung und andere Low-Level-Einstellungen. Unsloth Desktop ist erheblich einfacher zu bedienen, während llama.cpp die bessere Wahl ist, wenn ich die Konfiguration feinjustieren und die maximale Performance aus meiner Hardware herausholen möchte.
Als zertifizierter Data Scientist ist es meine Leidenschaft, modernste Technologien zu nutzen, um innovative Machine Learning-Anwendungen zu entwickeln. Mit meinem fundierten Hintergrund in den Bereichen Spracherkennung, Datenanalyse und Reporting, MLOps, KI und NLP habe ich meine Fähigkeiten bei der Entwicklung intelligenter Systeme verfeinert, die wirklich etwas bewirken können. Neben meinem technischen Fachwissen bin ich auch ein geschickter Kommunikator mit dem Talent, komplexe Konzepte in eine klare und prägnante Sprache zu fassen. Das hat dazu geführt, dass ich ein gefragter Blogger zum Thema Datenwissenschaft geworden bin und meine Erkenntnisse und Erfahrungen mit einer wachsenden Gemeinschaft von Datenexperten teile. Zurzeit konzentriere ich mich auf die Erstellung und Bearbeitung von Inhalten und arbeite mit großen Sprachmodellen, um aussagekräftige und ansprechende Inhalte zu entwickeln, die sowohl Unternehmen als auch Privatpersonen helfen, das Beste aus ihren Daten zu machen.
