Cours
Unsloth Studio a connu une mise à niveau majeure avec Unsloth Desktop, qui vous permet d’exécuter le tout en local sous forme d’application de bureau. C’est particulièrement utile si vous ne souhaitez pas passer du temps à installer des packages, à configurer divers outils ou à lancer sans cesse des commandes dans le terminal.
Unsloth Desktop est en pratique une solution tout-en-un pour les workflows d’IA locaux. Vous pouvez exécuter et affiner des LLM, tester des modèles de vision, générer des images et des vidéos, entraîner des modèles d’images, travailler avec l’audio, utiliser des outils de codage IA, gérer vos modèles et exposer une API locale, le tout depuis la même application.
Dans ce guide, nous allons installer Unsloth Desktop sous Linux, exécuter des LLM en local, le connecter à OpenCode et utiliser un modèle local pour créer un projet Python. Nous explorerons également d’autres fonctionnalités et verrons tout ce qu’il est possible de faire en local avec une seule application.
1. Vérifiez votre GPU NVIDIA
Avant d’installer Unsloth Desktop, il est judicieux de vérifier rapidement que votre GPU NVIDIA est détecté et que CUDA fonctionne correctement. Cela évitera des problèmes plus tard lorsque vous commencerez à exécuter ou affiner des modèles en local.
Ouvrez d’abord le terminal et lancez :
nvidia-smi

Vous devriez voir s’afficher votre GPU NVIDIA, la version du pilote, la mémoire GPU disponible et les informations de compatibilité CUDA.
Ensuite, vérifiez le compilateur CUDA installé sur votre système :
nvcc --version
Vous devriez obtenir une sortie similaire à celle-ci :
nvcc: NVIDIA (R) Cuda compiler driver
Copyright (c) 2005-2025 NVIDIA Corporation
Built on Tue_May_27_02:21:03_PDT_2025
Cuda compilation tools, release 12.9, V12.9.86
Build cuda_12.9.r12.9/compiler.36037853_0
Si les deux commandes fonctionnent et que votre GPU est correctement détecté, votre système est prêt pour Unsloth Desktop.
2. Téléchargez et installez Unsloth Desktop
Rendez-vous ensuite sur le site officiel d’Unsloth et téléchargez Unsloth Desktop. Assurez-vous de sélectionner le package correspondant à votre système d’exploitation.

Source : télécharger Unsloth Desktop pour Linux
Une fois le téléchargement terminé, installez le package comme n’importe quelle application de bureau. Sous Linux, il peut s’agir d’un package .deb selon votre distribution.

Une fois l’installation terminée, lancez Unsloth Desktop. L’application devrait détecter automatiquement votre matériel disponible et vous donner accès à l’interface principale.

À partir de là, vous pouvez parcourir et télécharger des modèles, exécuter des LLM en local, affiner des modèles, travailler avec des images et d’autres modalités, gérer vos modèles locaux et accéder aux autres outils disponibles dans Unsloth Desktop.
3. Téléchargez et exécutez un LLM dans Unsloth Desktop
Ouvrez le Model hub dans Unsloth Desktop et recherchez le modèle que vous souhaitez exécuter. Pour ce test, j’ai utilisé l’un de mes petits modèles favoris :
empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF · Hugging Face

Après avoir téléchargé le modèle, vous pouvez le charger et discuter avec lui directement dans Unsloth Desktop. Sur mon système, j’obtenais environ 102 tokens par seconde en moyenne, avec des pointes à 125 tokens par seconde pour certaines requêtes liées au code.
J’ai également activé l’accès Web et posé au modèle des questions sur les dernières actualités boursières. Cela rend l’expérience de chat local bien plus utile lorsque vous avez besoin d’informations au-delà de ce que le modèle contient déjà.

Ensuite, je voulais voir s’il pouvait construire quelque chose plutôt que de simplement répondre aux questions. Je lui ai demandé de créer un site Web ; il a généré le code et affiché le site à côté du chat, ce qui facilite la visualisation du résultat tout en continuant les modifications.

4. Tester un modèle de vision
Unsloth Desktop prend aussi en charge les modèles vision-langage : vous pouvez téléverser une image directement dans le chat et poser des questions à son sujet.
Pour mon test, l’encodeur de vision requis s’est installé automatiquement lors du téléchargement du modèle. J’ai simplement téléversé une image, posé une question et, en quelques secondes, le modèle a renvoyé une réponse très précise.

Le support de la vision est particulièrement utile avec les agents de codage. Par exemple, vous pouvez téléverser une capture d’écran d’un site, pointer un problème à corriger, montrer à l’agent un design à reproduire, ou utiliser une interface existante comme référence visuelle pendant que vous construisez votre propre application.
5. Utiliser Unsloth Desktop avec OpenCode
Les modèles plus petits sont parfaits pour les tests et même pour un peu de codage agentique. Mais si vous voulez un agent de codage local sérieux, capable de gérer des projets plus importants, il vous faudra un modèle plus puissant qui tienne malgré tout dans la VRAM de votre GPU.
Dans mon cas, j’utilise une RTX 3090 avec 24 Go de VRAM, j’ai donc téléchargé la version Q4 de Muse Glimmer 30B.
Ouvrez l’onglet Models dans Unsloth Desktop, recherchez le modèle et téléchargez la version UD-Q4_K_XL. En quelques minutes, le modèle devrait être téléchargé et chargé sur votre système.

Par défaut, la fenêtre de contexte était réglée à environ 4K, trop faible pour un agent de codage travaillant sur plusieurs fichiers. Ouvrez le panneau de droite dans Unsloth Desktop, passez la longueur de contexte à 64K, descendez, puis rechargez le modèle.

Après rechargement du modèle, allez dans Settings → System pour vérifier l’usage mémoire du GPU. Dans mon cas, le modèle utilisait environ 22 Go de VRAM, laissant environ 2 Go disponibles pour le cache KV. C’était suffisant pour mes tests, mais la mémoire disponible dépendra de votre GPU et de la charge.

Ensuite, ouvrez Settings → Agents et sélectionnez OpenCode comme agent de codage. Unsloth Desktop générera automatiquement la commande nécessaire pour le lancer.

Créez d’abord un répertoire de projet via le terminal :
mkdir unsloth-project
cd unsloth-project
Puis lancez OpenCode :
unsloth start opencode \
--model unsloth/Muse-Glimmer-30B-GGUF:UD-Q4_K_XL \
--context-length 64000
Assurez-vous d’inclure la longueur de contexte dans la commande. Sinon, OpenCode peut démarrer avec une fenêtre de contexte par défaut plus petite.
La commande installera OpenCode si nécessaire puis lancera son interface terminal, prête à utiliser votre modèle Unsloth local.

6. Construire un projet avec OpenCode
Maintenant que tout est connecté, je voulais mettre l’agent de codage local à l’épreuve. Plutôt que de lui demander un petit extrait de code, je lui ai demandé de créer un jeu façon Mario en Python, à partir de zéro.
J’ai utilisé cette instruction :
Create a simple Mario-style 2D platform game in Python using Pygame.
Add left/right movement, jumping, platforms, coins, enemies, a score counter, and a finish flag.
Use simple built-in shapes instead of external assets. Create the files, install dependencies, test the game, and tell me how to run it.
OpenCode a d’abord créé une to-do list, puis a avancé pas à pas. Il a créé les fichiers, écrit la logique du jeu, géré les dépendances et, pour finir, m’a donné la commande pour lancer le jeu.

Le jeu final fonctionnait, même s’il restait quelques bugs. La version Q4 de Muse Glimmer n’a pas été aussi performante que je l’espérais pour cette tâche de codage plus lourde. Si vous avez suffisamment de VRAM, je vous recommande d’essayer la version Q8 pour de meilleures performances en codage.

7. Autres fonctionnalités clés d’Unsloth Desktop
Jusqu’ici, nous avons surtout utilisé Unsloth Desktop pour exécuter des LLM et des agents de codage, mais il sait faire bien plus. L’idée est de regrouper l’essentiel de vos workflows d’IA locaux dans une même application plutôt que de configurer un outil différent pour chaque tâche.

Fine-tuning de LLM
Vous pouvez affiner des LLM en local avec des méthodes comme LoRA et QLoRA. L’interface d’entraînement sans code facilite la sélection du jeu de données, la configuration des paramètres, le lancement de l’entraînement et l’export du modèle final, sans avoir à construire vous‑même tout le pipeline.
Génération et retouche d’images
Vous pouvez télécharger des modèles de diffusion pris en charge et générer des images localement à partir d’invites textuelles. Vous pouvez aussi téléverser une image existante, décrire les modifications souhaitées et utiliser les modèles pris en charge pour l’édition d’images.
Entraînement d’Image LoRA
Si vous voulez aller au-delà de la génération d’images, vous pouvez aussi entraîner des LoRA d’images sur votre propre jeu de données. Utile pour apprendre à un modèle un sujet, un personnage, un produit ou un style visuel précis, puis réutiliser cette LoRA pour de futures générations.
Génération vidéo
Unsloth Desktop prend également en charge des workflows de génération vidéo en local avec des modèles de diffusion compatibles. Vous pouvez ainsi expérimenter image et vidéo dans la même application sans mettre en place un environnement séparé.
Modèles de parole et d’audio
Vous pouvez travailler avec la reconnaissance vocale (speech-to-text), la synthèse vocale (text-to-speech) et d’autres modèles audio pris en charge. Cela permet de transcrire de l’audio, de générer de la parole et d’expérimenter divers workflows d’IA audio en local.
Data Recipes
Les Data Recipes aident à transformer des fichiers comme des PDF et des CSV en jeux de données que vous pouvez inspecter, éditer et préparer pour l’entraînement. Particulièrement utile si vous disposez de vos propres données mais ne souhaitez pas construire le dataset manuellement.
Stockage et gestion des modèles
À mesure que vous téléchargez plus de modèles et commencez vos propres entraînements, la gestion peut vite devenir chaotique. Unsloth Desktop vous offre un emplacement central pour gérer les modèles téléchargés, jeux de données, adaptateurs, runs d’entraînement et autres ressources locales.
Exporter des modèles
Unsloth Studio prend officiellement en charge l’export de modèles Safetensors/LoRA vers GGUF et d’autres formats. llama.cpp est explicitement pris en charge pour l’exécution des modèles exportés.
API locale
Enfin, Unsloth Desktop peut exposer votre modèle local via une API compatible OpenAI. Cela facilite la connexion de vos modèles locaux à d’autres applications, outils de codage ou projets d’IA sans dépendre d’une API hébergée.
Conclusion
Unsloth Desktop évolue dans une direction très intéressante. Réunir LLM, fine-tuning, génération d’images et de vidéos, agents de codage, jeux de données et API locales dans une seule application de bureau simplifie grandement l’IA locale, surtout pour celles et ceux qui ne veulent pas configurer chaque outil manuellement.
Cela dit, l’ensemble reste encore un peu perfectible. Sur des GPU plus anciens ou avec des pilotes CUDA obsolètes, vous devrez peut-être résoudre des dépendances et installer certains composants manuellement sous Linux ou Windows. J’ai aussi rencontré des problèmes avec la génération d’images, les réglages de contexte et les agents de codage. Par exemple, si vous augmentez le contexte du modèle dans Unsloth Desktop, vous devrez peut-être aussi définir explicitement la même longueur de contexte lors du lancement de votre agent de codage. Certains workflows de génération de sites Web et de type Canvas ne se sont pas toujours comportés comme prévu.
Unsloth a ajouté un grand nombre de fonctionnalités très rapidement, mais tout n’est pas encore totalement stable. Je m’attends à ce que beaucoup de ces points s’améliorent à mesure que Desktop gagne en optimisation et en maturité.
Pour l’instant, si mon objectif principal est simplement de servir un LLM local pour un agent de codage IA ou une autre application, je préfère encore llama.cpp. Il me donne bien plus de contrôle sur le modèle, le contexte, l’offloading GPU, l’usage mémoire et d’autres paramètres bas niveau. Unsloth Desktop est bien plus simple à utiliser, tandis que llama.cpp reste l’option de choix lorsque je veux affiner la configuration et tirer le maximum de performance de mon matériel.
En tant que data scientist certifié, je suis passionné par l'utilisation des technologies de pointe pour créer des applications innovantes d'apprentissage automatique. Avec une solide expérience en reconnaissance vocale, en analyse de données et en reporting, en MLOps, en IA conversationnelle et en NLP, j'ai affiné mes compétences dans le développement de systèmes intelligents qui peuvent avoir un impact réel. En plus de mon expertise technique, je suis également un communicateur compétent, doué pour distiller des concepts complexes dans un langage clair et concis. En conséquence, je suis devenu un blogueur recherché dans le domaine de la science des données, partageant mes idées et mes expériences avec une communauté grandissante de professionnels des données. Actuellement, je me concentre sur la création et l'édition de contenu, en travaillant avec de grands modèles linguistiques pour développer un contenu puissant et attrayant qui peut aider les entreprises et les particuliers à tirer le meilleur parti de leurs données.


