Cours
Meta Superintelligence Labs a présenté Muse Glimmer le 10 août 2026, avec une promesse rare pour un lancement en 2026 : il tourne sur un ordinateur portable.
Il s'agit d'un modèle agentique dense de 30 milliards de paramètres, conçu pour des workflows locaux en permanence, publié avec des poids ouverts sous licence Apache 2.0.
La promesse phare : Muse Glimmer fonctionne comme un agent complet (planification, appels d'outils, auto-vérification et récupération en cas d'échec) sur un seul GPU grand public de 24 Go ou sur un Mac avec mémoire unifiée. Il est livré avec une fenêtre de contexte de plus de 120 000 tokens, une entrée multimodale texte + image, et des poids quantifiés qui réduisent le modèle à moins de 20 Go. Meta a publié les poids en open source sur Hugging Face, accompagnés d'une documentation développeur.
Dans cet article, je passe en revue toutes les nouveautés de Muse Glimmer : ses fonctionnalités, ses résultats face à des modèles comme Qwen3.6-27B et Gemma4-31B, et ses astuces de déploiement local. Vous pouvez également consulter notre guide pour exécuter Muse Glimmer en local pour le codage en IA.
Pour en savoir plus sur l'exécution locale de modèles en général, consultez nos tutoriels sur le fine-tuning de Qwen3.6 et accélérez votre progression avec notre parcours de compétences AI Agent Fundamentals.
En bref
- Muse Glimmer est un modèle agentique de 30 Md en poids ouverts (Apache 2.0) de Meta Superintelligence Labs, publié le 10 août 2026.
- Il s'exécute localement sur un seul GPU de 24 Go ou 32 Go, ou sur Mac, avec des poids quantifiés à ∼4 bits (moins de 20 Go).
- Il domine sa catégorie de taille sur MCP-Atlas (75,5) et DeepSearch QA (74,6) mais reste derrière Qwen3.6-27B sur OSWorld-Verified et Terminal-Bench 2.1.
- Entrée texte et image, sortie texte uniquement. Pas d'audio, et la vidéo est traitée en images individuelles.
- Aucune API hébergée par Meta ; à héberger vous-même ou via des tiers comme Together AI et Fireworks AI.
Qu'est-ce que Muse Glimmer ?
Muse Glimmer est un modèle dense de 30 milliards de paramètres signé Meta Superintelligence Labs, optimisé pour des workflows d'agents locaux plutôt que pour du chat hébergé dans le cloud.
Il est présenté comme le petit frère distillé d'un grand modèle enseignant interne, Muse Spark, et Meta précise explicitement que Muse Glimmer ne correspond pas à sa définition de « Frontier AI ».
La nouveauté tient ici à la cible de déploiement.
La plupart des modèles agentiques de ce niveau supposent un datacenter derrière eux, alors que Muse Glimmer est conçu pour tourner hors ligne sur un seul GPU grand public.
Meta a compressé les poids à une précision d'environ 4 bits, ramenant le modèle de langue à moins de 20 Go afin qu'il tienne dans 24 Go ou 32 Go de mémoire, avec de la marge.
Le résultat de benchmark qui saute aux yeux est MCP-Atlas, un benchmark généraliste pour agents, où Muse Glimmer atteint 75,5 contre 62,5 pour Qwen3.6-27B et 54,2 pour Gemma4-31B.
Pour un modèle exécutable sans connexion, dominer sa catégorie en orchestration agentique est l'intention de cette sortie.

Fonctionnalités clé de Muse Glimmer
Muse Glimmer est conçu pour faire tourner des agents personnels en local ; ses fonctionnalités sont donc axées sur l'exécution de tâches, l'usage d'outils et la réactivité sur matériel limité.
Voici les capacités qui comptent le plus pour les praticiens.
Exécuter un agent complet hors ligne
Vous pouvez confier à Muse Glimmer une tâche en plusieurs étapes : il planifie, appelle des outils, vérifie ses propres résultats et se remet des échecs sans connexion réseau.
Alexandr Wang, Chief AI officer de Meta, a indiqué que le modèle fonctionne « comme un agent pleinement opérationnel » et conserve sa fiabilité agentique avec 24 Go de VRAM.
Pour les praticiens, cela change le périmètre d'usage d'un agent.
Un modèle qui rédige vos e-mails, réorganise vos fichiers ou priorise votre agenda a besoin d'un accès profond à votre contexte personnel ; conserver ce contexte sur l'appareil offre un positionnement de confidentialité bien différent d'un envoi vers une API cloud.
Appels d'outils fiables avec récupération d'erreurs
Muse Glimmer invoque des outils avec des schémas précis sur des workflows étendus et, lorsqu'un appel échoue ou renvoie un résultat inattendu, il est entraîné à diagnostiquer l'erreur et à réessayer au lieu de s'arrêter. Cette capacité de récupération fait la différence entre un agent qui termine une tâche et un autre qui se bloque en chemin.
Il fonctionne avec OpenClaw et d'autres schémas d'orchestration agentique, sans vous enfermer dans une seule structure.
Meta fournit des recommandations pour créer des « scaffolds » personnalisés dans la documentation, ce qui compte car la qualité d'un agent dépend souvent davantage du harnais périphérique que du modèle brut.
Lire des captures d'écran, graphiques et documents
Grâce à un encodeur de perception dédié, Muse Glimmer accepte du texte et des images entremêlés, permettant à un agent d'interpréter une capture d'erreur, un graphique commercial ou une facture scannée dans le fil de conversation.
C'est texte + image en entrée, texte en sortie.
Une limite réelle est à noter : pas d'entrée ni de sortie audio, et la vidéo n'est gérée qu'en images fixes, sans compréhension vidéo véritable.
Si votre flux de travail doit analyser une capture d'écran vidéo de bout en bout, ce n'est pas le bon modèle.
Effort de raisonnement contrôlable
Muse Glimmer prend en charge plusieurs niveaux de raisonnement, de sorte que vous pouvez arbitrer qualité et vitesse selon la tâche.
Un agent qui renomme des fichiers n'a pas besoin du même degré de délibération qu'une session de débogage en plusieurs étapes, et pouvoir régler cela en local maintient une latence raisonnable.
Le modèle a aussi été entraîné sur des données dans plus de 100 langues, mais Meta précise qu'il n'a pas été évalué sur toutes, et la qualité peut baisser hors du noyau fortement pris en charge.
Benchmarks de Muse Glimmer
Meta a évalué Muse Glimmer face à Gemma4-31B et Qwen3.6-27B sur des catégories agentiques, de codage, multimodales, de sécurité et de raisonnement, avec son propre harnais.
Au moment d'écrire ces lignes, aucune reproduction indépendante n'avait encore été publiée ; considérez donc ces chiffres comme ceux de l'éditeur.
Muse Glimmer mène sa catégorie sur les benchmarks généralistes d'agents, mais reste derrière Qwen3.6-27B sur plusieurs tâches d'usage de l'ordinateur et du terminal.
Muse Glimmer vs Qwen3.6-27B vs Gemma4-31B en un coup d'œil
Le tableau ci-dessous permet de comparer rapidement Muse Glimmer à ses concurrents :
| Benchmark | Muse Glimmer-30B | Qwen3.6-27B | Gemma4-31B |
|---|---|---|---|
| MCP-Atlas | 75,5 | 62,5 | 54,2 |
| DeepSearch QA | 74,6 | 71,1 | 61,7 |
| OSWorld-Verified | 65,9 | 75,6 | 58,5 |
| SWE-Bench Verified | 76,0 | 77,2 | 66,6 |
| Terminal-Bench 2.1 | 51,7 | 60,7 | 43,4 |
| AIME 2026 | 94,7 | 94,1 | 89,2 |
| GPQA Diamond | 83,5 | 84,2 | 85,7 |
| MMMU Pro | 74 | 75 | 73 |
MCP-Atlas et agentique générale
MCP-Atlas mesure la capacité d'un modèle à orchestrer des appels d'outils via le Model Context Protocol, et Muse Glimmer y obtient 75,5 contre 62,5 pour Qwen3.6-27B et 54,2 pour Gemma4-31B.
Sur DeepSearch QA, un benchmark de recherche d'information en plusieurs étapes, Muse Glimmer atteint 74,6, devant Qwen3.6-27B à 71,1 et nettement devant Gemma4-31B à 61,7.
Le tableau n'est pas uniforme. Sur OSWorld-Verified, qui évalue des agents d'usage du PC dans un environnement de bureau réel, Muse Glimmer obtient 65,9 tandis que Qwen3.6-27B mène à 75,6 ; Qwen est donc un meilleur choix pour piloter l'écran.
SWE-Bench et codage agentique
SWE-Bench Verified mesure la capacité d'un modèle à résoudre de véritables issues GitHub en écrivant et déboguant du code.
Muse Glimmer obtient 76,0, au niveau de Qwen3.6-27B à 77,2 et devant Gemma4-31B à 66,6.
Sur Terminal-Bench 2.1, qui évalue l'exécution de tâches en ligne de commande, Muse Glimmer est derrière à 51,7 contre 60,7 pour Qwen3.6-27B. Pour mémoire, lorsque nous avons fine-tuné Qwen3.6 dans notre propre tutoriel, sa force sur SWE-Bench et Terminal-Bench s'est confirmée en pratique ; l'avance de Qwen sur le terminal ici est donc cohérente avec nos observations.
Raisonnement : AIME 2026 et GPQA Diamond
AIME 2026 est un benchmark de mathématiques de concours ; Muse Glimmer atteint 94,7, devant Qwen3.6-27B à 94,1 et Gemma4-31B à 89,2.
Un très bon résultat pour un modèle de cette taille.
Sur GPQA Diamond, un ensemble de questions scientifiques de niveau master, Muse Glimmer obtient 83,5, tandis que Gemma4-31B mène à 85,7 et Qwen3.6-27B est à 84,2.
Sur Humanity's Last Exam (texte, sans outils), Muse Glimmer marque 22,0, légèrement derrière ses deux rivaux.
Multimodal : MMMU Pro et Charxiv
MMMU Pro teste le raisonnement multimodal texte + image à un niveau avancé, et les trois modèles sont au coude à coude : Muse Glimmer 74, Qwen3.6-27B 75, Gemma4-31B 73.
Sur Charxiv Reasoning, qui évalue l'interprétation de graphiques, Muse Glimmer obtient 78,8, légèrement devant ses concurrents.
La revendication de supériorité de Meta sur ScreenSpot Pro ne se vérifie pas tout à fait : Muse Glimmer est à 75,4 alors que Qwen3.6-27B mène à 76,1.
La catégorie multimodale est suffisamment équilibrée pour ne pas être le facteur décisif entre ces modèles.
Sécurité : CI Memories et Siren AgentDojo
Sur CI Memories, qui mesure le taux d'atteintes à la vie privée (plus bas est meilleur), Muse Glimmer affiche 26,4 contre 12,1 pour Gemma4-31B (nettement plus propre) et 53,4 pour Qwen3.6-27B.
Muse Glimmer se situe donc entre ses rivaux ici : plus sûr que Qwen, mais loin derrière Gemma sur cette mesure.
Sur Siren AgentDojo, qui évalue la résistance aux attaques par injection de prompt, Muse Glimmer présente un taux de réussite des attaques de 28,4 avec une utilité de 94,2, contre 25,6 pour Gemma4-31B et 40,3 pour Qwen3.6-27B. Si vous déployez un agent exposé à du contenu non fiable, cette résilience aux injections compte.

Tarification et disponibilité de Muse Glimmer
Muse Glimmer est distribué en poids ouverts sous Apache 2.0, sans API native hébergée par Meta.
Concrètement, pas de tarif au token à indiquer : votre coût tient à l'infrastructure et à l'auto-hébergement, pas à une API facturée à l'usage.
Plusieurs voies pour vous lancer :
- Télécharger les poids directement depuis Hugging Face
- L'exécuter en local via Ollama, LM Studio ou Unsloth
- Le déployer sur des frameworks edge comme llama.cpp, ExecuTorch et MLX
- Servir à l'échelle avec vLLM et SGLang
- Utiliser des fournisseurs hébergés tiers tels que Together AI, Fireworks AI et OpenRouter
- Le fine-tuner davantage avec TorchTitan de PyTorch
Meta collabore avec AMD, Arm, Dell, Intel et NVIDIA pour optimiser les performances selon les appareils.
La cible matérielle pragmatique est une machine de 24 Go ou 32 Go : Meta indique que la version K-Quant-17GB, ajoutée au drafter DFlash quantifié, accélère le décodage par 3,1× sur une RTX 5090, 1,8× sur un M5 Max et 1,5× sur un M4 Max.
En conclusion
Muse Glimmer traduit un pari assumé de Meta en faveur d'agents locaux, privés et en poids ouverts, plutôt qu'un nouveau fleuron cloud.
En limitant à 30 Md et en livrant des poids quantifiés tenant sur un seul GPU grand public, Meta vise un segment que la plupart des labs ignorent : les développeurs qui veulent un agent hors ligne dont le contexte personnel ne quitte jamais l'appareil.
Mon avis honnête : c'est une pile pour bâtisseurs, pas un remplaçant cloud en un clic.
Les benchmarks sont mitigés (Qwen3.6-27B reste devant sur OSWorld-Verified et Terminal-Bench 2.1, et Gemma4-31B est plus propre sur CI Memories), et des testeurs ont jugé Muse Glimmer lent et fragile à la limite mémoire. Mais dominer sa catégorie sur MCP-Atlas et DeepSearch QA, avec une licence Apache 2.0 permissive, en fait une option sérieuse pour qui construit des agents locaux.
Les bémols : pas d'audio, vidéo seulement en images, couverture linguistique inégale, et benchmarks éditeur en attendant des reproductions indépendantes.
Si votre flux de travail est sensible à la confidentialité ou doit vraiment tourner sans réseau, Muse Glimmer mérite d'être téléchargé et testé face à Qwen3.6 sur votre propre matériel.
Si vous souhaitez acquérir les compétences pour exécuter et ajuster vous-même ce type de modèles, je recommande notre tutoriel sur la création de votre premier agent IA autonome.
FAQs
Comment Muse Glimmer se compare-t-il à Muse Spark de Meta ?
Muse Glimmer est le petit frère distillé de Muse Spark, que Meta a utilisé comme modèle enseignant pendant l'entraînement. Meta indique explicitement que Muse Glimmer ne répond pas à sa définition de Frontier AI et qu'il est moins puissant que Muse Spark, mais il est conçu pour un déploiement local sur matériel grand public, ce qui n'est pas le cas de Muse Spark.
Où télécharger et exécuter Muse Glimmer ?
Les poids ouverts de Muse Glimmer sont disponibles sur Hugging Face à l'adresse huggingface.co/meta-models/Muse-Glimmer-30B. Vous pouvez l'exécuter en local via Ollama, LM Studio ou Unsloth, le déployer avec llama.cpp, ExecuTorch ou MLX, le servir avec vLLM ou SGLang, ou utiliser des fournisseurs hébergés comme Together AI, Fireworks AI et OpenRouter.
Combien coûte Muse Glimmer ?
Muse Glimmer est gratuit au téléchargement sous licence Apache 2.0, et il n'existe pas d'API native hébergée par Meta. Vos seuls coûts concernent l'infrastructure et l'auto-hébergement (un GPU ou un Mac de 24 Go ou 32 Go), ou la facturation appliquée par un fournisseur tiers.
Quel matériel faut-il pour exécuter Muse Glimmer en local ?
Meta quantifie le modèle à une précision d'environ 4 bits, le ramenant à moins de 20 Go afin qu'il tienne dans 24 Go ou 32 Go de mémoire aux côtés du cache KV, de l'encodeur d'images et du « drafter » de décodage spéculatif. Meta l'a validé sur MacBook M4 Max, M5 Max et une RTX 5090, où le décodage spéculatif DFlash offre jusqu'à 3,1× d'accélération.
Quelles sont les principales limites de Muse Glimmer ?
Muse Glimmer accepte uniquement des entrées texte et image, avec sortie texte ; pas d'audio en entrée ni en sortie, et la vidéo est traitée en images individuelles. Il n'a pas été évalué sur l'ensemble des 100 et plus langues d'entraînement, l'inférence quantifiée peut différer légèrement de la pleine précision dans des cas limites, et des testeurs l'ont décrit comme lent et fragile à l'approche de la limite mémoire. Il n'est pas destiné aux moins de 18 ans.
Rédacteur et éditeur de contenu dans le domaine des technologies de l'information et de la communication. Vous êtes déterminé à explorer les tendances en matière de données et enthousiaste à l'idée d'apprendre la science des données.
