Weiter zum Inhalt

Muse Glimmer: Metas offenes agentisches Modell für dein Gerät

Meta Superintelligence Labs hat Muse Glimmer veröffentlicht, ein agentisches 30B-Open-Weight-Modell, das lokal auf einer einzelnen 24-GB-Consumer-GPU läuft. Hier erfährst du, was es kann und wie es funktioniert.
Aktualisiert 23. Sept. 2026  · 10 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Meta Superintelligence Labs hat Muse Glimmer am 10. August 2026 veröffentlicht – und die Botschaft ist für einen Launch im Jahr 2026 ungewöhnlich: Es läuft auf dem Laptop.

Es handelt sich um ein agentisches Modell mit 30 Milliarden Parametern für lokale, ständig aktive Workflows, ausgeliefert mit offenen Gewichten unter der Apache-2.0-Lizenz.

Die zentrale Aussage: Muse Glimmer arbeitet als vollwertiger Agent (Planung, Tool-Aufrufe, Selbstprüfung und Fehlerbehebung) auf einer einzelnen 24-GB-Consumer-GPU oder einem Mac mit einheitlichem Speicher. Es kommt mit über 120K Kontextfenster, multimodaler Eingabe aus Text und Bild sowie quantisierten Gewichten, die das Modell auf unter 20 GB schrumpfen. Meta hat die Gewichte auf Hugging Face mit Entwicklerdokumentation open-source bereitgestellt.

In diesem Artikel stelle ich alles Neue an Muse Glimmer vor: Features, Benchmarks im Vergleich zu Modellen wie Qwen3.6-27B und Gemma4-31B sowie die Tricks für die lokale Bereitstellung. Eine separate Anleitung zum lokalen Einsatz von Muse Glimmer fürs KI-Coding findest du hier. 

Wenn du generell mehr zum lokalen Betrieb von Modellen lernen willst, schau dir unsere Tutorials zum Feintuning von Qwen3.6 an und bring dich mit unserem Lernpfad AI Agent Fundamentals auf den neuesten Stand.

Auf einen Blick

  • Muse Glimmer ist ein 30B-Open-Weight-Modell (Apache 2.0) von Meta Superintelligence Labs, veröffentlicht am 10. August 2026.
  • Es läuft lokal auf einer einzelnen 24-GB- oder 32-GB-GPU oder einem Mac, mit auf ~4 Bit quantisierten Gewichten (unter 20 GB).
  • Es führt seine Größenklasse auf MCP-Atlas (75,5) und DeepSearch QA (74,6) an, liegt aber bei OSWorld-Verified und Terminal-Bench 2.1 hinter Qwen3.6-27B.
  • Text und Bild rein, nur Text raus. Kein Audio, und Video wird als Einzelbilder verarbeitet.
  • Es gibt keine von Meta gehostete API; du hostest selbst oder nutzt Drittanbieter wie Together AI und Fireworks AI.

Was ist Muse Glimmer?

Muse Glimmer ist ein dichtes 30-Milliarden-Parameter-Modell von Meta Superintelligence Labs, optimiert für lokale Agent-Workflows statt cloudbasierten Chat.

Es ist als kleiner, destillierter Ableger eines größeren internen Lehrermodells positioniert, Muse Spark, und Meta stellt ausdrücklich klar, dass Muse Glimmer nicht der eigenen Definition von \"Frontier AI\" entspricht.

Das Neue ist hier das Ziel der Bereitstellung.

Die meisten agentischen Modelle dieser Leistungsstufe setzen ein Rechenzentrum im Hintergrund voraus, doch Muse Glimmer ist dafür gebaut, offline auf einer einzelnen Consumer-GPU zu laufen.

Meta hat die Gewichte auf etwa 4-Bit-Präzision komprimiert und das Sprachmodell auf unter 20 GB gebracht, sodass es in 24 oder 32 GB Speicher mit Puffer passt.

Der auffälligste Benchmark ist MCP-Atlas, ein allgemeiner agentischer Benchmark, bei dem Muse Glimmer 75,5 erzielt – gegenüber 62,5 bei Qwen3.6-27B und 54,2 bei Gemma4-31B.

Für ein Modell, das du ohne Internetverbindung betreiben kannst, ist die Führungsrolle bei agentischer Orchestrierung der Kern des Releases.

\"muse-glimmer-specs\"

Die wichtigsten Features von Muse Glimmer

Muse Glimmer ist darauf ausgelegt, persönliche Agenten lokal auszuführen – mit Fokus auf Aufgabenabschluss, Tool-Nutzung und Reaktionsfähigkeit auf begrenzter Hardware.

Das sind die Fähigkeiten, die für Praktiker am meisten zählen.

Einen vollwertigen Agenten offline betreiben

Du kannst Muse Glimmer auf eine mehrstufige Aufgabe ansetzen und es planen, Tools aufrufen, eigene Ergebnisse prüfen und sich von Fehlern erholen lassen – alles ohne Netzwerkverbindung.

Alexandr Wang, Chief AI Officer von Meta, sagte, das Modell arbeite \"als vollwertiger Agent\" und behalte seine agentische Zuverlässigkeit auf 24 GB VRAM.

Für Praktiker ändert das den Einsatzort eines Agenten.

Ein Modell, das deine E-Mails entwirft, Dateien neu organisiert oder deinen Kalender vorsortiert, braucht tiefen Zugriff auf persönlichen Kontext – und diesen Kontext auf dem Gerät zu behalten ist eine andere Datenschutzhaltung, als ihn an eine Cloud-API zu schicken.

Zuverlässige Tool-Aufrufe mit Fehlerbehebung

Muse Glimmer ruft Tools mit präzisen Schemata über längere Workflows hinweg auf. Wenn ein Aufruf fehlschlägt oder Unerwartetes zurückkommt, ist es darauf trainiert, den Fehler zu diagnostizieren und einen erneuten Versuch zu starten, statt stehenzubleiben. Dieses Fehlermanagement macht den Unterschied zwischen einem Agenten, der eine Aufgabe beendet, und einem, der auf halber Strecke steckenbleibt.

Es funktioniert mit OpenClaw und anderen agentischen Orchestrierungsmustern, sodass du nicht an ein einziges Gerüst gebunden bist.

Meta liefert in der Doku Hinweise zum Einrichten eigener Gerüste – wichtig, denn die Agentenqualität hängt oft stärker vom umgebenden Harness ab als vom Rohmodell.

Screenshots, Charts und Dokumente lesen

Über einen speziellen Wahrnehmungs-Encoder akzeptiert Muse Glimmer verschachtelte Texte und Bilder. So kann ein Agent einen Screenshot eines Fehlers, ein Sales-Chart oder eine gescannte Rechnung im Kontext der Unterhaltung interpretieren.

Das ist Text und Bild rein, nur Text raus.

Ein echter Haken: Es gibt keine Audio-Ein- oder -Ausgabe, und Video wird nur als einzelne Frames statt als echtes Videoverständnis verarbeitet.

Wenn dein Workflow eine komplette Bildschirmaufnahme durchgehen muss, ist dies nicht das richtige Modell.

Steuerbarer Denkaufwand

Muse Glimmer unterstützt verschiedene Reasoning-Stufen, sodass du je nach Aufgabe Qualität gegen Geschwindigkeit tauschen kannst.

Ein schneller Umbenenn-Agent für Dateien braucht nicht dieselbe Gründlichkeit wie eine mehrstufige Debugging-Sitzung – und das lokal feinzujustieren hält die Latenz niedrig.

Das Modell wurde zudem auf Daten aus über 100 Sprachen trainiert. Meta weist jedoch darauf hin, dass es nicht für alle evaluiert wurde und die Qualität außerhalb des stark unterstützten Sets sinken kann.

Benchmarks zu Muse Glimmer

Meta hat Muse Glimmer mit Gemma4-31B und Qwen3.6-27B in den Kategorien Agentik, Coding, Multimodalität, Sicherheit und Reasoning verglichen – mit einem eigenen Harness.

Unabhängige Reproduktionen lagen zum Zeitpunkt des Schreibens noch nicht vor, behandle diese Zahlen also als Vendor-Werte.

Muse Glimmer führt seine Größenklasse bei allgemeinen agentischen Benchmarks an, liegt aber bei mehreren Aufgaben zur Computerbedienung und im Terminal hinter Qwen3.6-27B.

Muse Glimmer vs. Qwen3.6-27B vs. Gemma4-31B im Überblick

In der Tabelle unten siehst du schnell, wie Muse Glimmer im Vergleich abschneidet: 

Benchmark Muse Glimmer-30B Qwen3.6-27B Gemma4-31B
MCP-Atlas 75.5 62.5 54.2
DeepSearch QA 74.6 71.1 61.7
OSWorld-Verified 65.9 75.6 58.5
SWE-Bench Verified 76.0 77.2 66.6
Terminal-Bench 2.1 51.7 60.7 43.4
AIME 2026 94.7 94.1 89.2
GPQA Diamond 83.5 84.2 85.7
MMMU Pro 74 75 73

MCP-Atlas und allgemeine Agentik

MCP-Atlas misst, wie gut ein Modell Tool-Aufrufe über das Model Context Protocol orchestriert. Muse Glimmer erzielt 75,5 gegenüber 62,5 bei Qwen3.6-27B und 54,2 bei Gemma4-31B.

Bei DeepSearch QA, einem Benchmark für mehrstufige Informationssuche, liegt Muse Glimmer bei 74,6 – knapp vor Qwen3.6-27B mit 71,1 und deutlich vor Gemma4-31B mit 61,7.

Das Bild ist nicht einheitlich. Bei OSWorld-Verified, das Computer-Nutzungsagenten in einer echten Desktop-Umgebung testet, erreicht Muse Glimmer 65,9, während Qwen3.6-27B mit 75,6 führt. Für Screen-Driving-Agenten ist Qwen also die stärkere Wahl.

SWE-Bench und agentisches Coding

SWE-Bench Verified misst, ob ein Modell reale GitHub-Issues durch Schreiben und Debuggen von Code lösen kann.

Muse Glimmer kommt auf 76,0 – nah an Qwen3.6-27B mit 77,2 und vor Gemma4-31B mit 66,6.

Bei Terminal-Bench 2.1, das die Erledigung von Kommandozeilenaufgaben prüft, liegt Muse Glimmer mit 51,7 hinter Qwen3.6-27B mit 60,7. Zur Einordnung: In unserem eigenen Feintuning-Tutorial zu Qwen3.6 zeigte sich dessen Stärke bei SWE-Bench und Terminal-Bench auch in der Praxis – Qwens Vorteil im Terminal spiegelt unsere Erfahrungen.

Reasoning: AIME 2026 und GPQA Diamond

AIME 2026 ist ein Benchmark für Wettbewerbs-Mathematik. Muse Glimmer erzielt 94,7, knapp vor Qwen3.6-27B mit 94,1 und deutlich vor Gemma4-31B mit 89,2.

Das ist ein starkes Ergebnis für ein so kleines Modell.

Bei GPQA Diamond, einem Set von Fragen auf Master-Niveau in den Naturwissenschaften, kommt Muse Glimmer auf 83,5, während Gemma4-31B mit 85,7 führt und Qwen3.6-27B bei 84,2 liegt.

Bei Humanity's Last Exam (Text, ohne Tools) erreicht Muse Glimmer 22,0 und liegt damit knapp hinter beiden Rivalen.

Multimodal: MMMU Pro und Charxiv

MMMU Pro prüft multimodales Reasoning über Bilder und Text auf Master-Niveau – die drei Modelle liegen eng beisammen: Muse Glimmer 74, Qwen3.6-27B 75, Gemma4-31B 73.

Bei Charxiv Reasoning, das die Interpretation von Charts testet, erzielt Muse Glimmer 78,8 und liegt damit minimal vor beiden Rivalen.

Metas eigener Stärke-Claim bei ScreenSpot Pro hält nicht ganz: Muse Glimmer kommt auf 75,4, während Qwen3.6-27B mit 76,1 führt.

Die Multimodal-Kategorie ist so knapp, dass sie nicht der entscheidende Faktor zwischen diesen Modellen sein wird.

Sicherheit: CI Memories und Siren AgentDojo

Bei CI Memories, das die Rate an Datenschutzverletzungen misst (je niedriger, desto besser), verzeichnet Muse Glimmer 26,4 – gegenüber sehr sauberen 12,1 bei Gemma4-31B und 53,4 bei Qwen3.6-27B.

Damit liegt Muse Glimmer zwischen seinen Rivalen, sicherer als Qwen, aber deutlich hinter Gemma bei dieser Metrik.

Bei Siren AgentDojo, das die Resistenz gegen Prompt-Injection-Angriffe misst, zeigt Muse Glimmer eine Angriffs-Erfolgsrate von 28,4 bei 94,2 Utility – im Vergleich zu 25,6 bei Gemma4-31B und 40,3 bei Qwen3.6-27B. Wenn dein Agent mit untrusted Content arbeitet, solltest du diese Injection-Resistenz mit einbeziehen.

\"muse-glimmer-benchmarks\"

Preise und Verfügbarkeit

Muse Glimmer wird als offene Gewichte unter Apache 2.0 verteilt, und es gibt keine von Meta gehostete First-Party-API.

Das heißt: Es gibt keine Token-Preise von Meta zu berichten – deine Kosten sind Infrastruktur und Self-Hosting, nicht eine getaktete API-Gebühr.

Du kannst über mehrere Wege starten:

  • Lade die Gewichte direkt von Hugging Face herunter
  • Führe es lokal mit Ollama, LM Studio oder Unsloth aus
  • Stelle es auf Edge-Frameworks wie llama.cpp, ExecuTorch und MLX bereit
  • Betreibe es im Scale-Betrieb mit vLLM und SGLang
  • Nutze gehostete Drittanbieter wie Together AI, Fireworks AI und OpenRouter
  • Feinjustiere es weiter mit TorchTitan von PyTorch

Meta arbeitet mit AMD, Arm, Dell, Intel und NVIDIA zusammen, um die Performance über Geräte hinweg zu optimieren.

Das praxisnahe Hardwareziel sind 24 GB oder 32 GB: Meta berichtet, dass der K-Quant-17GB-Build plus der quantisierte DFlash-Drafter das Decoding auf einer RTX 5090 um das 3,1-Fache, auf einem M5 Max um das 1,8-Fache und auf einem M4 Max um das 1,5-Fache beschleunigt.

Fazit

Muse Glimmer ist Metas bewusste Wette auf lokale, private, offene Agenten statt eines weiteren Cloud-Flaggschiffs.

Mit der Deckelung bei 30B und der Auslieferung quantisierter Gewichte, die auf eine einzelne Consumer-GPU passen, zielt Meta auf eine Nische, die die meisten Labs ignorieren: Entwickler, die einen Agenten offline mit persönlichem Kontext betreiben wollen, der das Gerät nie verlässt.

Mein ehrliches Fazit: Das ist ein Stack für Builder, kein 1-Klick-Cloud-Ersatz.

Die Benchmark-Bilanz ist gemischt (Qwen3.6-27B führt weiterhin bei OSWorld-Verified und Terminal-Bench 2.1, und Gemma4-31B ist bei CI Memories sauberer). Zudem beschrieben Reviewer Muse Glimmer als langsam und empfindlich nahe der Speicherauslastung. Aber die Führungsrolle in seiner Größenklasse bei MCP-Atlas und DeepSearch QA – zusammen mit der liberalen Apache-2.0-Lizenz – macht es zu einer ernsthaften Option für alle, die lokale Agenten bauen.

Zu den Einschränkungen zählen: kein Audio, Video nur als Frames, uneinheitliche Sprachabdeckung und bislang nur Vendor-Benchmarks, bis unabhängige Reproduktionen vorliegen.

Wenn dein Workflow besonders sensibel für Datenschutz ist oder wirklich ohne Netzwerk laufen muss, lohnt es sich, Muse Glimmer herunterzuladen und auf deiner eigenen Hardware gegen Qwen3.6 zu testen.

Wenn du die Kompetenzen aufbauen willst, um solche Modelle selbst zu betreiben und zu tunen, empfehle ich unser Tutorial zum Bau deines ersten autonomen KI-Agenten. 

FAQs

Wie schneidet Muse Glimmer im Vergleich zu Metas Muse Spark ab?

Muse Glimmer ist der kleinere, destillierte Ableger von Muse Spark, das Meta als Lehrermodell im Training eingesetzt hat. Meta sagt ausdrücklich, dass Muse Glimmer nicht der Frontier-AI-Definition entspricht und schwächer als Muse Spark ist, aber für die lokale Bereitstellung auf Consumer-Hardware gebaut wurde – im Gegensatz zu Muse Spark.

Wo kann ich Muse Glimmer herunterladen und ausführen?

Die offenen Gewichte von Muse Glimmer findest du auf Hugging Face unter huggingface.co/meta-models/Muse-Glimmer-30B. Du kannst es lokal mit Ollama, LM Studio oder Unsloth ausführen, mit llama.cpp, ExecuTorch oder MLX deployen, mit vLLM oder SGLang serven oder gehostete Provider wie Together AI, Fireworks AI und OpenRouter nutzen.

Was kostet Muse Glimmer?

Muse Glimmer ist unter der Apache-2.0-Lizenz kostenlos herunterladbar, und es gibt keine von Meta gehostete First-Party-API. Deine einzigen Kosten sind Infrastruktur und Self-Hosting (eine 24-GB- oder 32-GB-GPU oder ein Mac) oder das, was ein Drittanbieter fürs Hosten berechnet.

Welche Hardware brauche ich, um Muse Glimmer lokal zu betreiben?

Meta quantisiert das Modell auf ungefähr 4-Bit-Präzision und schrumpft es so auf unter 20 GB, damit es zusammen mit KV-Cache, Bildencoder und spekulativem Decoding-Drafter in 24 oder 32 GB Speicher passt. Validiert wurde es auf MacBook M4 Max, M5 Max und einer RTX 5090, wo DFlash Speculative Decoding bis zu 3,1x schnelleres Decoding bringt.

Was sind die wichtigsten Einschränkungen von Muse Glimmer?

Muse Glimmer akzeptiert nur Text- und Bildeingaben, mit Textausgabe – es gibt also kein Audio in oder out, und Video wird als Einzelbilder verarbeitet. Es wurde nicht für alle über 100 Trainingssprachen evaluiert, quantisierte Inferenz kann sich in Randfällen leicht von voller Präzision unterscheiden, und Reviewer beschrieben es nahe der Speichergrenze als langsam und fragil. Es ist nicht für Nutzer unter 18 Jahren gedacht.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Autorin und Redakteurin im Bereich der Bildungstechnologie. Engagiert bei der Erforschung von Datentrends und begeistert davon, Data Science zu lernen.

Themen
Künstliche Intelligenz
Große Sprachmodelle

Top-DataCamp-Kurse

Kurs

KI-Agenten mit dem Google ADK entwickeln

1 Std.
7.5K
In diesem einstündigen Kurs erstellst du Schritt für Schritt einen Support-Assistenten mit dem Agent Development Kit (ADK) von Google.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow
Verwandt

Blog

Arten von KI-Agenten: Ihre Rollen, Strukturen und Anwendungen verstehen

Lerne die wichtigsten Arten von KI-Agenten kennen, wie sie mit ihrer Umgebung interagieren und wie sie in verschiedenen Branchen eingesetzt werden. Verstehe einfache reflexive, modellbasierte, zielbasierte, nutzenbasierte, lernende Agenten und mehr.

Blog

Die 36 wichtigsten Fragen und Antworten zum Thema generative KI für 2026

Dieser Blog hat eine ganze Reihe von Fragen und Antworten zu generativer KI, von den Grundlagen bis hin zu fortgeschrittenen Themen.
Hesam Sheikh Hassani's photo

Hesam Sheikh Hassani

15 Min.

Blog

Lehrer/innen und Schüler/innen erhalten das Premium DataCamp kostenlos für ihre gesamte akademische Laufbahn

Keine Hacks, keine Tricks. Schüler/innen und Lehrer/innen, lest weiter, um zu erfahren, wie ihr die Datenerziehung, die euch zusteht, kostenlos bekommen könnt.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

4 Min.

Blog

Top 50+ AWS-Interviewfragen und Antworten für 2026

Ein kompletter Guide mit grundlegenden, fortgeschrittenen und szenariobasierten AWS-Interviewfragen – mit Beispielen aus der Praxis.
Zoumana Keita 's photo

Zoumana Keita

15 Min.

Blog

Die 20 besten Snowflake-Interview-Fragen für alle Niveaus

Bist du gerade auf der Suche nach einem Job, der Snowflake nutzt? Bereite dich mit diesen 20 besten Snowflake-Interview-Fragen vor, damit du den Job bekommst!
Nisha Arya Ahmed's photo

Nisha Arya Ahmed

15 Min.

Tutorial

OLS-Regression: Die wichtigsten Ideen erklärt

Gewinne Vertrauen in die OLS-Regression, indem du ihre theoretischen Grundlagen beherrschst. Erforsche, wie du einfache Implementierungen in Excel, R und Python durchführst.
Josef Waples's photo

Josef Waples

8 Min.

Mehr AnzeigenMehr Anzeigen