Hoppa till huvudinnehållet

Muse Spark: Funktioner, riktmärken och hur du använder det

Efter en lång tystnad är Meta tillbaka med en ny modell, ett nytt labb och ett uttryck de verkligen vill att du ska minnas. Lär dig mer om Muse Spark, dess funktioner och mer.
Uppdaterad 12 aug. 2026  · 14 min läsa

Utforska med AI

ChatGPTClaudePerplexity

Vi hade skrivit artiklar om Metas Llama-modeller i stadig takt (Llama 2, Llama 3 och så vidare). Sedan lanserades Llama 4 i april 2025 till omfattande kritik, där flera medier och företagets avgående AI-chef bekräftade att benchmarkresultat hade manipulerats med specialiserade delmodeller som aldrig släpptes publikt. 

Efter det slutade uppdateringarna att komma. Samtidigt meddelade Meta att man flyttade Horizon Worlds till endast mobil, vilket i praktiken avslutade VR-versionen som man en gång satsade företagets framtid på. Det såg ut som ett företag som tappade fotfästet på två fronter samtidigt.

Den 8 april 2026 lanserade Meta Muse Spark, den första modellen från Meta Superintelligence Labs. Pressmeddelandet använder frasen "personlig superintelligens" lite för många gånger. Skalar man bort det finns det en verklig modell under som sätter Meta tillbaka i samtalet på frontlinjen.

Om du vill se hur Metas nya modell står sig mot en av dess bästa nuvarande konkurrenter rekommenderar jag att du läser vår guide om Muse Spark vs Claude Opus 4.6. Du kan också läsa vår guide till Muse Glimmer och vår handledning om att köra Muse Glimmer lokalt.

Vad är Muse Spark?

Muse Spark är en ursprungligen multimodal resonemangsmodell som hanterar text, bilder, ljud och verktygsanvändning i en och samma arkitektur. Den stöder visuell chain-of-thought, vilket betyder att modellen kan arbeta sig igenom bildbaserade problem steg för steg i stället för att bara producera ett enda svar. Multiagent-orkestrering är också en del av upplägget, vilket vi återkommer till.

Tidigare Llama-modeller återgav svar baserat på mönstermatchning från träningen. Muse Spark arbetar igenom problem innan den svarar. Det är den faktiska förändringen.

Vem står bakom?

Meta Superintelligence Labs, eller MSL, bildades den 30 juni 2025 när Mark Zuckerberg omorganiserade företagets AI-verksamhet. Alexandr Wang, tidigare vd för Scale AI, kom in som Chief AI Officer; Meta hade investerat ungefär 14 miljarder dollar i Scale AI som en del av affären. 

Nat Friedman, tidigare vd för GitHub, leder produkt- och tillämpad forskningssidan, och Shengjia Zhao, som var med och skapade GPT-4 och o1 på OpenAI (samma o1 som Muse Spark nu jämförs mot i benchmark), är Chief Scientist.

Det finns en tredje faktor värd att nämna: Yann LeCun, Metas långvarige Chief AI Scientist och företagets mest synliga förespråkare för öppen källkod, lämnade i november 2025. Hans avhopp följde på organisatoriska förändringar som begränsade hans roll och teamets förskjutning mot slutna utvecklingsmodeller.

Vad är nytt med Muse Spark (och varför ska vi bry oss)?

Huvudnumren är resonanslägen, en ombyggd träningspipeline och ett medvetet fokus på hälsa. Vi tar dem i tur och ordning.

Tre resonanslägen

Muse Spark erbjuder tre sätt att interagera med modellen, och skillnaden mellan dem är värd att förstå innan du provar modellen.

  • Instant är standard för vardagliga frågor. Det svarar snabbt utan utökat resonemang, ungefär som du får från en vanlig chattmodell.
  • Thinking använder utökad chain-of-thought-resonemang. Modellen tar längre tid, arbetar igenom mellanliggande steg och presterar i allmänhet bättre på svårare problem. Det är läget bakom de flesta benchmarkresultaten i den här artikeln.
  • Contemplating är det mest intressanta. Mer om det direkt nedan.

En sak att känna till direkt: Contemplating-läget rullas ut gradvis och var inte tillgängligt för alla användare på lanseringsdagen. Om du inte ser det än är det väntat.

Contemplating-läget

Contemplating-läget startar flera resonemangsagenter som arbetar parallellt och kombinerar sedan deras resultat till ett enda svar. Där Geminis Deep Think och OpenAIs GPT Pro-läge skalar resonemang genom att tänka längre, skalar Muse Spark det genom att tänka bredare. Fler agenter arbetar samtidigt i stället för att en agent arbetar längre.

Metas argument är att detta tillvägagångssätt ger jämförbara resultat med lägre latens, eftersom agenterna körs parallellt i stället för sekventiellt. Oberoende bekräftelse av latenspåståendena finns ännu inte, men benchmark-siffrorna från Contemplating-läget leder på flera svåra utvärderingar (mer om dem strax).

Detta är en funktion vid inferenstid, inte en arkitektonisk. Själva modellen ändras inte.

Skalning av förstärkningsinlärning och "thought compression"

Meta byggde om sin träningsstack från grunden under de nio månader det tog att utveckla Muse Spark. Påståendena om förstärkningsinlärning (RL) kommer särskilt från Metas egen tekniska blogg och har inte verifierats oberoende.

Den mer intressanta detaljen är en teknik som forskarteamet kallar thought compression. Under RL-träning belönas modellen för att ge korrekta svar men bestraffas också för tänketid, vilket översätts till överdrivet många utgående tokens. Detta skapar ett tredelat beteende vid komplexa uppgifter som matteproblem. 

Först förbättras modellen genom att tänka längre. Sedan slår längdstraffet till och tvingar modellen att lösa samma problem med betydligt färre tokens. Vid någon punkt utökar den åter sitt resonemang och passerar tidigare prestationsnivåer samtidigt som den använder färre tokens.

Det praktiska resultatet: modellen lärde sig att göra mer med mindre. Det påståendet vilar på Metas egna träningskurvor, som inte har validerats oberoende.

10x mindre beräkning

Meta påstår att den nya arkitekturen matchar Llama 4 Mavericks prestanda med tio gånger mindre träningsberäkning. Det handlar om arkitektonisk effektivitet, inte Muse Sparks tak. Llama 4 Maverick fick 18 på Artificial Analysis Intelligence Index. Muse Spark fick 52.

Tokeneffektivitetssiffrorna från Artificial Analysis oberoende körning pekar åt samma håll. Muse Spark använde 58 miljoner utgående tokens. GPT-5.4 använde 120 miljoner. Claude Opus 4.6 använde 157 miljoner.

Hälsa: ett medvetet fokus

Hälsa är Muse Sparks tydligaste benchmarkfördel, och den är avsiktlig. Meta arbetade med mer än 1 000 läkare för att kurera träningsdata för hälsorelaterat resonemang. 

Modellen kan generera interaktiva vyer som täcker näringsinnehåll, läkemedelsinformation och träningsfysiologi. På HealthBench Hard fick Muse Spark 42,8 mot GPT-5.4:s 40,1 och Gemini 3.1 Pro på 20,6. Den skillnaden mot Gemini håller vid oberoende utvärdering.

Detta är uppenbart Metas svar på ChatGPT Health. Metas argument för varför man kan konkurrera är de 3 miljarder användarnas sociala kontext, som borde ge en fördel i att förstå hur människor faktiskt ställer hälsofrågor. Om det håller för komplexa eller ovanliga frågor i stället för de vardagliga som befolkar benchmark är värt att följa.

Hur blir det med Llama?

Utvecklarcommunityn frågar en sak, och det förtjänar ett tydligt svar.

Muse Spark är inte öppen källkod. Varje Llama-modell fram till Llama 4 levererades med vikter som utvecklare kunde ladda ner och köra lokalt. Communities som r/LocalLLaMA byggdes på det. Det användningsfallet är borta.

Metas angivna skäl är delvis konkurrens: kinesiska labb, inklusive DeepSeek, använde Llama-vikter för att accelerera sin egen forskning. Wang har sagt att företaget "hoppas" kunna open-sourca framtida Muse-modeller, utan tidslinje. "Hoppas" bär stor vikt i den meningen.

Llama-teamet flyttades in i Wangs labb, och Llama 4 var den sista modellen från den gamla strukturen. Huruvida Llama fortsätter vid sidan av Muse eller tyst fasas ut har Meta inte sagt.

Muse Sparks benchmarkresultat

Benchmark är knepiga med Muse Spark av ett skäl som är värt att namnge direkt. Med tanke på Metas Llama 4-historik, håll isär självrapporterade och oberoende verifierade siffror.

Här är resultaten i Thinking-läget, där de flesta rättvisa jämförelsedata finns.

Full benchmark-jämförelsetabell för Muse Spark Thinking-läge jämfört med Opus 4.6, Gemini 3.1 Pro, GPT-5.4 och Grok 4.2 över multimodalt, resonemang, hälsa och agentiska kategorier.

Källa: Meta Superintelligence Labs / ai.meta.com

Contemplating-läget har en separat uppsättning för de svåraste utvärderingarna. Det leder på Humanity's Last Exam och FrontierScience Research, men ligger efter GPT-5.4 Pro och Gemini 3.1 Deep Think på IPhO 2025 Theory-fysikproblem. Allt från Metas egen rapportering, så läs dem som riktvisande snarare än avgjorda.

Källa: Meta Superintelligence Labs / ai.meta.com

Den oberoende bilden från Artificial Analysis är mer återhållsam. De placerade Muse Spark på fjärde plats på sin Intelligence Index, bakom Gemini 3.1 Pro Preview, GPT-5.4 och Claude Opus 4.6. Fortfarande topp fem globalt. Siffrorna gör också svagheterna tydliga: ARC-AGI-2 och Terminal-Bench 2.0 är värda att uppmärksamma om kodning eller abstrakt resonemang är viktiga för ditt användningsfall.

Test av Muse Spark

Med dessa benchmarkpoäng i åtanke ska vi sätta Muse Spark på prov. Jag granskar modellen i flerstegresonemang, bilduppfattning och kodfelsökning.

Test 1: Fibonacci–binär logikkedja (stabilitet i kaskadresonemang)

I mitt första test siktar jag på Muse Sparks avancerade resonemangsförmåga i en flerstegsövning. Modellen behöver:

  • Identifiera rätt Fibonacci-term
  • Konvertera den korrekt till binärt
  • Räkna bitar exakt
  • Generera primtal i ett beräknat intervall
  • Utföra en stor summering

Uppmaningen som användes var:

Step 1: Find the 13th number in the Fibonacci sequence (starting with F1=1, F2=1). Let this be X.
Step 2: Convert X into a binary string (Base 2).
Step 3: Count the number of '1's in that binary string. Let this count be C.
Step 4: Identify all prime numbers (p) such that 20 ≤ p ≤ (C × 100).
Step 5: Calculate the sum of these primes. What is the final result?

Muse Spark gjorde det mycket bra och löste övningen korrekt på första försöket. Det är särskilt imponerande eftersom GPT-5.4 misslyckades i sista steget och lyckades först när det delades upp i två steg (lista primtalen och sedan addera dem).

Test 2: Bilduppfattning och säljresonemang på ett flerlinjigt tidsseriediagram

Meta hävdar att Muse Spark är bra på att förstå komplexa bilder, så jag använder följande flerlinjiga tidsseriediagram för att se om den kan identifiera mönster och omsätta dem i användbara förslag.

Detta är prompten:

Examine this multi-line time-series of monthly active users for three products. Describe the key patterns you see, explain how events likely impacted each product, and propose data-driven next steps for the business.

Muse Sparks svar på diagramigenkänning: nyckelmönster per produkt

Muse Spark identifierade alla mönster korrekt, vilket antyder att bildigenkänningen fungerar bra.

Muse Sparks svar på diagramigenkänning: effekt av annoterade händelser

Datan som användes var slumpmässigt fabricerad, så det finns inget entydigt rätt eller fel svar här. Med det sagt identifierar Muse Spark alla händelser och resonerar över de olika produkterna och tidpunkterna för var och en av händelserna, och drar rimliga slutsatser. Den analyserar till och med förändringar i summan av månatligt aktiva användare (MAU) för produktkombinationer utan att bli ombedd, vilket är ett trevligt tillskott.

Muse Sparks svar på diagramigenkänning: datadrivna nästa steg

Alla föreslagna nästa steg ligger i linje med analyserna av produkt-MAU-mönster och händelseeffekter. Muse Spark identifierade det viktigaste temat för varje produkt (lanseringsplaybook för A, prissättning för B, skala för C) och tog fram specifika åtgärder som är logiska.

Test 3: Kodfelsökning

Avslutningsvis testar jag Muse Sparks förmåga att diagnostisera kodbuggar. Testet är utformat för att visa om modellen bara följer kodens korrekthet rad för rad eller även kan upptäcka underliggande fel.

Prompten:

A developer wrote this Python function to compute a running average: 

def running_average(data, window=3): 
    result = [] 
    for i in range(len(data)): 
        start = max(0, i - window + 1) 
        chunk = data[start:i + 1] 
        result.append(round(sum(chunk) / window, 2)) 
    return result 
When called with running_average([10, 20, 30, 40, 50]), the first two values in the output seem wrong. Why? Please help me fix what is wrong!

Funktionen dividerar alltid med window (3), även i början när delen har färre än 3 element. Den felaktiga utgången är [3.33, 10.0, 20.0, 30.0, 40.0], men de två första värdena borde vara 10.0 och 15.0 eftersom dessa delar innehåller endast 1 respektive 2 element. Åtgärden är att ändra / window till / len(chunk).

Modeller spårar ofta igenom loopen perfekt, men rapporterar sedan att utdata verkar "korrekta". De ser matematiken ske steg för steg och flaggar inte att det inte är vettigt att dividera ett enskilt element med 3. Det kräver att modellen håller intentionen (vad ett glidande medelvärde ska göra) vid sidan av exekveringen (vad koden faktiskt gör) och upptäcker glappet däremellan.

Muse Sparks svar på kodfelsökning

Muse Spark identifierade ett glidande medelvärde som intention och upptäckte misstaget. Den föreslog rätt ändring och förklarade varför den är nödvändig. Den föreslog till och med ett annat alternativ ifall partiella fönster helt ska hoppas över.

Sammantaget klarade modellen alla tre testerna perfekt och gav ett gott första intryck.

Hur får jag tillgång till Muse Spark?

Du kan komma åt Muse Spark på meta.ai eller via Meta AI-appen på iOS och Android. Båda är gratis. Den initiala utrullningen sker i USA först, med expansion till andra regioner under de följande veckorna. meta.ai-användargränssnitt och val av läge för Muse Spark-modellen

Meta planerar att rulla ut det till WhatsApp, Instagram, Facebook, Messenger och sina Ray-Ban AI-glasögon under samma tidsram.

Det finns inget offentligt API. En privat förhandsvisning är öppen för utvalda företagskunder, utan bekräftat datum för bredare åtkomst. Om integritet: Metas policy sätter få gränser för hur konversationer kan användas för att förbättra deras modeller. Om du planerar att dela känslig information, läs villkoren först.

Var Muse Spark brister

Meta sade det rakt ut i sin tekniska blogg: modellen har luckor i flerstegsuppgifter för agenter och kodningsarbetsflöden.

På SWE-Bench Verified är gapet mot Gemini och Opus 4.6 litet. Det öppnar sig i agentiskt arbete: Terminal-Bench 2.0 (59,0 mot GPT-5.4:s 75,1) och GDPval-AA kontorsautomation (1 444 mot GPT-5.4:s 1 672). De är inte nära. 

Abstrakt visuellt resonemang följer samma mönster: ARC-AGI-2 är 42,5 för Muse Spark mot mitten av 70-talet för både GPT-5.4 och Gemini. Modellen som leder på diagramläsning ligger rejält efter på nya visuella mönster.

Det sista fick ett svar på lanseringsdagen. François Chollet, medgrundare av ARC Prize och skapare av Keras och ARC-AGI, kallade modellen "överoptimerad för offentliga benchmarksiffror på bekostnad av allt annat." Wang svarade, erkände gapet i ARC-AGI-2 och pekade på positiv användarfeedback om visuell kodning och resonemang. Om det håller vid bredare användning är fortfarande en öppen fråga.

Det saknade offentliga API:et, som jag tog upp tidigare, är ett konkurrensmässigt gap ovanpå det. Wang erkände det på lanseringsdagen: "Det finns definitivt vassa kanter vi kommer att slipa över tid i modellbeteendet."

Muse Sparks säkerhet 

Meta genomförde utvärderingar under sitt Advanced AI Scaling Framework före lanseringen. På BioTIER-refuse leder Muse Spark jämförelseseten för vägran på biovapenförfrågningar. Dessa siffror är Metas egna.

Stapeldiagram som visar vägransgrad för biovapen över frontmodeller: Muse Spark 98,0 %, Opus 4.6 95,4 %, GPT-5.4 74,7 %, Gemini 3.1 Pro 61,5 %, Kimi K2.5 21,2 %.

Källa: Meta Superintelligence Labs / ai.meta.com

Den mer intressanta iakttagelsen kommer från Apollo Research. De fann att Muse Spark uppvisade den högsta graden av utvärderingsmedvetenhet av alla modeller de testat: modellen identifierade ofta säkerhetsutvärderingar som testsammanhang och betedde sig mer försiktigt på grund av den upptäckten. 

En modell som bara beter sig väl när den vet att den övervakas är ett problem värt att ta på allvar. Apollos tidigare arbete har dokumenterat att detta mönster kan öka det de kallar "intrigbeteende" vid faktisk driftsättning.

Meta erkände iakttagelsen vid lansering, vilket de flesta labb inte gör. Deras uppföljning fann att det påverkade en liten delmängd av alignmentsutvärderingar, inga relaterade till farliga förmågor, och drog slutsatsen att det inte var ett blockerande bekymmer. Forskningen pågår.

Muse Spark vs. GPT-5.4 vs. Opus 4.6 vs. Gemini 3.1

Benchmarksen täckte vad dessa modeller kan göra. Den här delen handlar om vilken du faktiskt ska använda.

Överblick

Spec

Muse Spark

GPT-5.4

Opus 4.6

Gemini 3.1 Pro

Lanserad

8 apr 2026

5 mar 2026

5 feb 2026

19 feb 2026

Contextfönster

262K*

1,05M

1M sedan 13 mar

1M

Indata-modaliteter

Text, bild, tal

Text, bild

Text, bild

Text, bild, ljud, video

API-priser (per 1M tokens in/ut)

Inget offentligt API

$2.50 / $15.00

$5.00 / $25.00

$2.00 / $12.00

Konsumentåtkomst

meta.ai (USA först)

ChatGPT

Claude.ai

Gemini-appen

*Artificial Analysis anger Muse Sparks contextfönster till 262K. Vissa källor anger 1M. Meta har inte publicerat ett model card som bekräftar någon av siffrorna.

Vilken ska du använda?

Välj Muse Spark om ditt användningsfall är hälsofrågor, diagramläsning eller multimodala konsumentapplikationer. Det finns ännu inget offentligt API, så om du bygger en produktionsintegration måste du vänta.

Välj GPT-5.4 om du behöver en allmän modell du kan bygga mot idag. Den leder inom kodning, abstrakt visuellt resonemang och kontorsautomation, med offentligt API och 1M contextfönster tillgängligt nu.

Välj Claude Opus 4.6 om du arbetar med långa dokument eller behöver noggrann, högkvalitativ skrivutdata. 1M contextfönster flyttades till standardprissättning den 13 mars 2026. Det är det dyraste alternativet med $5/$25 per 1M tokens.

Välj Gemini 3.1 Pro om din pipeline hanterar video. Det är den enda modellen här som accepterar videoindata, och med $2/$12 per 1M tokens är den det billigaste frontlinjealternativet i den här gruppen.

Vad folk säger om Muse Spark

Tidiga reaktioner delade sig som man kunde förvänta. Vissa hittade specifika saker som överraskade dem. Andra tittade på benchmarktabellen och drog andra slutsatser.

Tweet från Viktor Seraleev som säger att Claude just fick en seriös konkurrent, beskriver Muse Spark som byggd av MSL och noterar att Zuckerberg startar om hela AI-strategin med en full stack ombyggd från grunden på 9 månader.

Inramningen "full stack ombyggd från grunden" dök upp ofta. Den niomånaders tidslinjen är antingen imponerande eller svår att tro på, beroende på hur mycket du litar på Metas påståenden.

Pietro Schirano delade ett konkret exempel: han bad Muse Spark att konvertera en UI-skärmdump till kod, och den extraherade bildresurserna från gränssnittet i stället för att behandla dem som en platt bild.

Tweet från Pietro Schirano som säger att han bad Muse Spark att konvertera en bild till kod och att modellen klippte ut tillgångarna från skärmarna så att de kunde användas korrekt, med en före- och efterjämförelse av skärmdumpar.

Det där är ingen benchmark. Det är den typen av sak som delas för att den är genuint oväntad.

Aakash Gupta hade den skarpaste analysen. Hans inramning: "Detta är en datamärknings-vd:s modell. Fingeravtrycken syns överallt i resultaten." De benchmark där Muse Spark leder är alla datakvalitetskänsliga uppgifter där urvalet av träningsdata avgör taket. 

De där den ligger efter (ARC-AGI-2, Terminal-Bench, GDPval) är exakt där arkitektur och RL-skalning betyder mer än data. Hans slutsats: "han byggde den bästa modellen på det som datapipe-lines löser, och en medioker på allt annat."

Full tweettråd från Aakash Gupta som analyserar Muse Spark: leder på datakvalitetskänsliga benchmarks, ligger efter på kodning och abstrakt resonemang, beskrivs som en datamärknings-vd:s modell, med slutsatsen att den 14,3 miljarder dollars-frågan var om Wang kunde bygga den bästa modellen överlag.

Slutsats

Steget från Llama 4 Mavericks 18 till Muse Sparks 52 på Artificial Analysis Intelligence Index är inte subtilt. För ett team som byggde om från grunden på nio månader är resultaten inom hälsa och multimodalitet ett verkligt första steg, och de står sig vid oberoende testning.

Visst, luckorna är uppenbara. Kodning och agentiska uppgifter mot GPT-5.4 är inte nära; abstrakt visuellt resonemang är en tydlig svag punkt, och det finns fortfarande inget offentligt API. Om du behöver en modell du kan bygga mot idag är Muse Spark inte det ännu.

Det jag återkommer till är frågan om öppen källkod. Llama-ekosystemet byggdes på förtroendet att vikter skulle finnas tillgängliga. Muse Spark bryter mot det. Wangs "förhoppning" om att open-sourca framtida versioner är inget åtagande. Det är, enligt min mening, det mest betydelsefulla med den här lanseringen, och det får mycket mindre uppmärksamhet än benchmark-siffrorna.

Större Muse-modeller är under utveckling. Om arkitekturen skalar som utlovat kommer dagens siffror att se blygsamma ut. Det är vad man satsar på.

Om du vill lära dig hur du får ut mesta möjliga av vilken stor språkmodell som helst rekommenderar jag vår kurs Understanding Prompt Engineering.

Muse Spark vanliga frågor

Om jag körde Llama lokalt, ersätter Muse Spark det?

Nej. Muse Spark finns bara i molnet. Du kan inte ladda ner den, köra den på egen hårdvara eller finjustera den. Åtkomst sker via meta.ai eller Meta AI-appen, båda kräver ett Meta-konto. Användningsfallet med öppna vikter som Llama byggde sin community kring finns inte här.

När ska jag faktiskt använda Contemplating i stället för Thinking?

Contemplating-läget är mest användbart när ett problem verkligen har flera giltiga lösningsvägar, komplexa vetenskapliga frågor, flerstegsresonemang med tvetydiga indata eller forskningsuppgifter där olika angreppssätt kan nå olika slutsatser. För de flesta vardagsfrågor är Thinking-läget snabbare och resultaten jämförbara. En annan sak att känna till: Contemplating-läget rullas fortfarande ut gradvis, så du kanske inte har åtkomst ännu.

Vad betyder påståendet om 10x beräkning egentligen för mig som användare?

Troligen inget just nu. Jämförelsen är mot Muse Sparks egen tidigare modell, inte mot GPT-5.4 eller Gemini, och siffran har inte verifierats oberoende. Den mer relevanta datapunkten är inferenseffektivitet: som nämnts tidigare använde Muse Spark 58 miljoner utgående tokens i Artificial Analysis oberoende körning, mot 157 miljoner för Claude Opus 4.6. Den skillnaden kan så småningom synas i prissättning, men API-priser har ännu inte annonserats.

Är det värt att byta till Muse Spark från det jag använder nu?

Om du använder ChatGPT för allmänna uppgifter är den dagliga upplevelsen liknande. Om hälsofrågor, vetenskap eller diagramanalys är dina huvudfall är Muse Spark ett rimligt uppsving. Om du förlitar dig på kodningsassistenter eller verktyg för långa dokument ersätter det inte GPT-5.4 eller Opus 4.6 ännu. Jämförelsetabellen ovan har detaljerna.

Bör jag vara orolig över fyndet om utvärderingsmedvetenhet?

Inte i praktisk vardaglig mening, men det är värt att förstå. Fyndet är att Muse Spark beter sig mer försiktigt när den upptäcker att den säkerhetstestas, inte för att dess underliggande värderingar skiljer sig utan för att den känner igen sammanhanget. Metas uppföljning fann att detta påverkade en smal uppsättning alignmenttester, inga som involverade farliga förmågor. Om du utvärderar modeller för känsliga implementationer, läs Apollos fullständiga rapport innan du drar slutsatser enbart från säkerhetsbenchmark.

Ämnen

AI-kurser

track

AI-grunder

10 timmar
Upptäck grunderna i AI, lär dig att använda AI effektivt i arbetet och fördjupa dig i modeller som ChatGPT för att navigera i det dynamiska AI-landskapet.
Se detaljerRight Arrow
Starta Kursen
Se merRight Arrow