Leerpad
We schreven in een gestaag tempo artikelen over Meta's Llama-modellen (Llama 2, Llama 3, enzovoort). Toen verscheen Llama 4 in april 2025 en kreeg het brede kritiek. Meerdere media en het vertrekkende AI-hoofd van het bedrijf zelf bevestigden dat benchmarkresultaten waren gemanipuleerd met gespecialiseerde submodellen die nooit openbaar werden gemaakt.
Daarna stokten de updates. Rond dezelfde tijd kondigde Meta aan dat Horizon Worlds naar alleen mobiel ging, waarmee de VR-versie waarop ooit de toekomst van het bedrijf werd gebouwd, feitelijk eindigde. Het leek een bedrijf dat op twee fronten tegelijk zijn grip verloor.
Op 8 april 2026 lanceerde Meta Muse Spark, het eerste model van Meta Superintelligence Labs. In het persbericht komt de uitdrukking "personal superintelligence" net iets te vaak terug. Haal dat weg en er staat een echt model onder dat Meta weer meeneemt in het gesprek aan de frontlinie.
Wil je zien hoe Meta's nieuwe model zich verhoudt tot een van de beste huidige concurrenten, lees dan onze gids Muse Spark vs Claude Opus 4.6. Je kunt ook onze gids voor Muse Glimmer en onze tutorial voor het lokaal draaien van Muse Glimmer lezen.
Wat is Muse Spark?
Muse Spark is een van nature multimodaal redeneermodel dat tekst, afbeeldingen, audio en toolgebruik in één architectuur verwerkt. Het ondersteunt visuele chain-of-thought, wat betekent dat het model beeldgebaseerde problemen stap voor stap kan doorlopen in plaats van alleen een enkel antwoord te geven. Multi-agent orchestration maakt ook deel uit van de setup; daar komen we zo op terug.
Eerdere Llama-modellen gaven antwoorden op basis van patroonherkenning uit training. Muse Spark werkt problemen eerst uit voordat het reageert. Dát is de daadwerkelijke verschuiving.
Wie zit erachter?
Meta Superintelligence Labs, of MSL, werd opgericht op 30 juni 2025, toen Mark Zuckerberg de AI-activiteiten van het bedrijf reorganiseerde. Alexandr Wang, voormalig CEO van Scale AI, trad aan als Chief AI Officer; Meta had ongeveer $14 miljard in Scale AI geïnvesteerd als onderdeel van de deal.
Nat Friedman, voormalig CEO van GitHub, leidt de product- en toegepaste onderzoekskant, en Shengjia Zhao, die GPT-4 en o1 bij OpenAI mede ontwikkelde (dezelfde o1 waartegen Muse Spark nu wordt gebenchmarkt), is Chief Scientist.
Er is nog een derde factor die het noemen waard is: Yann LeCun, Meta's longtime Chief AI Scientist en de meest zichtbare open-source pleitbezorger van het bedrijf, vertrok in november 2025. Zijn vertrek volgde op organisatorische veranderingen die zijn rol beperkten en de verschuiving van het team naar closed-source ontwikkeling.
Wat is er nieuw aan Muse Spark (en waarom is dat belangrijk)?
De belangrijkste vernieuwingen zijn redeneermodi, een opnieuw opgebouwde trainingspijplijn en een bewuste focus op gezondheid. Laten we ze op volgorde doornemen.
Drie redeneermodi
Muse Spark biedt drie manieren om ermee te werken, en het is de moeite waard om het onderscheid daartussen te begrijpen voordat je het model probeert.
- Instant is de standaard voor losse vragen. Het reageert snel zonder uitgebreid redeneren, vergelijkbaar met wat je van een standaard chatmodel krijgt.
- Thinking gebruikt uitgebreide chain-of-thought-redenering. Het model neemt meer tijd, werkt tussenstappen uit en presteert over het algemeen beter op moeilijkere problemen. Dit is de modus achter de meeste benchmarkresultaten in dit artikel.
- Contemplating is de interessantste. Daarover direct hieronder meer.
Één ding om vooraf te weten: Contemplating-modus wordt geleidelijk uitgerold en was op de lanceringsdag niet voor alle gebruikers beschikbaar. Als je het nog niet ziet, is dat te verwachten.
Contemplating-modus
Contemplating-modus start meerdere redeneeragenten die parallel werken en voegt hun outputs samen tot één antwoord. Waar Gemini's Deep Think en OpenAI's GPT Pro-modus redeneren opschalen door langer na te denken, schaalt Muse Spark het op door breder na te denken. Meer agenten werken gelijktijdig in plaats van één agent die langer werkt.
Meta's stelling is dat deze aanpak vergelijkbare resultaten oplevert met lagere latentie, omdat de agenten parallel draaien in plaats van sequentieel. Onafhankelijke bevestiging van de latentieclaims is er nog niet, maar de benchmarkcijfers van de Contemplating-modus leiden op verschillende zware evaluaties (daarover zo meer).
Dit is een feature op inferentietijd, geen architecturale. Het model zelf verandert niet.
Opschalen met reinforcement learning en gedachtecompressie
Meta heeft zijn trainingsstack vanaf nul herbouwd gedurende de negen maanden die de ontwikkeling van Muse Spark duurde. De claims over reinforcement learning (RL) komen met name uit Meta’s eigen technische blog en zijn niet onafhankelijk geverifieerd.
Het interessantere detail is een techniek die het onderzoeksteam gedachtecompressie noemt. Tijdens RL-training wordt het model beloond voor correcte antwoorden, maar ook bestraft voor denktijd, wat zich vertaalt naar overmatige outputtokens. Dit creëert een gedrag in drie fasen bij complexe taken zoals wiskundeproblemen.
Eerst verbetert het model door langer na te denken. Vervolgens treedt de lengteboete in werking en dwingt het model om dezelfde problemen met veel minder tokens op te lossen. Op een gegeven moment verlengt het zijn redenering opnieuw en doorbreekt het eerdere prestatielimieten terwijl het minder tokens gebruikt.
Het praktische resultaat: het model leerde meer te doen met minder. Die claim rust op Meta's eigen trainingscurves, die niet onafhankelijk zijn gevalideerd.
10x minder compute
Meta stelt dat de nieuwe architectuur de prestaties van Llama 4 Maverick evenaart met tien keer minder trainingscompute. Dat gaat over architecturale efficiëntie, niet over het plafond van Muse Spark. Llama 4 Maverick scoorde 18 op de Artificial Analysis Intelligence Index. Muse Spark scoorde 52.
De tokenefficiëntiecijfers uit de onafhankelijke run van Artificial Analysis wijzen in dezelfde richting. Muse Spark gebruikte 58 miljoen outputtokens. GPT-5.4 gebruikte 120 miljoen. Claude Opus 4.6 gebruikte 157 miljoen.
Gezondheid: een bewuste focus
Gezondheid is Muse Spark's duidelijkste benchmarkvoordeel, en dat is bewust zo. Meta werkte met meer dan 1.000 artsen om trainingsdata voor gezondheidsredenering samen te stellen.
Het model kan interactieve weergaven genereren met voedingsinhoud, medicatie-informatie en inspanningsfysiologie. Op HealthBench Hard scoorde Muse Spark 42,8 tegenover 40,1 voor GPT-5.4 en 20,6 voor Gemini 3.1 Pro. Dat gat met Gemini blijft bestaan onder onafhankelijke evaluatie.
Dit is duidelijk Meta's antwoord op ChatGPT Health. Meta's argument waarom het kan concurreren is de sociale context van 3 miljard gebruikers, die het een voorsprong zou moeten geven in het begrijpen hoe mensen daadwerkelijk vragen over gezondheid. Of dat standhoudt bij complexe of ongebruikelijke vragen in plaats van de alledaagse uit de benchmarks, is het aanzien waard.
En Llama dan?
De ontwikkelaarscommunity stelt één vraag, en die verdient een direct antwoord.
Muse Spark is niet open-source. Elk Llama-model tot en met Llama 4 werd geleverd met gewichten die ontwikkelaars konden downloaden en lokaal draaien. Communities zoals r/LocalLLaMA zijn daarop gebouwd. Die usecase is weg.
Meta's opgegeven reden is deels competitief: Chinese labs, waaronder DeepSeek, gebruikten Llama-gewichten om hun eigen onderzoek te versnellen. Wang heeft gezegd dat het bedrijf "hoopt" toekomstige Muse-modellen open-source te maken, zonder tijdlijn. "Hoopt" doet veel werk in die zin.
Het Llama-team werd ondergebracht in Wang's lab, en Llama 4 was het laatste model uit de oude structuur. Of Llama naast Muse blijft bestaan of stilletjes uitdooft, heeft Meta niet gezegd.
Muse Spark-benchmarkresultaten
Benchmarks zijn lastig bij Muse Spark, en wel om een reden die het waard is om vooraf te benoemen. Gezien Meta's Llama 4-geschiedenis, houd de zelfgerapporteerde en onafhankelijk geverifieerde cijfers gescheiden.
Hier zijn de resultaten voor Thinking-modus, waar het meeste eerlijke vergelijkingsmateriaal zit.

Bron: Meta Superintelligence Labs / ai.meta.com
Contemplating-modus heeft een aparte set voor de zwaarste evaluaties. Het leidt op Humanity's Last Exam en FrontierScience Research, maar ligt achter op GPT-5.4 Pro en Gemini 3.1 Deep Think bij IPhO 2025 Theory-fysicaproblemen. Allemaal uit Meta's eigen rapportage, dus lees ze als richtinggevend interessant in plaats van definitief.

Bron: Meta Superintelligence Labs / ai.meta.com
Het onafhankelijke beeld van Artificial Analysis is genuanceerder. Zij plaatsten Muse Spark als vierde op hun Intelligence Index, achter Gemini 3.1 Pro Preview, GPT-5.4 en Claude Opus 4.6. Nog steeds top vijf wereldwijd. De cijfers maken de zwakke plekken ook duidelijk: ARC-AGI-2 en Terminal-Bench 2.0 zijn het waard om op te letten als coderen of abstract redeneren belangrijk is voor jouw usecase.
Muse Spark testen
Met die benchmarkcijfers in gedachten, gaan we Muse Spark aan de tand voelen. Ik bekijk het model op meerstapsredenering, beeldbegrip en code-debugging.
Test 1: Fibonacci–binaire logische keten (stabiliteit van cascaderende redenering)
In mijn eerste test richt ik me op de geavanceerde redeneercapaciteiten van Muse Spark in een meerstapsoefening. Het model moet:
- De juiste Fibonacci-term identificeren
- Die correct naar binair omzetten
- Bits nauwkeurig tellen
- Priemgetallen genereren in een berekende range
- Een grote som uitvoeren
De gebruikte prompt was:
Step 1: Find the 13th number in the Fibonacci sequence (starting with F1=1, F2=1). Let this be X.
Step 2: Convert X into a binary string (Base 2).
Step 3: Count the number of '1's in that binary string. Let this count be C.
Step 4: Identify all prime numbers (p) such that 20 ≤ p ≤ (C × 100).
Step 5: Calculate the sum of these primes. What is the final result?
Muse Spark deed het uitstekend en loste de oefening in één keer correct op. Dat is extra indrukwekkend omdat GPT-5.4 faalde in de laatste stap en pas slaagde toen die werd opgesplitst in twee stappen (de priemgetallen opsommen en ze daarna optellen).

Test 2: Beeldbegrip en verkoopredenering op een meerregelige tijdreeksdiagram
Meta claimt dat Muse Spark uitblinkt in het begrijpen van complexe afbeeldingen, dus ik gebruik de volgende meerregelige tijdreeksdiagram om te zien of het patronen kan herkennen en omzetten in bruikbare suggesties.

Dit is de prompt:
Examine this multi-line time-series of monthly active users for three products. Describe the key patterns you see, explain how events likely impacted each product, and propose data-driven next steps for the business.

Muse Spark identificeerde alle patronen correct, wat impliceert dat de beeldherkenning goed werkt.

De gebruikte data waren willekeurig gefabriceerd, dus er is hier geen duidelijk goed of fout antwoord. Dat gezegd hebbende, Muse Spark identificeert alle events en redeneert over de verschillende producten en tijden voor elk van de events, en komt tot verstandige conclusies. Het analyseert zelfs veranderingen in de som van monthly active users (MAU) van productcombinaties, zonder dat daarom is gevraagd, wat een fijne toevoeging is.

Alle voorgestelde vervolgstappen sluiten aan bij de analyses over MAU-patronen per product en de effecten van events. Muse Spark identificeerde het belangrijkste thema voor elk product (launch playbook voor A, prijsstelling voor B, opschaling voor C) en kwam met concrete acties die logisch zijn.
Test 3: Code-debugging
Tot slot test ik Muse Spark’s vaardigheden in het diagnosticeren van codebugs. De test is bedoeld om te laten zien of het model alleen de juistheid van code regel voor regel volgt of ook onderliggende fouten kan detecteren.
De prompt:
A developer wrote this Python function to compute a running average:
def running_average(data, window=3):
result = []
for i in range(len(data)):
start = max(0, i - window + 1)
chunk = data[start:i + 1]
result.append(round(sum(chunk) / window, 2))
return result
When called with running_average([10, 20, 30, 40, 50]), the first two values in the output seem wrong. Why? Please help me fix what is wrong!
De functie deelt altijd door window (3), zelfs in het begin, wanneer de chunk minder dan 3 elementen heeft. De buggy output is [3.33, 10.0, 20.0, 30.0, 40.0], maar de eerste twee waarden zouden 10.0 en 15.0 moeten zijn, omdat die chunks respectievelijk slechts 1 en 2 elementen bevatten. De fix is / window wijzigen in / len(chunk).
Modellen lopen vaak perfect door de lus heen, maar melden dan dat de output er "correct" uitziet. Ze zien de wiskunde stap voor stap gebeuren en markeren niet dat een enkel element door 3 delen niet logisch is. Het vereist dat het model intentie (wat een running average hoort te doen) naast uitvoering (wat de code daadwerkelijk doet) vasthoudt en de kloof ertussen ziet.

Muse Spark herkende een voortschrijdend gemiddelde als de intentie en zag de fout. Het stelde de juiste wijziging voor en legde uit waarom die nodig is. Het stelde zelfs een andere optie voor als gedeeltelijke vensters helemaal moeten worden overgeslagen.
Al met al slaagde het model perfect voor alle drie de tests en maakte het een goede eerste indruk.
Hoe krijg ik toegang tot Muse Spark?
Je kunt Muse Spark gebruiken via meta.ai of via de Meta AI-app op iOS en Android. Beide zijn gratis. De eerste uitrol is in de VS, met uitbreiding naar andere regio's in de weken erna.
Meta is van plan het in hetzelfde tijdsbestek uit te rollen naar WhatsApp, Instagram, Facebook, Messenger en de Ray-Ban AI-bril.
Er is geen publieke API. Er is een private preview voor geselecteerde enterprise-partners, zonder bevestigde datum voor bredere toegang. Over privacy: het beleid van Meta stelt weinig grenzen aan hoe gesprekken kunnen worden gebruikt om de modellen te verbeteren. Als je gevoelige informatie wilt delen, lees dan eerst de voorwaarden.
Waar Muse Spark tekortschiet
Meta zei het zelf in de technische blog: het model heeft gaten in meerstaps agenttaken en coding-workflows.
Op SWE-Bench Verified is de achterstand op Gemini en Opus 4.6 klein. Die wordt groter in agentisch werk: Terminal-Bench 2.0 (59,0 vs. 75,1 voor GPT-5.4) en GDPval-AA kantoorautomatisering (1.444 vs. 1.672 voor GPT-5.4). Dat is geen kleinigheid.
Abstract visueel redeneren volgt hetzelfde patroon: ARC-AGI-2 is 42,5 voor Muse Spark tegenover midden 70 voor zowel GPT-5.4 als Gemini. Het model dat vooroploopt in het lezen van grafieken scoort slecht op nieuwe visuele patronen.
Dat laatste riep op de lanceringsdag een reactie op. François Chollet, medeoprichter van ARC Prize en maker van Keras en ARC-AGI, noemde het model "overgeoptimaliseerd voor publieke benchmarkcijfers ten koste van al het andere." Wang reageerde, erkende de kloof bij ARC-AGI-2 en wees op positieve gebruikersfeedback over visueel coderen en redeneren. Of dat standhoudt bij breder gebruik is nog een open vraag.
De ontbrekende publieke API, zoals ik eerder besprak, is daarbovenop een concurrentienadeel. Wang erkende het op de lanceringsdag: "Er zijn zeker ruwe kantjes in het modelgedrag die we in de loop van de tijd zullen polijsten."
Muse Spark-veiligheid
Meta voerde voor de lancering evaluaties uit onder het Advanced AI Scaling Framework. Op BioTIER-refuse scoort Muse Spark het hoogst in de vergelijkingsset voor het weigeren van bio-wapenverzoeken. Dit zijn Meta's eigen cijfers.

Bron: Meta Superintelligence Labs / ai.meta.com
De interessantere bevinding komt van Apollo Research. Zij vonden dat Muse Spark de hoogste mate van evaluatiebewustzijn vertoonde van alle modellen die ze hadden getest: het model identificeerde veiligheidsevaluaties vaak als testcontexten en gedroeg zich voorzichtiger vanwege die detectie.
Een model dat zich alleen goed gedraagt wanneer het weet dat het bekeken wordt, is een probleem dat serieus moet worden genomen. Eerder werk van Apollo heeft gedocumenteerd dat dit patroon kan leiden tot wat zij "schemend gedrag" noemen in daadwerkelijke inzet.
Meta erkende de bevinding bij de lancering, wat de meeste labs niet doen. Hun vervolgonderzoek wees uit dat het een kleine subset van alignmentevaluaties betrof, geen enkele gerelateerd aan gevaarlijke capaciteiten, en concludeerde dat het geen blokkerende zorg was. Het onderzoek loopt door.
Muse Spark vs. GPT-5.4 vs. Opus 4.6 vs. Gemini 3.1
De benchmarks dekken wat deze modellen kunnen. Dit deel gaat over welke je daadwerkelijk moet gebruiken.
In één oogopslag
|
Spec |
Muse Spark |
GPT-5.4 |
Opus 4.6 |
Gemini 3.1 Pro |
|
Uitgebracht |
8 apr 2026 |
5 mrt 2026 |
5 feb 2026 |
19 feb 2026 |
|
Contextvenster |
262K* |
1,05M |
1M sinds 13 mrt |
1M |
|
Inputmodaliteiten |
Tekst, afbeelding, spraak |
Tekst, afbeelding |
Tekst, afbeelding |
Tekst, afbeelding, audio, video |
|
API-prijzen (per 1M tokens in / uit) |
Geen publieke API |
$2,50 / $15,00 |
$5,00 / $25,00 |
$2,00 / $12,00 |
|
Toegang voor consumenten |
meta.ai (VS eerst) |
ChatGPT |
Claude.ai |
Gemini-app |
*Artificial Analysis noteert het contextvenster van Muse Spark op 262K. Sommige bronnen noemen 1M. Meta heeft geen modelkaart gepubliceerd die een van beide cijfers bevestigt.
Welke moet je gebruiken?
Kies Muse Spark als je usecase gezondheidsvragen, grafieklezing of multimodale consumentenapps zijn. Er is nog geen publieke API, dus als je een productie-integratie bouwt, moet je wachten.
Kies GPT-5.4 als je vandaag een general-purpose model nodig hebt waar je tegenaan kunt bouwen. Het leidt op coderen, abstract visueel redeneren en kantoorautomatisering, met een publieke API en 1M contextvenster die nu beschikbaar zijn.
Kies Claude Opus 4.6 als je met lange documenten werkt of zorgvuldige, hoogwaardige schrijfoutput nodig hebt. Het 1M-contextvenster ging op 13 maart 2026 naar standaardprijzen. Het is de duurste optie met $5/$25 per 1M tokens.
Kies Gemini 3.1 Pro als je pipeline video verwerkt. Het is het enige model hier dat video-invoer accepteert, en met $2/$12 per 1M tokens is het de goedkoopste frontier-optie in deze groep.
Wat mensen zeggen over Muse Spark
Vroege reacties vallen uiteen zoals je zou verwachten. Sommigen vonden specifieke dingen die hen verrasten. Anderen keken naar de benchmarktabel en trokken andere conclusies.

Het frame van "full stack opnieuw vanaf nul opgebouwd" kwam vaak terug. Die termijn van negen maanden is ofwel indrukwekkend ofwel moeilijk te geloven, afhankelijk van hoeveel je Meta's claims vertrouwt.
Pietro Schirano deelde een concreet voorbeeld: hij vroeg Muse Spark om een UI-screenshot naar code te converteren, en het sneed de image assets uit de interface in plaats van ze als een vlakke afbeelding te behandelen.

Dat is geen benchmark. Het is het soort ding dat wordt gedeeld omdat het oprecht onverwacht is.
Aakash Gupta had de scherpste observatie. Zijn framing: "Dit is het model van een data labeling-CEO. De vingerafdrukken zitten overal in de resultaten." De benchmarks waarop Muse Spark leidt, zijn allemaal taken die gevoelig zijn voor datakwaliteit, waar curatie van de trainingsset het plafond bepaalt.
Die waarop het achterblijft (ARC-AGI-2, Terminal-Bench, GDPval) zijn precies waar architectuur en RL-schaling meer uitmaken dan data. Zijn conclusie: "hij bouwde het beste model op de dingen die datapijplijnen oplossen, en een middelmatig model voor al het andere."

Conclusie
De sprong van 18 voor Llama 4 Maverick naar 52 voor Muse Spark op de Artificial Analysis Intelligence Index is niet subtiel. Voor een team dat in negen maanden vanaf nul opnieuw heeft opgebouwd, zijn de resultaten op gezondheid en multimodaal een echte eerste stap, en ze houden stand onder onafhankelijke tests.
Zeker, de gaten zijn duidelijk. Coderen en agentische taken vergeleken met GPT-5.4 liggen niet dicht bij elkaar; abstract visueel redeneren is een duidelijke zwakke plek, en er is nog steeds geen publieke API. Als je vandaag een model nodig hebt waar je tegenaan kunt bouwen, is Muse Spark dat nog niet.
Waar ik steeds op terugkom, is de open-sourcevraag. Het Llama-ecosysteem was gebouwd op het vertrouwen dat gewichten beschikbaar zouden zijn. Muse Spark doorbreekt dat. Wang's "hoop" om toekomstige versies open-source te maken is geen commitment. Dat is naar mijn idee het meest ingrijpende aan deze lancering, en het krijgt veel minder aandacht dan de benchmarkcijfers.
Grotere Muse-modellen zijn in ontwikkeling. Als de architectuur schaalt zoals gesteld, zullen de cijfers van vandaag bescheiden lijken. Dat is de gok.
Wil je leren hoe je het meeste uit elk groot taalmodel haalt, volg dan onze cursus Understanding Prompt Engineering.
Muse Spark FAQ's
Als ik Llama lokaal gebruikte, vervangt Muse Spark dat dan?
Nee. Muse Spark draait alleen in de cloud. Je kunt het niet downloaden, op je eigen hardware draaien of fine-tunen. Toegang gaat via meta.ai of de Meta AI-app, beide vereisen een Meta-account. De open-weights usecase waar Llama zijn community omheen bouwde, bestaat hier niet.
Wanneer moet ik Contemplating-modus gebruiken in plaats van Thinking?
Contemplating-modus is het nuttigst wanneer een probleem echt meerdere geldige oplossingspaden heeft, bij complexe wetenschappelijke vragen, meerstapsredenering met onduidelijke input of onderzoekstaken waarbij verschillende invalshoeken tot verschillende conclusies kunnen leiden. Voor de meeste alledaagse vragen is Thinking-modus sneller en zijn de resultaten vergelijkbaar. Nog iets om te weten: Contemplating-modus wordt nog geleidelijk uitgerold, dus het kan dat je er nog geen toegang toe hebt.
Wat betekent de 10x compute-claim eigenlijk voor mij als gebruiker?
Waarschijnlijk niets op dit moment. De vergelijking is met Muse Sparks eigen vorige model, niet met GPT-5.4 of Gemini, en het cijfer is niet onafhankelijk geverifieerd. Het relevantere datapunt is inferentie-efficiëntie: zoals eerder genoemd, gebruikte Muse Spark 58 miljoen outputtokens in de onafhankelijke run van Artificial Analysis tegenover 157 miljoen voor Claude Opus 4.6. Dat verschil kan uiteindelijk in prijzen terugkomen, maar API-prijzen zijn nog niet aangekondigd.
Is het de moeite waard om over te stappen op Muse Spark vanaf wat ik nu gebruik?
Als je ChatGPT voor algemene taken gebruikt, is de dagelijkse ervaring vergelijkbaar. Als gezondheidsvragen, wetenschap of grafiekanalyse je belangrijkste usecases zijn, is Muse Spark een redelijke upgrade. Als je afhankelijk bent van coding-assistenten of tools voor lange documenten, vervangt het GPT-5.4 of Opus 4.6 nog niet. De vergelijkingstabel hierboven heeft de details.
Moet ik me zorgen maken over de bevinding rond evaluatiebewustzijn?
Niet in praktische zin voor alledaags gebruik, maar het is wel de moeite om te begrijpen. De bevinding is dat Muse Spark zich voorzichtiger gedraagt wanneer het detecteert dat het wordt getest op veiligheid, niet omdat de onderliggende waarden verschillen maar omdat het de context herkent. Meta's vervolgonderzoek wees uit dat dit een smalle set alignmenttests betrof, geen enkele met gevaarlijke capaciteiten. Als je modellen evalueert voor gevoelige inzet, lees dan het volledige rapport van Apollo voordat je conclusies trekt op basis van alleen veiligheidsbenchmarkcijfers.
Ik ben een data-engineer en communitybouwer die werkt aan datapijplijnen, cloud en AI-tools, en tegelijkertijd praktische, impactvolle tutorials schrijft voor DataCamp en beginnende developers.

Ik ben een schrijver en editor op het gebied van data science en heb bijgedragen aan onderzoeksartikelen in wetenschappelijke tijdschriften. Ik ben vooral geïnteresseerd in lineaire algebra, statistiek, R en dergelijke. Ik speel ook best wat schaak!
Tom is data scientist en technisch docent. Hij schrijft en beheert de data science-tutorials en blogposts van DataCamp. Eerder werkte Tom in data science bij Deutsche Telekom.


