Anthropic har inte publicerat något direkt benchmarktest mellan Opus 5 och Sonnet 5. Varje lanseringsinlägg jämför sin modell med sin egen föregångare och med Opus 4.8. Så siffrorna nedan berättar bara en del av historien. Resten är samma avvägning som vid vilket Opus–Sonnet-par som helst: hur mycket takhöjd behöver du egentligen, och vad är du beredd att betala för den.
Vad är Claude Opus 5?
Opus 5 är Anthropics toppmodell, släppt den 24 juli 2026, prissatt till $5 per miljon inmatningstokens och $25 per miljon utmatningstokens. Anthropic kallar den state-of-the-art på Frontier-Bench och GDPval-AA, och nära den större modellen Fable 5 till halva priset. Den är standardmodell på Claude Max och den starkaste modellen på Claude Pro.
Dess utmärkande drag är självverifiering: att kontrollera sitt eget arbete, bygga testharnesk när ingen datafeed finns, och säga ifrån vid dåliga instruktioner i stället för att följa dem.
Vad är Claude Sonnet 5?
Sonnet 5 är Anthropics mellanklassmodell, släppt den 30 juni 2026. Anthropic beskriver den som sin mest agentiska Sonnet hittills, med prestanda nära Opus 4.8 till ett lägre pris. Den är standardmodell på Free- och Pro-abonnemang och finns även på Max, Team, Enterprise och via API:et.
Priser: $2 per miljon inmatningstokens och $10 per miljon utmatningstokens till och med 31 augusti 2026, därefter $3/$15 som standard.
Skillnaden mellan nivåerna i praktiken
Det här är den del som lanseringsinläggen inte stavar ut, eftersom det bara är så Anthropics modellutbud fungerar i allmänhet, inte specifikt för just det här paret.
Opus är takmodellen
Du tar till den när det är dyrt att ha fel, när en uppgift körs länge och autonomt utan avstämning halvvägs, eller när problemet är genuint nytt snarare än en variant på något modellen sett tusen gånger. Djupa refaktoreringar över flera filer, otydliga forskningsfrågor, långa agentiska körningar där fel ackumuleras — det är Opus-terräng. Du betalar för att modellen ska fånga sina egna misstag innan de blir ditt problem.
Sonnet är arbetshästen
Den är byggd för att vara tillräckligt snabb och billig för att köra kontinuerligt: chattassistenter, klassificering i hög volym, iterativ kodning där du ändå är med i loopen och granskar var tredje–fjärde steg, latenstkänsliga applikationer. Dömestaket är lägre, men för en stor del av det verkliga arbetet når du aldrig upp till det. De flesta team bör i vardagen luta åt Sonnet, med selektivt inkallad Opus för de uppgifter som faktiskt kräver den.
Just Sonnet 5 är Anthropics försök att skjuta upp det taket högre än vanligt för en mellanklassmodell — därav "mest agentiska Sonnet hittills" och påståendet att den närmar sig Opus 4.8 i vissa uppgifter. Det är sammanhanget för att läsa benchmark-siffrorna nedan: Sonnet 5 är inte bara billig, den är billig och närmare Opus-nivå än tidigare Sonnet-modeller var.
Vad releasesiffrorna faktiskt visar
Pris
Den tydligaste, minst tvetydiga skillnaden. Sonnet 5 ligger på $2/$10 (till 31 aug) eller $3/$15 (standard) jämfört med Opus 5:s fasta $5/$25 — Sonnet 5 kostar 40–60% av Opus 5 beroende på prisspannet.
Alignment
Den enda plats där de två lanseringsinläggen nämner varandra direkt. Anthropics automatiserade granskning fann att Opus 5 "följer Claudes konstitution bättre än Opus 4.8, Sonnet 5 eller Fable 5" — ett faktiskt, uttalat resultat, inte en tolkning. Opus 5 får 2,3 i den granskningen, dess säkraste poäng hittills. Sonnet 5 förbättrades jämfört med sin egen föregångare (lägre hallucination, lägre inställsamhet, bättre motstånd mot prompt-injection-kapningar) men Anthropic noterar att den fortfarande uppvisar en högre frekvens av felinriktat beteende än Opus 4.8.
Cybersäkerhet
Båda modellerna hölls borta från avsiktlig cyberträning, men de landar på olika nivåer.
Opus 5 närmar sig Mythos 5 i att hitta sårbarheter, även om den ligger efter i att omvandla dem till utnyttjanden. Sonnet 5 ligger längre bak: Anthropic säger uttryckligen att Sonnet 5 har "avsevärt sämre cyberförmågor än Opus 4.8 och Mythos 5", och på en utvärdering av exploitutveckling för Firefox producerade den aldrig en fullt fungerande exploit (0,0% framgång, bara en liten fördel över Sonnet 4.6 på partiella försök).
Om ditt användningsfall tangerar något cyberrelaterat är den här skillnaden verklig och den talar tydligt för Opus 5.
Kodning och kunskapsarbete
Här använder de två inläggen olika benchmarkuppsättningar, så det finns ingen ren poängrad.
Opus 5 mer än fördubblar Opus 4.8 på Frontier-Bench v0.1 och hamnar inom 0,5% av Fable 5 på CursorBench 3.2 till halva kostnaden. Sonnet 5 beskrivs som att den närmar sig Opus 4.8 på BrowseComp och OSWorld-Verified vid hög ansträngning.
Läst tillsammans med logiken om nivåskillnader ovan: Sonnet 5 kommer nära på de specifika uppgifter Anthropic valt att lyfta fram, men Opus 5:s vinster ser större och bredare ut. Behandla detta som vägledande, inte uppmätt.
När du ska välja vad
Välj Opus 5 om
uppgiften är högrisk, långvarig eller genuint ny; du arbetar med livsvetenskaper, kemi eller komplext flerstegs agentiskt arbete; du behöver den mest alignade modellen som finns; något cybersäkerhetsrelaterat ingår i omfattningen.
Välj Sonnet 5 om
du kör i hög volym, latenstid spelar roll, eller uppgiften är så väl avgränsad att du inte behöver Opus takhöjd i bedömningen; du använder Free eller Pro där den redan är standard; kostnad per token är den begränsande faktorn.
Varken eller, om
du behöver cybersäkerhetsarbete med reducerade skyddsräcken. Opus 5 faller automatiskt tillbaka till Opus 4.8, och Sonnet 5 ligger uttryckligen bakom Opus 4.8.
Avslutande tankar
Det mesta av avgörandet här är samma sak som avgör alla Opus–Sonnet-frågor: behöver den här uppgiften takhöjden, eller behöver den bara bli pålitligt utförd i skala? Sonnet 5 puttar upp den takhöjden mer än tidigare Sonnet-modeller, vilket är den verkliga nyheten i lanseringen. Men där Anthropic satte en siffra på de två modellerna tillsammans — alignmentgranskningen — kom Opus 5 ut före, och cybersäkerhetsberättelsen pekar åt samma håll. Utgå från Sonnet 5 för volym, sträck dig efter Opus 5 när uppgiften inte har råd med fel svar.