Cursus
Tot nu toe is 2026 het jaar van agentische AI. Verbeteringen in modellen hebben geleid tot talloze tools voor agentisch werk, van persoonlijke AI-assistenten tot codeeragents. De grote spelers in die ruimte zijn Gemini van Google, de GPT-serie van OpenAI en de modellen van Anthropic, die favoriet zijn geworden bij ontwikkelaars.
In dit artikel vergelijk ik Claude Opus 4.7 en Gemini 3.1 Pro, inclusief benchmarks en prijzen. Aan het einde geef ik je een criterium waarmee je kunt beslissen welk model het beste bij je workflow past.
Wat is Claude Opus 4.7?
Zoals we behandelen in ons Opus 4.7-artikel, is Claude Opus 4.7 het nieuwste vlaggenschipmodel van Anthropic, de update van zijn voorganger, Claude Opus 4.6. Het is ontworpen voor complexe agentische workflows en meerstapsredeneren. Het presteert beter bij agentisch coderen, visueel redeneren en toolgebruik.
Belangrijkste functies en mogelijkheden van Claude Opus 4.7
Een centrale functie van Opus 4.7 is taakbudgetten, waarmee je een financiële beperking kunt instellen voor hoeveel tokens de agent per taak mag gebruiken. Ze voorkomen onverwachte kosten wanneer de agent autonoom draait door hem te dwingen te optimaliseren en binnen budget te blijven.
Claude Opus 4.7 heeft een contextvenster van 1 miljoen tokens en 128K outputtokens. Dit betekent dat het langdurige taken kan uitvoeren terwijl alle context behouden blijft. Dit is vooral handig bij het verkennen van een grote codebase.
Het model heeft ook zijn visuele mogelijkheden verbeterd en ondersteunt afbeeldingen tot 3,75 megapixels. Daardoor presteert het beter in visueel redeneren dan Opus 4.6, wat het het ideale model maakt voor taken zoals data-extractie uit grafieken met hoge resolutie.
Opus 4.7 introduceert ook een nieuwe xhigh denk/redenatie-inspanning die tussen high en max zit om de beste resultaten te leveren bij codeer- en agenttaken. Je kunt ook de high denk-inspanning gebruiken voor iets minder denkwerk. Anthropic heeft bovendien /ultrareview in Claude Code geïntroduceerd om code reviews op codewijzigingen uit te voeren en bugs te vangen.

Wat sommige mensen kan verrassen: Adaptive Thinking laat standaard geen denk-responses meer zien. Je kunt een samengevatte versie van de redenering terughalen door thinking.display op summarized te zetten.
Qua benchmarks scoort Opus 4.7:
- 87,6% op SWE-bench Verified
- 64,3% op de moeilijkere variant SWE-bench Pro
- 78% op OSWorld, dat autonoom computergebruik meet
- 77,3% op MCP Atlas voor orkestratie van multi-tool workflows
Toen Claude Opus 4.7 werd uitgebracht, stond het bovenaan de Artificial Analysis Intelligence Index met een score van 57. Het leidde ook in agentisch werk in de praktijk zoals gemeten met GDPval-AA, met een score van 1.753 Elo. Ondertussen heeft GPT-5.5 het op beide ingehaald.
Leer hoe je een Streamlit-benchmarkapplicatie bouwt die test of het zelfkritiekgeheugen van Opus 4.7 de codeerprestaties daadwerkelijk verbetert bij high-, xhigh- en max-inspanningsniveaus in onze Claude Opus 4.7 Practical Benchmark-tutorial.
De voor- en nadelen van Claude Opus 4.7
De modellen van Anthropic staan bekend als de beste voor coderen, en de benchmarks van Opus 4.7 bewijzen dat. De Opus-familie is echter niet goedkoop, waardoor een taakbudget een nuttige toevoeging is, zeker voor mensen die lange, agentische workflows draaien.
Het model is ook beschikbaar via verschillende cloudproviders zoals Amazon Bedrock, Google Vertex AI en Microsoft Foundry. Dit maakt integratie met je bestaande provider eenvoudig.
Opus 4.7 wordt ook geleverd met een nieuwe tokenizer, waardoor het iets lastiger is om de werkelijke kosten met het vorige Opus-model te vergelijken. Volgens Artificial Analysis Intelligence gebruikte Opus 4.7 echter ~35% minder outputtokens dan Opus 4.6 om de index te draaien.

Leer de mogelijkheden van Anthropic’s beste publiek beschikbare model, Claude Opus 4.7, kennen en bouw een datawetenschapstool die een grafiek kan omzetten in ruwe data in onze Claude Opus 4.7 API Tutorial.
Wat is Gemini 3.1 Pro?
Gemini 3.1 Pro is het huidige vlaggenschip-redeneermodel van Google DeepMind met een Transformer-gebaseerd mixture-of-experts-model. Toen Gemini 3.1 Pro werd uitgebracht, leidde het de Artificial Analysis Intelligence Index met 4 punten voorsprong op Opus 4.6, en staat het nu gelijk met Opus 4.7 met een score van 57.
Wil je meer weten over Gemini 3.1 Pro, bekijk dan ons artikel Bouwen met Gemini 3.1 Pro, waarin we behandelen hoe je een production-ready app bouwt met Gemini 3.1 Pro.
Belangrijkste functies en mogelijkheden van Gemini 3.1 Pro
In tegenstelling tot Gemini 3 Pro, dat twee niveaus had, heeft Gemini 3.1 Pro drie denkniveaus: low, medium en high. Low is het best voor snelheid en tokenoptimalisatie. medium biedt een gebalanceerde aanpak. Omdat high meer thinking tokens produceert en de traagste reacties geeft, gebruik je dit voor taken die complex redeneren vereisen.
Gemini 3.1 Pro heeft ook een contextvenster van 1 miljoen tokens voor input, maar een kleiner venster van grofweg 65K outputtokens. Het is multimodaal en ondersteunt audio, pdf’s, tekst en afbeeldingen.
Laten we het over benchmarks hebben. Dit zijn twee gebieden waar Gemini 3.1 Pro uitblinkt:
- Gemini 3.1 Pro leidt het veld op ARC-AGI-2 met een score van 77,1%.
- Gemini 3.1 Pro scoort 73,9% op de MCP Atlas, die coördinatie van multi-tool workflows meet.

Volgens Artificial Analysis Intelligence is Gemini 3.1 Pro Preview tokenefficiënt en gebruikte het ~57M tokens om hun Index te draaien vergeleken met Opus 4.6.
Gemini 3.1 Pro ligt voor op Opus 4.7 op de Artificial Analysis Coding Index, maar moet het afleggen op de Agentic Index.
De voor- en nadelen van Gemini 3.1 Pro
De prijsstelling van Gemini 3.1 Pro is zeer aantrekkelijk, vooral voor jobs die veel tokens nodig hebben. Google biedt ook 50% korting met hun batch-prijsmodel, wat het een ideale optie maakt wanneer je geen realtime resultaten nodig hebt.
Aan de minzijde is het 65K-outputvenster van Gemini 3.1 Pro slechts half zo groot als dat van Opus 4.7 (128K).
Claude Opus 4.7 vs Gemini 3.1 Pro: directe vergelijking
Hier is een snel overzicht, voordat we elk categorie bekijken.
|
Claude Opus 4.7 |
Gemini 3.1 Pro |
|
|
Releasedatum |
16 april 2026 |
19 februari 2026 |
|
Contextvenster |
1M tokens |
1M tokens |
|
Max. output |
128K tokens |
65K tokens |
|
SWE-bench Verified |
87,6% |
80,6% |
|
SWE-bench Pro |
64,3% |
54,2% |
|
ARC-AGI-2 |
75,8% |
77,1% |
|
GPQA Diamond |
94,2% (gelijk) |
94,3% (gelijk) |
|
MCP Atlas |
77,3% |
73,9% |
|
OSWorld |
78,0% |
Geen gepubliceerde score |
|
Visie |
2576px / 3,75MP |
Multimodaal (video, audio, pdf) |
|
Inputprijzen |
$5/M tokens |
$2/M tokens |
|
Outputprijzen |
$25/M tokens |
$12/M tokens |
Prestaties bij agentisch en computergebruik
Opus 4.7 is een zeer sterk model voor agentisch werk, vooral omdat je kunt bepalen hoeveel tokens de agent mag gebruiken. Dit systeem is niet beschikbaar in Gemini 3.1 Pro; je moet het denkniveau gebruiken om het tokenverbruik te sturen.
Opus 4.7 scoort 78% op de OSWorld-benchmark voor autonoom computergebruik. Dat is een sterk resultaat, vergelijkbaar met de 78,7% van GPT 5.5, terwijl Gemini 3.1 Pro geen gepubliceerde OSWorld-score heeft. Op MCP Atlas pakt Opus 4.7 de leiding met 77,3% tegenover 73,9% voor Gemini. Deze cijfers maken Opus 4.7 een ideale keuze voor productieklare agentische systemen.
Codeerbenchmarks
Laten we nu bekijken welk model het beste is als het gaat om programmeren volgens de beschikbare benchmarks, in het bijzonder SWE-bench Verified, dat echte GitHub-issues test.
Opus 4.7 haalt 87,6% tegenover 80,6% voor Gemini 3.1 Pro. Op SWE-bench Pro, de moeilijkere variant, scoort Opus 4.7 64,3% tegenover 54,2% voor Gemini (en 58,6% voor GPT 5.5). De cijfers laten zien dat Opus 4.7 momenteel het sterkste codeermodel ter wereld is.
Laten we zien hoe de modellen presteren op Terminal-Bench 2.0, dat het vermogen van de modellen test om via de terminal te coderen. Opus 4.7 behaalt 69,4%, Gemini Pro 68,5% en de nieuwe GPT 5.5 82,7%. GPT-5.5 is de duidelijke winnaar op deze benchmark, terwijl onze twee modellen hier nagenoeg gelijk eindigen.
Redeneren en wetenschappelijke taken
Welk model is het beste voor redeneren en wetenschappelijke taken? Laten we dat uitzoeken. Ik gebruik de GPQA Diamond-benchmark niet, omdat alle modellen die glansrijk halen. In plaats daarvan kijken we naar ARC-AGI-2, dat vloeibare intelligentie meet: het vermogen van een model om abstracte redeneerproblemen op te lossen die het niet eerder heeft gezien.
Gemini 3.1 Pro scoort 77,1% tegenover 75,8% voor Opus 4.7 en 85,0% voor GPT 5.5, waarmee GPT 5.5 hier de duidelijke winnaar is, gevolgd door Gemini 3.1 Pro.
Op Humanity's Last Exam, dat graduate-niveau redeneren in wetenschap, wiskunde en geesteswetenschappen wil meten, leidt Opus 4.7 ten opzichte van Gemini 3.1 Pro zowel met als zonder tools:
- Zonder tools: Opus 4.7 leidt met 46,9%, gevolgd door Gemini 3.1 Pro (44,4%) en GPT 5.5 Pro (43,1%).
- Met tools: GPT 5.5 Pro leidt met 57,2%, gevolgd door Opus 4.7 (54,7%) en Gemini 3.1 Pro (51,4%).
Kosten en tokenefficiëntie
Opus 4.7 kost $5 per miljoen inputtokens en $25 per miljoen outputtokens, terwijl Gemini 3.1 Pro $2 per miljoen inputtokens en $12 per miljoen outputtokens kost. Gemini is veel goedkoper, en met de 50% batch-prijskorting is het model zeer scherp geprijsd voor taken die veel tokens vereisen.
Het is ook belangrijk om te vermelden dat de nieuwe tokenizer van Opus 4.7 het wat lastiger maakt om kosten te vergelijken met het vorige Opus-model.
Contextvenster en outputcapaciteit
Beide modellen accepteren 1 miljoen inputtokens, waardoor ze volledige codebases en lange onderzoeksdocumenten in één prompt kunnen verwerken.
Voor outputtokens ondersteunt Opus 4.7 128K tokens, terwijl Gemini 3.1 Pro 65.536 ondersteunt. Dit maakt Opus een betere keuze voor workflows die meer outputtokens moeten genereren.

Leer hoe Opus 4.7 en GPT 5.4 zich verhouden in onze Opus 4.7 vs. GPT-5.4-tutorial, waarin we de twee vergelijken voor coderen, agentische workflows en long-context-taken, en benchmarks analyseren.
Is Claude Opus 4.7 beter dan Gemini 3.1 Pro?
Dat brengt ons bij de vraag: welk van de twee modellen moet je kiezen?
Je kiest het beste voor Claude Opus 4.7 als...
- Je agentische codeerpijplijnen bouwt waarbij een verschil van 10 punten op SWE-bench Pro zich direct vertaalt naar minder mislukte runs in productie.
- Je taakbudgetten nodig hebt om lange autonome loops voorspelbaarder te maken zonder extra monitoringslogica toe te voegen.
- Je pijplijn lange outputs genereert en de limiet van 128K tokens telt, bijna het dubbele van wat Gemini 3.1 Pro ondersteunt.
- Je de sterkste score voor multi-tool orkestratie op MCP Atlas wilt voor complexe agentische workflows.
- Je al in het Anthropic-ecosysteem zit via Claude Code, Amazon Bedrock of de Claude API, en de overstapkosten zwaarder wegen dan het prijsverschil.
Je kiest het beste voor Gemini 3.1 Pro als...
- Je tokenvolumes het verschil van 2,5x in inputkosten significant maken; bij 500 miljoen tokens per maand is dat gat $1.500 elke maand.
- Je native video-, audio- of pdf-inputs nodig hebt in één API-call zonder aparte voorverwerkingsstap.
- Je bouwt op de infrastructuur van Google en een relatie met één leverancier wilt via Vertex AI.
- Abstract visueel redeneren je primaire usecase is. Opus blijft achter op ARC-AGI-2 met 75,8% tegenover 77,1% voor Gemini.
Tot slot
Claude Opus 4.7 en Gemini 3.1 Pro zijn beide sterke modellen. De keuze hangt af van je budget en de taken die je wilt uitvoeren. Opus wint op de agentische taken, maar als dat buiten budget valt, is Gemini 3.1 Pro ook een sterke kandidaat, zeker gezien de goedkopere tokens en 50% batch-prijskorting.
Anthropic heeft zijn voorsprong behouden in de beste codeermodellen, waardoor het zeer geschikt is voor agentische taken die complex redeneren en programmeren vereisen. Google biedt frontier-redeneermodellen tegen een aanzienlijk lagere prijs dan Anthropic. De strijd tussen beide bedrijven en andere grote spelers zoals OpenAI is om het beste agentische model te leveren dat ook een goed algemeen model is.
Gezien hoe duur de Opus-familie is, is het goed om de introductie van taakbudgetten te zien. Ik zou niet verbaasd zijn als andere aanbieders dit in hun toekomstige releases integreren. Dit wordt een goede toevoeging om de kosten van langdurige agenttaken voorspelbaarder te maken.
Wil je meer leren over werken met AI-tools, bekijk dan onze gids met de beste gratis AI-tools. Voor bredere AI-codeervaardigheden kun je onze cursus AI-Assisted Coding for Developers proberen om de skills te ontwikkelen die AI-assistenten betrouwbaardere partners maken in je developmentworkflow.
Tot slot kun je ook ontdekken hoe je AI-gedreven applicaties bouwt met LLM’s, prompts, chains en agents in LangChain in onze cursus Developing LLM Applications with LangChain.
Claude Opus 4.7 vs Gemini 3.1 Pro: veelgestelde vragen
Is Claude Opus 4.7 beter dan Gemini 3.1 Pro?
Dat hangt af van de usecase. Opus 4.7 leidt op codeerbenchmarks (87,6% vs 80,6% op SWE-bench Verified), agentisch toolgebruik (MCP Atlas 77,3% vs 73,9%) en outputcapaciteit (128K vs 65K tokens).
Wat is een taakbudget in Claude Opus 4.7?
Een taakbudget is een tokenlimiet die je instelt voor een volledige agentische loop, inclusief denken, tool-calls, toolresultaten en de uiteindelijke output. Claude houdt bij hoeveel van het budget is verbruikt en past zijn werk daarop aan.
Hoeveel kost Gemini 3.1 Pro vergeleken met Claude Opus 4.7?
Gemini 3.1 Pro kost $2 per miljoen inputtokens en $12 per miljoen outputtokens. Claude Opus 4.7 kost $5 per miljoen inputtokens en $25 per miljoen outputtokens, dus Gemini is 2,5x goedkoper op input. Gemini biedt ook een batch-API met 50% korting, waardoor de inputkosten dalen tot $1 per miljoen tokens voor asynchrone workloads.
Hoe verhouden Claude Opus 4.7 en Gemini 3.1 Pro zich in de SWE-bench-benchmark?
Gemini 3.1 Pro scoort 80,6% op SWE-bench Verified en 54,2% op SWE-bench Pro. Claude Opus 4.7 scoort 87,6% op SWE-bench Verified en 64,3% op SWE-bench Pro. Het verschil van 10 punten op de Pro-variant is het meest betekenisvolle verschil tussen de twee modellen bij codeertaken.
Welk model heeft het langste contextvenster?
Zowel Claude Opus 4.7 als Gemini 3.1 Pro ondersteunen een contextvenster van 1 miljoen tokens voor input. Voor output ondersteunt Opus 4.7 tot 128.000 tokens, wat het dubbele is van de 65.536 tokens van Gemini 3.1 Pro. Als je lange documenten of complexe code met meerdere bestanden in één keer wilt genereren, heeft Opus 4.7 de hogere outputlimiet van de twee.

