Leerpad
De Oxfordse wiskundige Marc Lackenby legde een open probleem voor aan Google’s AI-co-wiskundige. Het systeem leverde een bewijs, waarna zijn eigen reviewagents dat bewijs afkeurden. Bij het lezen van het afgekeurde betoog ontdekte Lackenby een echt nieuwe strategie, dichtte zelf het gat, en loste het probleem op.
De co-wiskundige verschijnt in een druk jaar voor AI en wiskunde. In juli 2026 hielp Claude Fable 5 de Jacobiaan-conjectuur aan te vechten; stelde GPT-5.6 Sol de constructie voor die de Maxwell-conjectuur brak en hielp bij het kraken van de Dinitz-Garg-Goemans-conjectuur; en OpenAI’s onuitgebrachte Astra klaarde tien open problemen in één dag.
De meeste daarvan waren one-shotresultaten: een model produceert een antwoord, mensen verifiëren het. De co-wiskundige is een andere gok, gebouwd voor het lange, niet-lineaire middenstuk van onderzoek in plaats van voor het oplossen van één vraag. In dit artikel bespreken we wat de AI co-wiskundige is, hoe de workflow en de multi-agentarchitectuur werken, wat vroege gebruikers zagen, en waar het nog tekortschiet.
Wat is de Google DeepMind AI Co-Wiskundige?
De AI co-wiskundige is een onderzoekswerkbank van Google DeepMind die een team van gespecialiseerde AI-agents coördineert om een wiskundige te helpen bij een volledig onderzoeksproject, van het formuleren van de vraag tot en met een uitgewerkt bewijs. Het is bedoeld om het hele rommelige onderzoeksproces te orkestreren, niet om één vraag in één keer te beantwoorden.
In mei 2026 publiceerden Google DeepMind-onderzoekers een arXiv-preprint getiteld "AI co-mathematician: Accelerating mathematicians with agentic AI," waarin een agentische AI-werkbank wordt beschreven die de volledige wiskundige werkcyclus orkestreert, inclusief ideevorming, literatuuronderzoek, berekening, bewijsproeven en theorievorming.
De AI co-wiskundige, momenteel beperkt beschikbaar voor een selecte groep onderzoekers, is op zichzelf geen oplosser of chatbot, maar een stateful werkruimte die de niet-lineaire, rommelige wiskundige workflow orkestreert. Het beheert parallelle onderzoekstrajecten, volgt onzekerheid, en bewaart mislukte pogingen voor toekomstig gebruik. De output is in LaTeX, het standaarddocumentformaat in wiskunde- en natuurkundeonderzoek.
Het is gebouwd op Gemini 3.1. Op dit moment gebruikt het Gemini Deep Think intern voor bewijsproeven en integreert het met Python-uitvoering voor computationele exploratie. Het bevat nog geen gespecialiseerde wiskundige engines van DeepMind (AlphaProof, AlphaEvolve, Aletheia) als interne componenten, maar is ontworpen om dat in de toekomst wel te doen.
Waarom is de AI co-wiskundige belangrijk?
Wiskundigen gebruiken LLM’s voor allerlei taken:
- Literatuuronderzoek
- Informele bewijsschetsen
- Standaard LaTeX-tekst
- Verkennende code
Ze gebruiken AI-tools, zoals formele bewijshulpen, om bewijzen mechanisch te verifiëren.
Hoewel elk hulpmiddel sterk is in een specifiek deel van de totale workflow, moet de wiskundige de resultaten ad hoc aan elkaar knopen. Tot nu toe ontbrak een infrastructuurtool die het niet-lineaire proces van wiskundigen orkestreert.
Hoe de AI co-wiskundige werkt
Het workflowmodel is losjes afgeleid van AI-codetools, zoals Claude Code of Codex. Deze workflow is echter niet één-op-één over te nemen. Software heeft een specificatie en een testsuite. Wiskundig onderzoek is niet-lineair. Het doel kan vaag of onbepaald zijn bij de start, en bevindingen gaandeweg kunnen de vraag volledig herdefiniëren.
De workflow van de co-wiskundige wordt aangedreven door een multi-agentsysteem en ziet er zo uit:
- Eerste verkenning. In plaats van een perfecte one-shotprompt te eisen, voert de onderzoeker een interactief gesprek met het systeem om de hoog-niveau doelen te verfijnen en de onderzoeksvraag te formaliseren. Zo wordt de onderzoeksintent expliciet vóórdat het werk begint.
- Literatuuronderzoek. De co-wiskundige voert een literatuurstudie uit, identificeert kernartikelen en extraheert relevante bewijzen en wiskundige technieken.
- Computationeel raamwerk. De co-wiskundige maakt een computationele Python-bibliotheek, met voorbeeldcases en bijbehorende tests.
- Zoekuitvoering. Nadat het computationele raamwerk is gemaakt, wordt de aangepaste bibliotheek geïmporteerd en schaalt de zoekopdracht over een cloudcluster. De onderzoeker krijgt voortgangsrapporten op hoofdlijnen zonder overspoeld te worden door gedetailleerde logs.
- Definitieve output. De definitieve output is een gecompileerde LaTeX-rapportage. Dit verslag legt het ontdekproces uit, niet alleen het resultaat, en gebruikt marge-aantekeningen om beweringen te koppelen aan specifieke referenties of code-uitvoer. Een rapport wordt pas als afgerond gemarkeerd nadat alle revieweragents het hebben goedgekeurd. Rapporten die de review niet doorstaan, worden nog steeds aan de onderzoeker getoond, gemarkeerd als onopgelost—zo bereikte het gebrekkige bewijs Lackenby.

Werkstroomarchitectuur van de AI co-wiskundige
De architectuur van de AI co-wiskundige is een multi-agentsysteem met een projectcoördinator op het hoogste niveau en gespecialiseerde subagents.
Workflowcoördinatie
Voordat er aan het probleem wordt gewerkt, start de projectcoördinator een dialoog met de onderzoeker om het doel te verfijnen via verhelderende vragen. Een onderzoeker die bijvoorbeeld vraagt naar bovengrenzen voor het "sofa-probleem", een open vraag in computationele meetkunde, kan worden gevraagd of de focus op de ene variant, de andere, of beide moet liggen. Het precieze, overeengekomen doel bakent het probleem af voordat agents worden ingezet.
Zodra het doel is vastgesteld, delegeert de projectcoördinator werk naar agents en subagents, die parallel werken tenzij afhankelijkheden anders vereisen. De ene agent voert de literatuurstudie uit, een andere bouwt het computationele raamwerk, en weer een andere voert de zoekopdracht uit. Er is echter een afhankelijkheid: de zoekopdracht kan pas worden uitgevoerd als de aangepaste bibliotheek uit het computationele raamwerk bestaat.

Hallucinaties vermijden
Standaardagents vinden vaak ongeldige shortcuts, hallucineren lemma’s of roepen te vroeg overwinning uit. De AI co-wiskundige gebruikt mechanismen om deze tekortkomingen te vermijden, waaronder revieweragents.
Als bijvoorbeeld de zoekruimte explodeert tijdens computationele exploratie, kan de coderingssubagent de code niet als klaar markeren totdat alle tests slagen en de revieweragent de resultaten accepteert, waardoor de workflow stokt. Deze mislukte verkenning wordt gelogd en naar de projectcoördinator gestuurd, die de onderzoeker vervolgens in de chat waarschuwt. De onderzoeker kan dan een andere aanpak voorstellen.
Dergelijke doodlopende paden worden niet alleen gelogd; ze worden als informatie behandeld. Ze worden versie-gevolgd en bewaard als onderdeel van het onderzoeksdossier. In de wiskunde onthult een mislukte aanpak vaak een beperking of wijst die naar een andere route.
Gedurende het proces filtert de coördinator standaard ruis op laag niveau, maar de onderzoeker kan inzoomen op elke werkstroom en deze indien nodig aanpassen.
Eerste casestudy’s en samenwerkingsmodi
Een paar vroege cases weerspiegelen verschillende vormen van samenwerking: een gebrekkig bewijs dat menselijk inzicht ontgrendelde, een margeopmerking die een vraag herkadert, en snelle detectie van een dood spoor die een week aan verkeerd gericht werk bespaarde.
Een bewijs repareren dat door het systeem als fout werd gemarkeerd
Marc Lackenby, hoogleraar wiskunde aan de University of Oxford, paste het systeem toe op een probleem uit het Kourovka-notitieboek (een verzameling open onderzoeksproblemen in de groepentheorie). De AI deed een bewijsproef, een reviewagent ontdekte een fout in het bewijs en rapporteerde die aan Lackenby. Hij wist hoe hij het gat moest repareren.
Die overdracht is precies de bedoeling. Een mens ving wat de machine miste, en de machine deed het zware werk eromheen.
Een margeopmerking volgen naar een nieuw inzicht
Een andere wiskundeprofessor, Gergely Bérczi, onderzocht een probleem rond Stirlingcoëfficiëntconjecturen. Voor de eerste review gaf hij de AI co-wiskundige het onderwerp, de achtergrond, de momenteel bekende methoden en een mogelijke richting die door AlphaEvolve-experimenten werd gesuggereerd.
De AI co-wiskundige leverde bewijzen (momenteel onder menselijke wiskundige review) voor twee van de conjecturen, met gedetailleerd computationeel bewijs voor de claims. Bérczi meldde dat het systeem hem hielp met een margeopmerking in het einddocument, die hem op een cruciaal inzicht wees, waar hij vervolgens in de chatinterface op doorpakte.
Een dood spoor detecteren vóórdat het een week kost
Tot slot legde Semon Rezchikov een technisch probleem voor over Hamiltoniaanse diffeomorfismen. Hij en de projectcoördinator bespraken het probleem totdat ze het eens waren over een precieze definitie van de taak. De write-up van de AI bevatte een cruciaal lemma met bewijs (later geverifieerd) dat de vraag in wezen oploste.
Onderweg werd een aanpak verkend, maar die liep dood. De AI bereikte het doodlopende spoor veel sneller dan anders het geval zou zijn, waardoor hij geen week verspilde aan een dood spoor. Het systeem comprimeerde een week verspilde moeite tot enkele uren.
FrontierMath-benchmarkresultaten
AI co-wiskundige is een workflowtool, geen wiskundige probleemoplosser an sich. Toch is het voor de auteurs belangrijk om hoge benchmarks te tonen, om meerdere redenen:
- Om te laten zien dat de onderliggende wiskundige engine capabel genoeg is om een nuttige samenwerkingspartner te zijn voor grensverleggende wiskunde.
- Om aan te tonen dat benchmarks een gecontroleerde omgeving bieden om te meten hoeveel de orkestratielaag toevoegt.
- Om een proxy te bieden voor samenwerkingsrendement, aangezien er momenteel geen gestandaardiseerde maatstaf bestaat.
De resultaten: AI co-wiskundige scoorde 48% op FrontierMath Tier 4, een benchmark op onderzoeksniveau. Dit is de hoogste score die is gerapporteerd, inclusief Google’s eigen Gemini 3.1 Pro, dat 19% scoorde op dezelfde test, dezelfde tier. Epoch AI vond fouten in ruwweg een derde van de FrontierMath-problemen (over Tiers 1–4) en voert een menselijke review uit.
De AI co-wiskundige scoorde 87% op een interne Google-benchmark bestaande uit 100 niet-gelekte wiskundeproblemen op onderzoeksniveau met code-checkbare antwoorden, afkomstig van professionele wiskundigen, terwijl Gemini 3.1 Pro 57% scoorde en Gemini 3.1 Deep Think 70%.
Bekende beperkingen van de AI co-wiskundige
Het paper is transparant over structurele beperkingen:
- De belangrijkste kwaliteitscontrole komt van revieweragents en bewijsagents. De adversariële reviewcyclus kan een reviewerbevredigende bias vertonen, waarbij agents convergeren op redeneringen die de revieweragent tevredenstellen in plaats van correct te zijn. Dit is een echte structurele kwetsbaarheid.
- Gepolijste LaTeX-output kan een vals gevoel van strengheid geven. Een goed opgemaakt document oogt af, of de onderliggende wiskunde nu klopt of niet.
- Het systeem werkt alleen goed als de onderzoeker echt een domeinexpert is. Er is een gevaar dat een niet-expert een vage vraag aan het systeem geeft en de output blindelings vertrouwt.
- AI-bewijzen vereisen nog steeds menselijke verificatie. De bewijzen van Bérczi, bijvoorbeeld, waren bij publicatie nog in menselijke review.
Slotgedachten
De AI co-wiskundige markeert een verschuiving van AI vragen om een probleem op te lossen naar sámenwerken met AI aan het iteratieve, rommelige proces van wiskundig onderzoek. De echte bottleneck is de workflow-infrastructuur die weerspiegelt hoe wiskundigen daadwerkelijk werken.
Wil je zelf zulke agentische systemen bouwen? De tracks van DataCamp Associate AI Engineer for Developers en Associate AI Engineer for Data Scientists zijn een goed startpunt.
Google AI co-wiskundige: veelgestelde vragen
Hoe verschilt de AI co-wiskundige van ChatGPT of Gemini?
ChatGPT en Gemini zijn conversatietools die zijn geoptimaliseerd voor losse uitwisselingen. De AI co-wiskundige is een stateful werkruimte die parallelle onderzoekstrajecten draait, mislukte pogingen bijhoudt en een wekenlang onderzoek beheert.
Vervangt de AI co-wiskundige wiskundigen?
Nee. Het systeem werkt het best wanneer het wordt gestuurd door een domeinexpert die de output kan beoordelen en herkent wanneer een gebrekkig bewijs een bruikbaar idee bevat.
Wat is een multi-agentsysteem?
Het is een architectuur waarin meerdere gespecialiseerde AI-modellen samenwerken aan een taak. In de AI co-wiskundige behandelen afzonderlijke agents literatuuronderzoek, berekening, bewijsproeven en adversariële review.
Hoe gaat de AI co-wiskundige om met fouten en doodlopende paden?
Mislukte pogingen worden gelogd, versie-gevolgd en geëscaleerd naar de onderzoeker in plaats van weggegooid. In de wiskunde onthult een dood spoor vaak een beperking of wijst het naar een betere route.
Hoe verschilt de output van een standaard AI-antwoord?
Het systeem produceert een gecompileerd LaTeX-document met marge-aantekeningen die beweringen koppelen aan specifieke papers of code-uitvoer, in plaats van ongedocumenteerde tekst. Een rapport wordt pas als afgerond gemarkeerd nadat alle revieweragents het hebben goedgekeurd.
Mark Pedigo, PhD, is een vooraanstaande data scientist met expertise in data science voor de gezondheidszorg, programmeren en onderwijs. Met een PhD in Wiskunde, een B.S. in Computer Science en een Professional Certificate in AI combineert Mark technische kennis met praktische probleemoplossing. In zijn loopbaan werkte hij onder meer aan fraudedetectie, het voorspellen van kindersterfte en financiële forecasting, en leverde hij bijdragen aan NASA’s software voor kostenraming. Als docent gaf hij les bij DataCamp en Washington University in St. Louis en begeleidde hij junior programmeurs. In zijn vrije tijd geniet Mark samen met zijn vrouw Mandy en hond Harley van de buitenlucht in Minnesota en speelt hij jazzpiano.

