Cursus
Op 6 oktober 2026 zette OpenAI 722 wiskundige manuscripten op GitHub. Het resultaat van een interne, niet-uitgebrachte frontiermodel, ze beslaan algebra, getaltheorie, topologie, theoretische informatica en wiskundige logica, allemaal geproduceerd in enkele weken tijd. De schaal was anders dan alles wat de onderzoeksgemeenschap eerder van een AI-systeem had gezien.
Om te begrijpen waarom dit anders binnenkomt dan een benchmarkscore, helpt het om uit te zoomen. Dit is hetzelfde model dat, slechts weken eerder, beweerde het Navier–Stokes Millennium Prize-probleem op te lossen, een resultaat dat volgde op Astra’s eendaagse sweep van tien decennia-oude open problemen in augustus. Elk van die momenten riep zijn eigen vragen op. Maar de release van 6 oktober is iets anders van aard, niet alleen van schaal. OpenAI presenteert 722 manuscripten als daadwerkelijke bijdragen aan de wiskundige onderzoeksliteratuur: geen benchmarkantwoorden, geen competitieresultaten.
Ik volg OpenAI’s wiskundepush sinds de Astra-release in augustus, en deze vergt meer zorg om te ontrafelen dan beide eerdere resultaten. Hieronder bekijken we wat de AI daadwerkelijk heeft geproduceerd, welke resultaten eruit springen, hoe verificatie in de praktijk werkt en waar wiskundigen zich zorgen over maken.
Wat heeft OpenAI’s AI daadwerkelijk bereikt?
OpenAI zette een interne, niet-uitgebrachte frontiermodel in op open wiskundige onderzoeksvragen. Het model scoorde niet alleen goed op een competitietest. Het produceerde wiskundige redeneringen in manuscriptvorm, ingediend op GitHub, samen met Lean-bewijsformaleringen en samenvattingen van de redenering van het model.
Hoog scoren op de AMC- of IMO-benchmarks laat zien dat een AI slimme competitieproblemen aankan. Manuscripten produceren die claimen langdurige open vragen in actieve onderzoeksgebieden op te lossen, is iets anders. De outputs worden gepresenteerd als kandidaatbijdragen aan wiskundige kennis. Of ze de toets der kritiek doorstaan, is een andere vraag, eentje die tijd zal kosten om te beantwoorden.
Hoeveel wiskundige resultaten heeft OpenAI vrijgegeven?
Je ziet meerdere getallen in de berichtgeving, en die zijn niet tegenstrijdig. Ze tellen verschillende dingen.
De repository bevat 722 manuscripten, georganiseerd in 372 resultaatfamilies. Een familie groepeert verwante papers: een hoofdresultaat naast begeleidende redeneringen, alternatieve bewijzen of afgeleide consequenties. Dus 372 families leveren 722 manuscripten op omdat veel resultaten met ondersteunend materiaal komen. De framing “honderden resultaten” is grofweg accuraat; 372 is de preciezere telling van afzonderlijke wiskundige bevindingen.
De README waarschuwt dat sommige resultaten problemen kunnen bevatten, en OpenAI zegt eventuele problemen te zullen herstellen terwijl het Lean-formaliseringen blijft toevoegen. Houd die kanttekening in gedachten, aangezien berichtgeving de getallen stelliger kan laten klinken dan de situatie is.
Op welke gebieden van de wiskunde werkte OpenAI’s AI?
De release beslaat zo’n 20 deelgebieden. Hier is een ruwe kaart van het terrein, omdat sommige van deze gebieden minder bekend zijn voor een technisch-maar-niet-wiskundig publiek:
- Algebra en groepentheorie bestuderen wiskundige structuren die voortkomen uit operaties en hun symmetrieën. Hier landen enkele van de meest besproken resultaten.
- Getaltheorie gaat over de eigenschappen van gehele getallen en priemgetallen. De Riemann-zètafunctie, die de verdeling van priemen codeert, komt in meerdere resultaten voor.
- Topologie bestudeert eigenschappen die blijven bestaan onder continue vervorming. Het Hodge-vermoeden (hieronder meer) zit op het snijvlak van topologie en algebraïsche meetkunde.
- Theoretische informatica stelt fundamentele vragen over rekenen: wat kan worden berekend, hoe efficiënt, en welke problemen zich verzetten tegen efficiënte algoritmen. Het model van OpenAI produceerde meer dan 80 papers in dit gebied alleen al.
- Wiskundige logica onderzoekt de formele fundamenten van wiskundige redenering zelf.
Wat zijn de grootste resultaten?
Hier is enige voorzichtigheid vereist. Er is een echt verschil tussen een resultaat dat de AI genereerde, een bewijs dat door Lean is gecontroleerd, een bewijs dat door een menselijke wiskundige is geverifieerd en een resultaat dat de wiskundige gemeenschap onafhankelijk erkent als een grote vooruitgang. De release mengt alle vier categorieën.
Dat gezegd hebbende, verschillende resultaten hebben oprechte interesse gewekt bij onafhankelijke wiskundigen.
Riemann-zètafunctie: een nieuwe nulvrije regio
De Riemann-hypothese blijft onopgelost. Het model van OpenAI loste die niet op. Wat het naar verluidt vaststelde, is een nieuwe nulvrije regio: aantonen dat er geen nulpunten bestaan voor Re(s) > 11/12. Dit soort partieel resultaat is betekenisvol in de analytische getaltheorie omdat nulvrije regio’s de verdeling van priemen begrenzen. De tekst werd door mensen bewerkt voor leesbaarheid, wat het een opmerkelijke uitzondering maakt op de rest van het manuscriptproductieproces. Een onafhankelijke hercontrole van het gerelateerde quasi-Riemann-resultaat doorstond een eerste inspectie.
Kaplansky’s direct-finiteness-vermoeden in karakteristiek twee
Irving Kaplansky vermoedde decennia geleden dat groepsringen een specifieke algebraïsche eigenschap hebben die direct finiteness heet. Het geval voor karakteristiek twee was bijzonder weerbarstig. Het model loste dit naar verluidt op. Lean-formalisering staat als beschikbaar vermeld.
Isomorfie van vrije groepfactoren
Dit betreft von Neumann-algebra’s, structuren in de functionaalanalyse die bepaalde symmetrieën van kwantumsystemen coderen. De vraag of vrije groepfactoren allemaal isomorf zijn, stond decennia open. Het model beweert een vermoeden van De la Harpe en Voiculescu te beslechten, door te laten zien dat von Neumann-algebra’s van fundamentele groepen van gesloten oriënteerbare oppervlakken van genus ≥ 2 vrije groepfactoren zijn. Een onafhankelijke hercontrole is geslaagd.
Exponent van matrixvermenigvuldiging
Een van de praktisch belangrijkere resultaten: het model stelt naar verluidt vast dat ω ≤ 2,25 over de complexe getallen, waarbij ω de exponent van matrixvermenigvuldiging is. Dit is het wiskundige object achter hoe efficiënt computers matrices kunnen vermenigvuldigen, een probleem met reële implicaties voor algoritmen in de hele informatica. Opmerkelijk voor iedereen met een achtergrond in finance of engineering: de efficiëntie van matrixvermenigvuldiging ligt aan de basis van vrijwel elke numerieke berekening op schaal.
Mézard–Parisi-formule voor verdunde spin glasses
Statistische fysica ontmoet waarschijnlijkheidstheorie: dit gaat over de vrije energie van wanordelijke magnetische systemen. De Mézard–Parisi-formule was wel vermoed, maar niet volledig bewezen in het verdunde geval.
Hodge-vermoeden voor CM-abelse variëteiten
Een beperkte casus van een van de zeven Millennium Prize-problemen. Het Hodge-vermoeden vraagt of bepaalde topologische kenmerken van algebraïsche variëteiten altijd algebraïsch kunnen worden gerepresenteerd. Het model stelt dit naar verluidt vast voor CM-abelse variëteiten, een specifieke, gestructureerde klasse. Dit is niet het volledige Hodge-vermoeden, dat open blijft, maar een speciaal geval waar wiskundigen naartoe werkten. Dit resultaat werd ook aangemerkt als een uitzondering op de standaardproductieprocedure.
Het resultaat over spontane magnetisatie voor de kwantum-Heisenberg-ferromagneet en de quasipolynomiale grenzen voor rekenkundige progressies hebben beide interesse gewekt bij onderzoekers die de release evalueren, al zal alomvattende onafhankelijke verificatie aanzienlijke tijd vergen.
Hoe produceerde OpenAI’s AI de resultaten?
OpenAI heeft meer methodologische details gepubliceerd dan bij sommige eerdere releases, al is het beeld nog onvolledig.
Het model kreeg gedurende de evaluatie ongeveer 4.000 problemen voorgelegd. De meeste resultaten kwamen voort uit een vaste procedure met hetzelfde interne model. Twee resultaten weken af van dat standaardproces: het werk rond de nulvrije regio voor de Riemann-zètafunctie en het Hodge-vermoeden voor CM-abelse variëteiten. Het gemiddelde resultaat gebruikte rekenkracht ruwweg gelijk aan drie uur ChatGPT Pro-denktijd. Dat is een nuttig referentiepunt, maar lees het niet alsof elk probleem drie uur kostte. Het getal beschrijft de gemiddelde compute per resultaat, niet de totale verstreken tijd of de kosten van mislukte pogingen.
Ter context: deze methodologie is aanzienlijk systematischer dan wat eraan voorafging. Toen Astra in augustus tien open problemen oploste, kostte elke oplossing naar verluidt circa $2.000 aan inferentie. Daarvóór verbruikte de Navier–Stokes-sprint 10.000 parallelle agenten die 88 uur draaiden tegen een geschatte $22,5 miljoen aan totale compute, een brute-forceaanpak die zowel een resultaat als een aanzienlijk kredietgeschil opleverde. De release van 6 oktober oogt minder als een sprint en meer als een duurzaam onderzoeksprogramma: lagere compute per resultaat, bredere dekking, een doordachte structuur rond families van verwante resultaten.
OpenAI heeft redeneersamenvattingen voor 10 resultaten vrijgegeven, samen met compute-schattingen en statistieken over de gepoogde problemen. De Advisory Group on Mathematics and Artificial Intelligence riep op om verder te gaan en alle prompts en volledige denkketens vrij te geven. Er gaapt een kloof tussen wat OpenAI heeft geleverd en wat sommigen in de wiskundige gemeenschap willen zien.
Hoe werden de wiskundige bewijzen van OpenAI geverifieerd?
Verificatie is waarschijnlijk het meest ingrijpende deel van dit verhaal. Het is de moeite waard precies te zijn over de verschillende lagen.
Lean-formalisering
Lean is een programmeertaal en bewijshulp waarmee wiskundige bewijzen kunnen worden uitgedrukt in een vorm die een computer mechanisch kan controleren. Als een bewijs in Lean controleert, zijn de logische stappen formeel correct gegeven de gestelde aannames. Veel van de 722 manuscripten hebben bijbehorende Lean-formaliseringen, al niet allemaal.
Wat Lean-verificatie vaststelt, is formele correctheid. Wat het niet vaststelt, is of de formele stelling de beoogde wiskundige vraag nauwkeurig weergeeft, of het resultaat werkelijk nieuw is, of dat de redenering betekenisvol is voor wiskundigen die erop willen voortbouwen.
Menselijke wiskundige verificatie
Hier vertraagt het proces. Wiskundigen moeten nog bepalen of de formele stelling daadwerkelijk het open probleem vangt waarop het zegt te doelen, of de bewijsstrategie nieuw is en of het resultaat nieuw is ten opzichte van de bestaande literatuur. Dana Moshkovitz, een complexiteitstheoreticus, beschreef de manuscripten als "alsof ze zijn geschreven door iemand die op psychedelica is" en moeilijk genoeg om te lezen zonder AI-hulp, terwijl ze ook erkende dat er veel van te leren valt. Technische correctheid naast moeilijk te doorgronden expositie creëert echt werk voor menselijke verificateurs.
Peerreview en onafhankelijke verificatie
Publiceren op GitHub is geen peerreview. De adviesraad stelde duidelijk dat de release "het begin, niet de voltooiing" vertegenwoordigt van het proces van menselijk begrip en het inbedden van het werk in wiskundige kennis. Met 722 manuscripten over 20 deelgebieden is alomvattende onafhankelijke evaluatie een jarenlang project.
Formele correctheid, wiskundig begrip, originaliteit en wetenschappelijke belangrijkheid zijn allemaal afzonderlijke vragen. Een door Lean geverifieerd bewijs kan aan het eerste voldoen zonder een van de andere te beslechten.
Hoeveel van de wiskunde is echt door AI gedaan?
Hier is geen eenduidig antwoord op.
Mensen kozen of formuleerden veel van de problemen die aan het model werden voorgelegd. De bestaande wiskundige literatuur bood de intellectuele context waarin de AI werkte. Het model genereerde de wiskundige redeneringen. Menselijke onderzoekers hielpen bij het voorbereiden van manuscripten, en Lean formaliseerde de bewijzen. Dus “wie deed de wiskunde?” beslaat een keten van bijdragen in plaats van op één partij neer te komen.
Sommige wiskundigen hebben een scherpere zorg geuit: dat het model soms bestaande lijnen van menselijk onderzoek voltooit in plaats van zelfstandig een nieuwe aanpak te ontdekken. Dit speelde acuut op na de Navier–Stokes-claim. Wiskundige Tristan Buckmaster, wiens eigen AI-ondersteunde werk aan verwante vergelijkingen uren vóór OpenAI’s aankondiging verscheen, stelde ernstige vragen over krediet. Hij stelde dat een jaar van zijn ongepubliceerde werk, willens en wetens of niet, de richting van OpenAI’s sprint had bepaald; OpenAI ontkende toegang tot privéprompts of ongepubliceerd onderzoek. Dat geschil blijft onopgelost. Dezelfde zorg, over op wiens intellectuele basis een AI-resultaat feitelijk voortbouwt, geldt voor de oktoberrelease, zelfs waar geen individuele onderzoeker wordt genoemd.
Econoom Joshua Gans heeft een nuttig kader voorgesteld: wiskundige ontdekking kent drie fasen. Kies het probleem, los het probleem op, begrijp en pas het resultaat toe. AI kan in toenemende mate de middelste stap automatiseren. Dat heft het onderscheid tussen menselijke en machinale bijdrage niet op, maar herverdeelt wel waar de inspanning heen gaat.
Waarom maken wiskundigen zich zorgen?
De zorgen zijn niet uniform. Het zou onjuist zijn om de wiskundige gemeenschap simpelweg als AI-resistent te omschrijven. Hier is waar de ernstigste critici zich werkelijk zorgen over maken.
Begrip kan achterlopen op ontdekking
Wanneer een menselijke wiskundige een bewijs produceert, levert het proces doorgaans hulpmiddelen, intuïties en inzichten op die deel gaan uitmaken van de wiskundige cultuur. Wanneer een model een correct maar ondoorzichtig bewijs produceert, bestaat het resultaat zonder dat omringende begrip. Terence Tao, die vóór de Navier–Stokes-aankondiging expliciet waarschuwde voor de opportuniteitskosten van het veranderen van historisch productieve open problemen in virale benchmarkmomenten, heeft de zorg geuit dat het opstapelen van correcte antwoorden zonder te begrijpen hoe of waarom ze waar zijn, de wiskunde op lange termijn schaadt als praktijk. Dat is niet alleen een esthetisch probleem.
Honderden resultaten zijn moeilijk te beoordelen
De beoordelingscapaciteit van de wiskundige gemeenschap is eindig. Wanneer een AI sneller onderzoek kan genereren dan die gemeenschap het kan evalueren, ontstaat een achterstand die vertekent hoe wiskundige kennis wordt vastgesteld. Een criticus beschreef de release als "verdacht Gish Gallopy", waarbij het terrein wordt overspoeld met zoveel manuscripten dat fouten jarenlang onbetwist kunnen blijven. Deze zorg heeft een recent precedent: Astra’s tien-problemenrelease in augustus is maanden later nog niet volledig peer-gereviewd. Tweeënzeventig keer dat volume is een categorisch andere uitdaging.
Bestaand menselijk onderzoek en krediet
Een aantal resultaten bouwt voort op specifiek eerder werk van bij naam genoemde onderzoekers. Hoe die intellectuele schuld wordt weergegeven, is echt omstreden. De Navier–Stokes-episode maakte dit concreet: een onderzoeker besteedde een jaar aan ongepubliceerd werk dat mogelijk een multi-miljoenen AI-sprint vormgaf, en kreeg vervolgens vragen over zijn loopbaan. De aanbevelingen van de adviesgroep gingen om deze reden specifiek in op citatieprocedures.
Propriëtaire modellen creëren ongelijke toegang
Het model dat deze resultaten produceerde, is niet openbaar beschikbaar. Academische wiskundigen die op dit capaciteitsniveau willen werken, hebben niet dezelfde tools als de interne teams van OpenAI. De aanbevelingen van de adviesgroep van 29 september vroegen AI-labs expliciet om te stoppen met het testen van geavanceerde wiskundige problemen op propriëtaire modellen die niet toegankelijk zijn voor de bredere onderzoeksgemeenschap. OpenAI erkende de aanbeveling zonder die volledig over te nemen.
Wiskundig onderzoek kan zich concentreren binnen AI-labs
Als de frontier van wiskundige ontdekking toegang vereist tot frontier-compute en propriëtaire modellen, dan kunnen de beslissingen over welke problemen belangrijk zijn en welke resultaten worden uitgelicht, in toenemende mate binnen een klein aantal private organisaties worden genomen. Dat is een heel andere structuur dan de wiskunde historisch heeft gehad.
Dit zijn zorgen die door leden van de wiskundige gemeenschap naar voren zijn gebracht, geen vaststaande conclusies, en niet alle wiskundigen delen ze in gelijke mate.
OpenAI’s nieuwe aanpak voor het publiceren van AI-wiskunde
OpenAI heeft enkele stappen gezet om de zorgen van de gemeenschap te adresseren, al vraagt de adviesgroep om meer.
De release is gepubliceerd op GitHub onder een Apache-2.0-licentie met revisieprotocollen. Eerdere versies blijven toegankelijk wanneer correcties worden aangebracht. Elk manuscript bevat een BibTeX-blok voor citatie. Lean-formaliseringen vergezellen veel resultaten. OpenAI publiceerde redeneersamenvattingen voor 10 resultaten en compute-schattingen uitgedrukt in ChatGPT Pro-uren.
OpenAI raadpleegde de Advisory Group on Mathematics and Artificial Intelligence aan het Institute for Advanced Study gedurende deze release. De groep omvat Melanie Matchett Wood (Harvard), Edward Witten (IAS), Ravi Vakil (Stanford), Ulrike Tillmann (Oxford) en anderen, negen prominente wiskundigen die onafhankelijk opereren en niet door OpenAI worden betaald.
Hun standpunt is dat de release een startpunt is. Melanie Wood omschreef het als "het begin, niet de voltooiing, van het proces van menselijk begrip." De groep riep OpenAI op alle prompts en volledige denkketens vrij te geven, wetenschappelijke repositories met persistente citeerbare identifiers te gebruiken in plaats van GitHub, en de ontwikkeling van menselijk begrip te ondersteunen via instellingen die niet door AI-labs worden gecontroleerd. OpenAI heeft toegezegd naar die standaarden toe te werken. Het voldoet daar nog niet volledig aan.
Wat betekent AI voor de rol van wiskundigen?
De interessantere vraag is niet of AI wiskundigen vervangt. Dat doet het niet, althans nog niet, en mogelijk niet op de manieren die het meest tellen. De interessantere vraag is hoe wiskundig werk verandert wanneer het genereren van bewijzen dramatisch goedkoper wordt.
Terug naar het kies → los op → begrijp-kader: als AI in toenemende mate de oplossingsstap verzorgt, wordt menselijke expertise waardevoller aan de randen. Bepalen welke problemen het waard zijn om na te streven, goede vermoedens formuleren, interpreteren wat een resultaat betekent, een nieuwe vondst verbinden met bestaande wiskunde, ontdekkingen toepassen in nieuwe contexten. Dat zijn de stadia waar menselijk oordeel onmisbaar blijft. Zoals ik in mijn stuk over Astra’s resultaten in augustus besprak, is de vaardigheid om een goed probleem te stellen en te weten welke de moeite waard is om aan te pakken precies wat AI nog niet kan repliceren. Die observatie is sindsdien alleen maar relevanter geworden.
Wiskundige Mehtaab Sawhney, die in 2026 bij OpenAI kwam na bij Columbia te hebben gewerkt, merkte op dat naarmate AI ontdekking versnelt, de primaire bottleneck voor menselijke wiskundigen verschuift van het genereren van bewijzen naar het absorberen en contextualiseren van door AI gegenereerde wiskunde.
Wat verandert wanneer het genereren van bewijzen goedkoper wordt, is waar de schaarste naartoe gaat. De schaarse hulpbron is in toenemende mate niet het vermogen om dingen te bewijzen, maar het vermogen om de juiste dingen te kiezen om te bewijzen en te begrijpen waarom hun oplossingen ertoe doen.
Conclusie
De release van 6 oktober is het best te begrijpen als de nieuwste stap in een traject dat het hele jaar versnelt. In augustus loste Astra tien decennia-oude problemen op in één dag. In september leverde een sprint van 88 uur met 10.000 agenten een betwiste maar door Lean geverifieerde claim op over de Navier–Stokes-variant van het Millennium Prize-probleem op, samen met een onopgelost kredietgeschil dat echte spanningen rond AI en onafhankelijk onderzoek blootlegde. Nu, in oktober, heeft hetzelfde frontiermodel in enkele weken 722 manuscripten over 20 deelgebieden geproduceerd.
Sommige van die resultaten — de nulvrije regio voor Riemann-zèta, de matrixvermenigvuldigingsgrens, de isomorfie van vrije groepfactoren — hebben al serieuze aandacht getrokken van wiskundigen die deze gebieden goed kennen. Maar het aantal manuscripten is niet het verhaal. Wat telt is of individuele resultaten standhouden, of ze echt nieuw zijn en of de wiskundige gemeenschap ze kan absorberen. Lean-verificatie stelt formele correctheid vast, geen wiskundig begrip. Publicatie op GitHub is geen peerreview. Met 722 manuscripten zal alomvattende onafhankelijke evaluatie jaren duren.
Het veld staat nu voor een vraag die het niet eerder hoefde te stellen: niet of AI moeilijke wiskundeproblemen kan oplossen, maar wat er gebeurt als het wiskundig onderzoek kan produceren sneller dan mensen het kunnen evalueren. Als het genereren van bewijzen goedkoop genoeg wordt om de onderzoeksliteratuur te overspoelen, verschuift de schaarse hulpbron van antwoorden genereren naar de juiste vragen kiezen en begrijpen waarom die antwoorden ertoe doen. Dat verandert wat wiskunde van wiskundigen vraagt. Niet het einde van het werk.
Vinod Chugani begon zijn carrière in Tokio als JPMorgans jongste Head van de Hedge Fund Sales Desk en vestigde later een individueel verkooprecord bij Lehman Brothers, bouwde daarna een elektronicadistributiebedrijf in 30 landen uit tot voorbij SG$100 miljoen omzet en maakte vervolgens de overstap naar data. Als afgestudeerde Economie aan Duke en alumnus van de NYC Data Science Academy was hij een van de drie beursontvangers uit meer dan 100 aanmeldingen voor Hugo Bowne-Andersons Building AI Applications-cursus op Maven. Tegenwoordig schrijft hij voor DataCamp, KDnuggets, Machine Learning Mastery en Statology over onderwerpen van statistiek tot agentische AI, en coacht hij dataprofessionals bij de NYC Data Science Academy met meer dan 1.000 één-op-één-sessies op zijn naam.
FAQs
Wat heeft OpenAI precies vrijgegeven op 6 oktober 2026?
OpenAI publiceerde 722 wiskundige manuscripten, geproduceerd door een interne, niet-uitgebrachte frontiermodel, georganiseerd in 372 resultaatfamilies in een openbare GitHub-repository. De release omvatte Lean-bewijsformaliseringen voor veel resultaten, redeneersamenvattingen voor 10 daarvan, compute-schattingen en citatieblokken. De resultaten bestrijken algebra, getaltheorie, topologie, theoretische informatica en wiskundige logica — in totaal grofweg 20 deelgebieden.
Waarom noemen berichten 337, 372 en 722 resultaten? Welk getal klopt?
Alle drie de aantallen verwijzen naar verschillende zaken. De 722 is het aantal individuele manuscripten. De 372 is het aantal resultaatfamilies — groepen verwante papers die een hoofdresultaat plus begeleidende bewijzen, alternatieve benaderingen of consequenties bevatten. Het getal 337 duikt in sommige berichtgeving op als de telling van afzonderlijke wiskundige resultaten; variaties ontstaan door hoe nauw verwante resultaten worden meegeteld. Het nuttigste getal hangt af van wat je meet. Voor breedte is 372 families de duidelijkste samenvatting.
Wat is Lean, en wat bewijst Lean-verificatie precies?
Lean is een programmeertaal en bewijshulp waarmee wiskundige bewijzen kunnen worden uitgedrukt in een formele taal die een computer stap voor stap kan controleren. Een door Lean geverifieerd bewijs is formeel correct gegeven de gestelde aannames — er bestaan geen logische hiaten in de redeneringsketen zoals opgeschreven. Wat Lean niet vaststelt, is of de formele stelling de wiskundige vraag die ze moet beantwoorden nauwkeurig vangt, of het resultaat werkelijk nieuw is ten opzichte van bestaand werk, of dat het bewijs betekenisvol is voor menselijke wiskundigen die het moeten gebruiken en erop voortbouwen. Die vragen vergen menselijk oordeel.
Heeft een onafhankelijke wiskundige deze resultaten bevestigd?
De verificatie is ongelijk en loopt nog. De ontwikkelaarsgemeenschap meldde dat een onafhankelijke hercontrole van het quasi-Riemann-resultaat (familie 003) een eerste inspectie doorstond. Verscheidene resultaten uit OpenAI’s eerdere augustusrelease (een afzonderlijke publicatie van 10 resultaten) zijn gecontroleerd door bij naam genoemde wiskundigen, waaronder Thomas Bloom, Tim Gowers en Noga Alon. Voor de oktoberrelease van 722 manuscripten zal alomvattende onafhankelijke beoordeling over alle resultaten aanzienlijk langer duren — het volume alleen al maakt dat tot een jarenlang project voor de wiskundige gemeenschap. De adviesgroep beschreef de release als "het begin, niet de voltooiing" van het proces van verificatie en begrip.
Wat is de Advisory Group on Mathematics and Artificial Intelligence?
Het is een onafhankelijke groep, gehuisvest bij het Institute for Advanced Study in Princeton, opgericht nadat OpenAI’s Navier–Stokes-claim in september 2026 aanzienlijke tegenreactie van wiskundigen uitlokte. Leden zijn onder meer Melanie Matchett Wood (Harvard), Edward Witten (IAS), Ravi Vakil (Stanford), Ulrike Tillmann (Oxford) en anderen. Ze worden niet door OpenAI betaald en opereren onafhankelijk. Hun rol is adviseren over hoe AI-wiskundige resultaten moeten worden vrijgegeven en beoordeeld — niet om OpenAI’s interne onderzoek te vertragen. De aanbevelingen van 29 september vroegen om meer transparantie dan OpenAI nu biedt, waaronder volledige openbaarmaking van prompts en denkketens en het gebruik van wetenschappelijke repositories in plaats van GitHub.
Welke zorgen hebben wiskundigen geuit over deze release?
De zorgen vallen in een paar categorieën. Ten eerste dat correcte maar ondoorzichtige bewijzen zich opstapelen zonder het omliggende begrip — tools, intuïties, technieken — dat normaal uit menselijk wiskundig werk voortkomt. Ten tweede dat 722 manuscripten de beoordelingscapaciteit van de gemeenschap overstijgen, waardoor een achterstand ontstaat die fouten onbetwist kan laten. Ten derde dat krediet voor eerder menselijk onderzoek dat AI-resultaten onderbouwt, onderbelicht wordt. Ten vierde dat propriëtaire modellen AI-labs onderzoeksvermogens geven die academische wiskundigen niet hebben, waardoor de frontier van ontdekking zich binnen een klein aantal organisaties concentreert. Dit zijn zorgen, geen vaststaande conclusies — niet alle wiskundigen delen ze in gelijke mate.
Hoe verhoudt deze release zich tot eerdere wiskundige resultaten van OpenAI?
De release van 6 oktober maakt deel uit van een reeks. In mei 2026 weerlegde een OpenAI-model het unit distance-vermoeden van Erdős. Op 1 augustus publiceerde OpenAI tien resultaten over open problemen, waaronder het weerleggen van Connes’ rigiditeitsvermoeden en het construeren van de eerste niet-sofische groep. Op 8 september claimde hetzelfde interne frontiermodel dat de oktoberrelease produceerde, het Navier–Stokes Millennium Prize-probleem op te lossen. De oktoberrelease vertegenwoordigt een veel grootschaligere versie van waar OpenAI in 2026 naartoe heeft gewerkt — van individuele showcaseresultaten naar bulkproductie van wiskundige manuscripten over de onderzoeksliteratuur heen.
Als AI bewijzen kan genereren, wat doen wiskundigen dan nog?
De meest bruikbare framing komt van nadenken over wiskundige ontdekking als drie fasen: het probleem kiezen, het probleem oplossen en het resultaat begrijpen en toepassen. AI kan in toenemende mate de oplossingsstap verzorgen. Wat daardoor belangrijker wordt — niet minder — is menselijke expertise aan de randen: beslissen welke problemen het waard zijn om na te streven, productieve vermoedens formuleren, interpreteren wat een resultaat in context betekent, nieuwe bevindingen verbinden met bestaande wiskunde en inzichten over velden heen communiceren. Wanneer het genereren van bewijzen goedkoper wordt, verschuift de schaarse hulpbron naar oordeel over wat te bewijzen en waarom het antwoord ertoe doet.

