课程
2026 年 10 月 6 日,OpenAI 在 GitHub 上发布了 722 篇数学手稿。它们出自一款尚未发布的内部前沿模型,涵盖代数、数论、拓扑、理论计算机科学和数理逻辑,全部在数周内完成。这一规模前所未有,超出研究界此前对 AI 系统的认知。
要理解这为何不同于一次基准测试成绩,不妨拉远视角。就在几周前,同一模型声称解决了纳维-斯托克斯千禧难题;在此之前,Astra 在 8 月用一天时间横扫十个悬而未决数十年的公开问题。每一刻都引发了各自的疑问。但 10 月 6 日的发布在性质上不同,不仅是规模。OpenAI 将 722 篇手稿作为对数学研究文献的真实贡献来呈现——不是基准答卷,也不是竞赛解答。
自 8 月 Astra 发布以来,我一直在追踪 OpenAI 的数学推进。这次比之前的两次结果更需要谨慎拆解。下文我们将关注 AI 实际产出了什么、哪些结果最突出、验证在实践中如何进行,以及数学家们在担心什么。
OpenAI 的 AI 实际完成了什么?
OpenAI 将一款尚未发布的内部前沿模型指向开放的数学研究问题。该模型不仅是在竞赛测试中取得高分,而是产出了以手稿形式组织的数学论证,同时提交了 Lean 证明形式化以及对模型推理的摘要。
在 AMC 或 IMO 基准上拿高分说明 AI 能处理巧妙设计的竞赛题。产出声称解决活跃研究领域长期悬而未决问题的手稿,则是另一回事。这些输出被作为对数学知识的候选性贡献来呈现。它们能否经得住审查是另一个问题,答案需要时间。
OpenAI 发布了多少数学结果?
您会在报道中看到若干数字,它们并不矛盾,而是在计数不同的事物。
该仓库包含 722 篇手稿,组织为 372 个“结果家族”。一个家族将相关论文分组:主结果以及配套论证、替代证明或下游推论。因此 372 个家族对应 722 篇手稿,因为许多结果附带支撑材料。“数百个结果”的表述大致准确;372 是更精确的不同数学发现的计数。
README 提醒部分结果可能存在问题,OpenAI 表示将修复此类问题并持续补充 Lean 形式化。随着报道让这些数字听起来比实际更确定,请牢记这一保留。
OpenAI 的 AI 涉及了数学的哪些领域?
此次发布覆盖约 20 个数学分支。为便于技术背景但非数学专业的读者把握版图,下面做一个粗略导览:
- 代数与群论研究由运算及其对称性构成的数学结构。部分讨论度最高的结果出现在这里。
- 数论关注整数与素数的性质。编码素数分布的黎曼ζ函数在若干结果中出现。
- 拓扑学研究在连续变形下保持不变的性质。霍奇猜想(下文详述)处于拓扑与代数几何的交汇处。
- 理论计算机科学探问计算的基本问题:能计算什么、多高效、哪些问题抗拒高效算法。OpenAI 的模型仅在这一领域就产出了 80 多篇论文。
- 数理逻辑审视数学推理本身的形式基础。
有哪些最重大的结果?
这里需要格外谨慎。AI 生成的结果、Lean 检查通过的证明、人类数学家验证的证明,以及数学共同体独立认可为重大进展的结果之间,存在真实差别。此次发布混合了这四类。
尽管如此,一些结果确实引起了独立数学家的真切兴趣。
黎曼ζ函数:一个新的零点无区域
黎曼猜想仍未被解决。OpenAI 的模型并未解决它。据报道,其确立了一个新的零点无区域:证明在 Re(s) > 11/12 上不存在零点。这类部分性结果在解析数论中是有意义的,因为零点无区域会约束素数的分布。该稿件为提高可读性经过人工编辑,成为与其他手稿制作流程不同的显著特例。相关的“类黎曼”结果的独立复核通过了初步检视。
特征为 2 时的 Kaplansky 直接有限性猜想
Irving Kaplansky 数十年前猜想群环具有一种称为直接有限性的特定代数性质。特征为 2 的情形尤其顽固。据报道,该模型已解决。Lean 形式化列为可用。
自由群因子的同构性
这涉及冯诺依曼代数——泛函分析中编码量子系统某些对称性的结构。自由群因子是否都同构的问题已悬而未决数十年。该模型声称解决了 de la Harpe 和 Voiculescu 的一个猜想,证明属数 ≥ 2 的闭定向曲面基本群的冯诺依曼代数是自由群因子。独立复核通过。
矩阵乘法指数
较具实践意义的结果之一:该模型据称在复数域上确立了 ω ≤ 2.25,其中 ω 为矩阵乘法指数。它决定了计算机能以多高效率进行矩阵相乘,这对计算机科学中的各类算法有现实影响。对金融或工程背景的读者而言值得注意:矩阵乘法效率几乎支撑了所有大规模数值计算。
稀疏自旋玻璃的 Mézard–Parisi 公式
统计物理遇见概率论:涉及无序磁性系统的自由能。Mézard–Parisi 公式在稀疏情形下一直处于猜想状态,未被完全证明。
CM 阿贝尔簇的霍奇猜想
七大千禧难题之一的受限情形。霍奇猜想询问代数簇的某些拓扑特征是否总能以代数方式表示。据报道,模型在一个特定且结构化的类别——CM 阿贝尔簇上确立了该猜想。这不是完整的霍奇猜想(仍未解决),而是数学家一直努力推进的一个特例。该结果同样被标注为偏离标准制作流程的特例。
量子海森堡铁磁体的自发磁化结果,以及关于等差数列的拟多项式界,也引发了评估此次发布的研究者的兴趣,但全面的独立验证将耗费相当长的时间。
OpenAI 的 AI 是如何产出这些结果的?
与早些发布相比,OpenAI 公布了更多方法细节,尽管全貌仍不完整。
在评估期间,模型被提出了约 4,000 个问题。大多数结果来自一套固定流程,使用同一内部模型。有两个结果偏离了标准流程:黎曼ζ零点无区域的工作,以及 CM 阿贝尔簇的霍奇猜想。平均每个结果使用的算力大致相当于 ChatGPT Pro 思考三小时。这是一个有用的参照,但并不意味着每个问题都花了三小时。该数字描述的是每个结果的平均算力消耗,而非总耗时或失败尝试的成本。
作为对比,这一方法论显著比此前更为系统。Astra 在 8 月解决十个公开问题时,据称每个解答的推理成本约为 2,000 美元。在此之前,纳维-斯托克斯冲刺耗费了10,000 个并行代理运行 88 小时,估算总算力成本 2,250 万美元,这是一种蛮力路径,既产出结果,也引发了严峻的署名争议。10 月 6 日的发布更像一项持续的研究计划:更低的单结果算力、更广的覆盖、围绕结果家族的刻意结构化。
OpenAI 为 10 个结果发布了推理摘要,同时给出了算力估算以及对尝试问题的统计。数学与人工智能咨询小组呼吁更进一步,发布所有提示词与完整思维链。OpenAI 提供的内容与数学界期望看到的之间,仍存在差距。
OpenAI 的数学证明如何被验证?
验证或许是这件事最关键的部分。值得精确区分不同层次。
Lean 形式化
Lean 是一种编程语言与证明助理,允许将数学证明表达为计算机可机械检验的形式。若证明在 Lean 中检查通过,则在所述假设下逻辑步骤是形式正确的。722 篇手稿中的许多附有 Lean 形式化,但并非全部。
Lean 验证所确立的是形式正确性。它不能确立的是:形式陈述是否准确代表了预期的数学问题、结果是否真正新颖、或推理对于希望在其上继续构建的数学家是否具备意义。
人类的数学验证
这一步会放慢脚步。数学家仍需判断形式陈述是否实际捕捉到所声称针对的公开问题、证明技巧是否新颖、结果相对既有文献是否具有新意。复杂性理论家 Dana Moshkovitz 将这些手稿形容为“像是某个嗑药的人写的”,没有 AI 帮助也很难读,同时也承认其中有许多可学习之处。技术上的正确与难以解析的表述并存,给人类验证者带来实在的工作量。
同行评审与独立验证
在 GitHub 上发布并不等于同行评审。顾问委员会直言,此次发布代表着“人类理解并将该工作纳入数学知识过程的开始,而非完成”。跨越 20 个分支的 722 篇手稿,要实现全面的独立评估,将是一个以年计的工程。
形式正确性、数学理解、新颖性与科学重要性是彼此独立的问题。一篇通过 Lean 验证的证明可以满足第一点,而对其余各点仍未定论。
这些数学究竟有多少是由 AI 完成的?
没有一个干净利落的答案。
人类选择或构造了许多提交给模型的问题。既有数学文献提供了 AI 工作的智识语境。模型生成了数学论证。人类研究者帮助准备手稿,Lean 对证明进行形式化。所以“是谁做了这份数学?”覆盖的是一条贡献链,而非归于某一方。
一些数学家提出了更尖锐的担忧:模型有时可能是在补全现有的人类研究思路,而非独立发现一种全新方法。这在纳维-斯托克斯声明后尤为突出。数学家 Tristan Buckmaster 的相关方程的 AI 辅助工作在 OpenAI 公告前数小时发表,他对署名问题提出了严厉质疑。他声称自己一年的未发表工作有意无意间影响了 OpenAI 的冲刺方向;OpenAI 否认访问过任何私有提示或未发表研究。该争议仍未解决。同样的关切——AI 结果究竟建立在谁的智识基础之上——也适用于 10 月的发布,即便没有点名某一位研究者。
经济学家 Joshua Gans 提出了一个有用框架:数学发现有三个阶段。选择问题、解决问题、理解并应用结果。AI 可能会越来越多地自动化中间这一步。这并不抹平人机贡献的区分,但确实重分配了努力的着力点。
数学家为何担忧?
担忧并不一致。将数学共同体简单描述为抗拒 AI 并不准确。以下是最严肃的批评者真正关心的问题。
理解可能滞后于发现
当人类数学家给出证明时,这一过程通常会生成工具、直觉与洞见,成为数学文化的一部分。当模型给出一个正确但不透明的证明时,结果存在,却缺少周边的理解。Terence Tao 在纳维-斯托克斯公告之前就明确警告:将历史上富有产出的公开问题变成病毒式传播的基准时刻,其机会成本很高。他担心长期来看,积累“正确答案”却不理解其“如何与为何”为真,会伤害数学这一实践。这不只是审美问题。
数百个结果难以审阅
数学共同体的同行评审能力是有限的。当 AI 的研究产出速度快于共同体的评估能力,就会形成积压,扭曲数学知识的确立方式。一位批评者称此次发布“可疑地像 Gish Gallop”,用海量手稿“淹没战场”,让错误可能多年不被挑战。这一担忧有近例可循:Astra 在 8 月发布的十个问题,几个月后也尚未完全同行评审。其 72 倍的量级是完全不同的挑战。
现有的人类研究与署名
不少结果建立在特定学者的既有工作之上。如何体现这份智识债务,确实存在争议。纳维-斯托克斯事件让这一问题具象化:一位研究者花了一年在未发表工作上,可能影响了一次数百万美元的 AI 冲刺,却最终要面对关于其职业发展的质疑。顾问小组的建议中特别因此涉及引用程序。
专有模型造成不平等的获取
产出这些结果的模型并未公开。希望在这一能力水平上开展工作的学术数学家,手头并无与 OpenAI 内部团队同等的工具。顾问小组在 9 月 29 日的建议中明确要求 AI 实验室停止在学界无法获取的专有模型上测试高级数学问题。OpenAI 认可了这一建议,但未完全采纳。
数学研究可能集中于 AI 实验室内部
如果数学发现的前沿需要前沿算力与专有模型,那么关于哪些问题重要、哪些结果应该被传播的决策,可能会越来越多地由少数私营机构作出。这与数学的历史结构大不相同。
这些是数学共同体成员提出的担忧,而非既定结论,且并非所有数学家同等认同。
OpenAI 发布 AI 数学的新做法
OpenAI 已采取一些举措回应共同体的关切,但顾问小组认为还需更多。
此次发布在 GitHub 上以 Apache-2.0 许可发布,并附有修订流程。更正后仍保留先前版本。每篇手稿包含用于引用的 BibTeX 块。许多结果附有 Lean 形式化。OpenAI 为 10 个结果发布了推理摘要,并以 ChatGPT Pro 小时数形式给出算力估计。
OpenAI 在整个发布过程中咨询了高级研究院(IAS)的“数学与人工智能咨询小组”。该小组成员包括 Melanie Matchett Wood(哈佛)、Edward Witten(IAS)、Ravi Vakil(斯坦福)、Ulrike Tillmann(牛津)等,共 9 位知名数学家,独立运作且未从 OpenAI 领取报酬。
他们的立场是:这次发布是一个起点。Melanie Wood 将其描述为“人类理解过程的开始,而非完成”。小组呼吁 OpenAI 发布所有提示词与完整思维链,使用具有持久可引用标识符的学术存储库而非 GitHub,并通过不受 AI 实验室控制的机构来支持人类理解的发展。OpenAI 承诺将努力达成这些标准,但尚未全部实现。
AI 对数学家角色意味着什么?
更有趣的问题不在于 AI 是否取代数学家。至少目前没有,且很可能不会在最重要的方面。更有趣的是:当证明生成的成本大幅降低,数学工作的方式将如何变化。
回到“选择 → 解决 → 理解”这一框架:如果 AI 日益承担“解决”这一步,那么人类在两端的专长价值更高。决定哪些问题值得追求、提出好的猜想、解释结果意味着什么、将新发现与既有数学相连、在新语境中应用发现。这些阶段仍离不开人类判断。正如我在 8 月 Astra 结果的文章中所述,提出一个好问题并知道哪个值得攻克,正是 AI 尚无法复制的能力。这一点自那时以来更为重要。
数学家 Mehtaab Sawhney 在哥伦比亚大学工作后于 2026 年加入 OpenAI。他指出,随着 AI 加速发现,人类数学家的主要瓶颈正从“生成证明”转向“吸收并将 AI 生成的数学置于语境中”。
当证明生成变得更便宜时,稀缺性也会转移。稀缺资源可能不再是“证明能力”,而越来越是“选择要证明什么并理解其重要性的能力”。
结语
最好将 10 月 6 日的发布理解为全年不断加速轨迹中的最新一步。8 月,Astra 在一天内解决了十个数十年未决的问题。9 月,一次 88 小时、10,000 代理的冲刺产出了对纳维-斯托克斯千禧难题变体的一个经 Lean 验证但存在争议的主张,同时伴随一场未解的署名争议,暴露了 AI 与独立研究之间的真实张力。如今 10 月,同一前沿模型在数周内于 20 个分支产出了 722 篇手稿。
其中一些结果——黎曼ζ零点无区域、矩阵乘法界、自由群因子同构——已经引起熟悉这些领域的数学家的严肃关注。但手稿数量并非故事的核心。重要的是单个结果能否站得住、是否真正新颖,以及数学共同体能否消化它们。Lean 验证确立的是形式正确,而非数学理解。在 GitHub 上发布并非同行评审。对于 722 篇手稿,全面的独立评估将耗时数年。
该领域正面临一个前所未有的问题:不再是 AI 能否解决难题,而是当它能以快于人类评估速度的节奏产出数学研究时,会发生什么。如果证明生成变得足够廉价以至于“淹没”研究文献,那么稀缺资源将从“生成答案”转向“选择正确问题并理解其答案为何重要”。这改变了数学对数学家的要求,而不是让工作终结。
Vinod Chugani 的职业生涯始于东京,曾任摩根大通最年轻的对冲基金销售台负责人,随后在雷曼兄弟创下个人销售纪录,之后又打造了覆盖 30 个国家的电子分销业务,营收突破 1 亿新元,随后转向数据领域。他毕业于杜克大学经济学专业,亦为 NYC Data Science Academy 校友,并在 100 多名申请者中成为Hugo Bowne-Anderson 在 Maven 开设的 “Building AI Applications” 课程的三位奖学金获得者之一。目前,他为 DataCamp、KDnuggets、Machine Learning Mastery 和 Statology 撰稿,内容涵盖从统计学到代理式 AI 等主题,并在 NYC Data Science Academy 指导数据从业者,已完成超过 1,000 场一对一辅导。
FAQs
OpenAI 在 2026 年 10 月 6 日究竟发布了什么?
OpenAI 在一个公开的 GitHub 仓库上发布了由一款未发布的内部前沿模型产出的 722 篇数学手稿,按 372 个结果家族组织。发布为许多结果提供了 Lean 证明形式化、其中 10 个的推理摘要、算力估算以及引用块。结果覆盖代数、数论、拓扑、理论计算机科学和数理逻辑——合计约 20 个分支。
为何报道中提到 337、372 与 722 个结果?哪个是对的?
这三个数字指代不同的事物。722 是单篇手稿的数量。372 是结果家族的数量——即相关论文的组群,包含主结果及配套证明、替代路径或推论。有些报道中的 337 被作为不同数学结果的计数;差异源于对“高度相关结果”计数口径的不同。哪个数字最有用取决于您要衡量什么。若以覆盖面计,372 个家族是最清晰的概括。
什么是 Lean?Lean 验证究竟证明了什么?
Lean 是一种编程语言与证明助理,可将数学证明表达为计算机能够逐步检查的形式语言。给定陈述的假设,一份通过 Lean 验证的证明在形式上是正确的——书写的推理链中不存在逻辑漏洞。Lean 不能确立的是:该形式陈述是否准确捕捉了要回答的数学问题、相较既有工作结果是否真正新颖,或对需要使用并在其上构建的人类数学家是否具有意义。这些问题需要人类判断。
是否有独立数学家确认了这些结果?
验证进展不均且在持续中。开发者社区报告称,对“类黎曼”结果(家族 003)的独立复核通过了初步检视。OpenAI 8 月早先发布的若干结果(单独的 10 项发布)曾由包括 Thomas Bloom、Tim Gowers、Noga Alon 在内的数学家检查。对于 10 月发布的 722 篇手稿,要在所有结果上实现全面的独立评审将需要更久——仅从规模看,对数学共同体而言就是一个多年期项目。顾问小组将此次发布描述为“验证与理解过程的开始,而非完成”。
什么是“数学与人工智能咨询小组”?
这是一个设在普林斯顿高级研究院的独立团体,成立于 OpenAI 在 2026 年 9 月的纳维-斯托克斯声明引发数学家强烈反弹之后。成员包括 Melanie Matchett Wood(哈佛)、Edward Witten(IAS)、Ravi Vakil(斯坦福)、Ulrike Tillmann(牛津)等。他们不受 OpenAI 支付且独立运作。其职责是就 AI 数学结果应如何发布与评估提供建议——而不是放缓 OpenAI 的内部研究。该小组在 9 月 29 日的建议呼吁比 OpenAI 目前提供的更高透明度,包括完整提示词与思维链披露、以及使用学术存储库而非 GitHub。
数学家对这次发布提出了哪些担忧?
担忧主要分为几类。其一,正确但不透明的证明会积累,却缺少通常由人类数学工作带来的周边理解——工具、直觉、技术。其二,722 篇手稿超出共同体的审阅承载力,造成积压,可能让错误多年不被发现。其三,对支撑 AI 结果的人类既有研究的署名体现不足。其四,专有模型让 AI 实验室具备学术数学家难以获得的研究能力,将发现前沿集中在少数机构内部。以上是担忧,而非既定结论——并非所有数学家都同等认同。
此次发布与 OpenAI 早先的数学结果有何关联?
10 月 6 日的发布是一个序列的一部分。2026 年 5 月,OpenAI 的一个模型否证了 Erdős 的单位距离猜想。8 月 1 日,OpenAI 发布了 10 项关于公开问题的结果,包括否证 Connes 的刚性猜想并构造出首个非 sofic 群。9 月,产出 10 月发布的同一内部前沿模型声称解决了纳维-斯托克斯千禧难题。10 月的发布是 OpenAI 整个 2026 年布局的更大规模版本——从个别展示性结果转向跨研究文献的数学手稿“批量生产”。
如果 AI 能生成证明,数学家还做什么?
最有用的框架来自将数学发现视为三个阶段:选择问题、解决问题、理解并应用结果。AI 可能会越来越多地承担“解决”这一步。这并不会让人类变得不重要——恰恰相反,人类在两端的专长更加关键:决定哪些问题值得追求、提出有效的猜想、在语境中解读结果意味着什么、将新发现与既有数学连接,并在跨领域进行交流。当证明生成变得更便宜,稀缺资源就转向对“证明什么”和“为何重要”的判断。
