Tracks
牛津大学数学家 Marc Lackenby 将一道未解问题交给 Google 的 AI 共同数学家。系统给出了一个证明,但其自带的审阅代理否决了该证明。Lackenby 阅读被否决的论证后,捕捉到其中一个真正新颖的策略,亲自弥补了漏洞,并解决了该问题。
这位共同数学家出现在 AI 与数学的繁忙年份。2026 年 7 月,Claude Fable 5 协助撼动雅可比猜想;GPT-5.6 Sol 提出了击破麦克斯韦猜想的构造,并且帮助攻破 Dinitz-Garg-Goemans 猜想;OpenAI 尚未发布的 Astra 在一天内解出十道未解难题。
以上多数是“一锤定音”的结果:模型给出答案,人类核验。共同数学家则押注于不同路径,它为研究的漫长、非线性中段而建,而非为了交付单个问题的一次性解答。本文将介绍 AI 共同数学家是什么、其工作流和多代理架构如何运作、早期用户的发现,以及它仍存在哪些不足。
什么是 Google DeepMind 的 AI 共同数学家?
AI 共同数学家是 Google DeepMind 推出的研究工作台,它协同一支专门化的 AI 代理团队,帮助数学家运行完整的研究项目,从界定问题到撰写成文的证明。它旨在编排研究的整个“杂乱”过程,而不是一次性回答单个问题。
2026 年 5 月,Google DeepMind 的研究人员发布了一篇题为“AI co-mathematician: Accelerating mathematicians with agentic AI”的arXiv 预印本,介绍了一款代理式 AI工作台,能够编排完整的数学工作周期,包括构思、文献检索、计算、证明尝试与理论构建。
AI 共同数学家目前小范围提供给部分研究人员试用。本身既不是求解器也不是聊天机器人,而是一个有状态的工作空间,用来编排非线性、混乱的数学工作流。它管理并行研究线索、跟踪不确定性,并保留失败尝试以备后用。输出采用 LaTeX,这也是数学与物理研究中的标准文档格式。
它构建于Gemini 3.1 之上。目前,它在内部使用Gemini Deep Think 进行证明尝试,并与 Python 执行环境集成以进行计算探索。它尚未将DeepMind 的专业数学引擎(AlphaProof、AlphaEvolve、Aletheia)作为内部组件纳入,但已为未来整合做好设计。
为何 AI 共同数学家重要?
数学家使用大语言模型(LLM)来协助多项任务:
- 文献综述
- 非正式证明草图
- LaTeX 模板性写作
- 探索性代码
他们也使用如形式化证明助手等 AI 工具来机械化验证证明。
尽管各工具在整体工作流的某一部分各有所长,但数学家必须临时性地将结果拼接起来。迄今为止,还没有基础设施型工具来编排数学家所采用的这种非线性过程。
AI 共同数学家如何工作
其工作流模型松散借鉴了 AI 编码工具,如 Claude Code 或 Codex。然而,这种工作流无法直接照搬。软件有规格说明和测试套件,而数学研究是非线性的。研究目标在一开始可能含糊甚至未定义,过程中得到的发现还可能彻底重塑问题本身。
共同数学家的工作流由一个多代理系统驱动,流程如下:
- 初步探索。研究者无需给出“完美的一次性提示”,而是与系统进行互动式对话,逐步细化高层目标并形式化研究问题。这样在动手之前就将研究意图说清楚。
- 文献综述。共同数学家开展文献回顾,识别关键论文并提取相关证明与数学技术。
- 计算框架。共同数学家创建一个计算用的 Python 库,配套示例用例与相关测试。
- 搜索执行。在计算框架建立后,导入该自定义库,并在云端集群上扩展搜索规模。它向研究者提供高层进度报告,而不会用底层日志将其淹没。
- 最终输出。最终输出是一份编译完成的 LaTeX 文档。该报告不仅说明结果,还解释发现过程,并通过页边注释将论断与具体参考文献或代码输出相连。只有在所有审阅代理批准后,报告才会被标记为定稿。未通过审阅的报告仍会呈现给研究者,并标注为“未解决”,这正是有瑕疵的证明抵达 Lackenby 的方式。

AI 共同数学家的工作流架构
AI 共同数学家的架构是一个多代理系统,包含顶层的项目协调代理以及专门化子代理。
工作流协调
在开展任何实质工作之前,项目协调者会与研究者开启对话,通过澄清性问题来细化目标。比如,研究者若询问计算几何中的开放问题“沙发问题”的上界,系统可能会问是否聚焦某一变体、另一变体,或两者兼顾。明确并达成一致的目标会在派发代理前界定问题范围。
一旦目标确定,项目协调者便将工作委派给各代理与子代理;除非存在依赖关系,否则它们并行工作。某个代理负责文献综述,另一个构建计算框架,还有一个执行搜索。但存在依赖:只有在计算框架产出的自定义库可用后,搜索才能执行。

避免幻觉
标准代理常会寻找无效捷径、臆造引理或过早宣告成功。AI 共同数学家通过多种机制来避免这些缺陷,其中包括审阅代理。
例如,在计算探索中若搜索空间爆炸,编码子代理在所有测试通过且审阅代理接受其结果之前,不能将代码标记为完成,从而使工作流停滞。此次失败的探索会被记录并发送给项目协调者,后者会在聊天中提醒研究者,研究者随后可以建议另一种途径。
这类死路不仅被记录,还被当作信息对待。它们会进行版本追踪,并作为研究记录的一部分予以保留。在数学中,失败的路径往往揭示约束或指向另一条道路。
在整个过程中,协调者默认会过滤底层噪声,但研究者可按需深入任何工作流并进行修改。
首批案例与协作模式
几起早期案例反映了不同的协作模式:一份被系统标记为错误的证明激发了人类洞见;一条页边注释重构了问题;以及一次快速的死路检测节省了本可被误耗的一周时间。
修补一份被系统判为错误的证明
牛津大学数学系教授 Marc Lackenby 将系统用于《Kourovka 笔记本》(群论开放研究问题集)中的一道题。AI 做出证明尝试,审阅代理发现了证明中的缺陷,并将其报告给 Lackenby。他知道如何修补这个漏洞。
这种交接正是关键:人类抓住了机器遗漏的点,而机器完成了围绕它的大量重活。
顺着页边注释获得新洞见
另一位数学教授 Gergely Bérczi 研究涉及斯特林系数猜想的问题。为便于初步审阅,他向 AI 共同数学家提供了主题、背景、已知方法以及 AlphaEvolve 实验所建议的一个潜在方向。
AI 共同数学家针对其中两条猜想给出了证明(目前正接受人类数学审阅),并附有详细的计算性证据来支撑论断。Bérczi 表示,系统通过成稿中的一条页边注释帮助了他,这条注释提醒了一个关键洞见,他随后在聊天界面里进一步跟进。
在代价是一周之前发现死路
最后,Semon Rezchikov 提出了一个关于哈密顿微分同胚的技术问题。他与项目协调者反复讨论,直到就任务的精确定义达成一致。AI 生成的写作中包含一个关键引理及其证明(后经验证),基本解决了该问题。
期间也探索过一种方法,但走进了死路。AI 更快地抵达了这条死路,使他免于在无果之路上白白耗上一周。系统将原本可能浪费的一周压缩成了数小时。
FrontierMath 基准测试结果
AI 共同数学家是一个工作流工具,而非严格意义上的数学问题求解工具。尽管如此,作者展示高分基准仍很重要,原因包括:
- 表明其底层数学引擎足够强大,能在前沿数学中成为有用的协作者。
- 证明基准为衡量编排层的增益提供了可控环境。
- 在尚无标准化度量的情况下,提供协作效能的代理指标。
结果:AI 共同数学家在研究级基准 FrontierMath 第 4 级中取得 48% 的成绩。这是目前报告的最高分,包括 Google 自家的 Gemini 3.1 Pro 在相同测试、相同级别中的 19%。Epoch AI 发现大约三分之一的 FrontierMath 题目(涵盖第 1–4 级)存在错误,且正进行人工复核。
在 Google 的一项内部基准中(由 100 道未泄露的、具备代码可校验答案的研究级数学题组成,来源于专业数学家),AI 共同数学家得分为 87%,而 Gemini 3.1 Pro 为 57%,Gemini 3.1 Deep Think 为 70%。
AI 共同数学家的已知局限
论文对结构性局限保持透明:
- 主要质量控制来自审阅代理与证明代理。对抗式审阅循环可能出现“取悦审阅者”的偏差,即代理趋向于收敛到能满足审阅代理的论证,而非真正正确的论证。这是一个真实存在的结构性脆弱点。
- 精致的 LaTeX 输出可能造成伪严谨感。文档排版精美,看起来就像完成品,而不论底层数学是否正确。
- 系统只有在研究者是真正的领域专家时才表现良好。存在风险:非专家可能把一个模糊的问题交给系统并盲目信任其输出。
- AI 证明仍需人类核验。例如,Bérczi 的证明在发表时仍处于人类审阅中。
结语
AI 共同数学家体现了一个转变:不再是让 AI 独立解决问题,而是与 AI 一起投入迭代且“凌乱”的数学研究过程。真正的瓶颈在于能映射数学家实际工作方式的工作流基础设施。
如果您想亲自构建类似的代理式系统,DataCamp 的开发者副高级 AI 工程师与数据科学家副高级 AI 工程师学习路径是不错的起点。
Google AI 共同数学家常见问题
AI 共同数学家与 ChatGPT 或 Gemini 有何不同?
ChatGPT 和 Gemini 是为单轮对话优化的会话式工具。AI 共同数学家是一个有状态的工作空间,可以运行并行研究线索、跟踪失败尝试,并管理为期数周的研究。
AI 共同数学家会取代数学家吗?
不会。该系统在由领域专家掌舵时效果最佳,专家能够评估其输出,并识别出有瑕疵的证明中蕴含的有用想法。
什么是多代理系统?
这是一种架构,多个专门化的 AI 模型协同完成任务。在 AI 共同数学家中,独立的代理分别负责文献检索、计算、证明尝试和对抗式审阅。
AI 共同数学家如何处理错误与死路?
失败尝试不会被丢弃,而是被记录、版本追踪,并上报给研究者。在数学中,死路往往揭示约束或指向更优路径。
输出与标准的 AI 生成回复有何不同?
系统会生成编译完成的 LaTeX 文档,并用页边注释将论断与具体论文或代码输出相连,而不是给出没有出处的文字。只有当所有审阅代理批准后,报告才会被标记为定稿。
