Courses
2026 年 9 月,研究员 Jacob Coxon(在加入 Anthropic 前,曾在 OpenAI 从事约三年的预训练研究,并于加入 Anthropic 两个月后)选择离职,公开警告称,领先实验室正竞逐他所称的“自我改进的超级智能”,而在风险面前并未采取足够负责的行动。Anthropic 负责对齐科学的 Evan Hubinger 公开表示赞同:对未来风险应予以严肃关注,同时将其与当前系统的实际能力区分开来。此番争论迅速进入主流 AI 话语。
这场争论的核心概念是递归自我改进(RSI)。值得脱离争议本身去理解它,因为其底层思想比任何一次新闻周期都更广泛、更具澄清意义。本文将介绍 RSI 的真实含义、反馈回路如何运作、当今 AI 在这方面的真实能力,以及研究者为何对其走向看法分歧。
什么是递归自我改进?
递归自我改进描述的是一个反馈回路:AI 参与创造更强的 AI,而更强的 AI 又更善于推动下一次改进,如此循环:
AI 帮助改进 AI → 改进后的 AI 更擅长改进 AI → 该系统推动下一次改进 → 重复
有三件常被混为一谈的事情,值得分开来看。
- 其一,人类使用 AI 加速 AI 研究。这已在广泛发生。
- 其二,AI 研究日益自主化,系统在更少人类指引下承担更多研究流程。
- 其三,完全的递归自我改进,即 AI 系统能够在很大程度上自行设计并开发其后继者。
完全的 RSI 属于第三种。目前尚无 AI 系统被确证实现这一点。Anthropic 本人也明确划出这条界限,指出完全 RSI 尚未达成,且未必必然发生。这一界定也是 Coxon 之争之所以激烈的原因:争论不在于 RSI 今天是否存在,而在于差距缩小得有多快,以及这对构建这些系统的人提出了什么要求。
递归自我改进如何运作
按 RSI 的含义,自我改进的系统会对 AI 开发流水线本身作出贡献。这意味着编写和改进研究代码、设计实验、生成或筛选训练数据、评估模型性能、识别弱点并提出算法改进。关键在于“递归”:如果通过这一过程产出的系统在这些任务上变得更好,那么下一代 AI 的开发就可能更快或更有效。

示意图展示了跨越多代 AI 的递归自我改进反馈回路。图片由作者提供。
这并不是某个模型在实时“改写自身权重”。更恰当的理解是代际更迭:每一代 AI 更有效地参与构建下一代。复利效应发生在版本之间,而非单一运行中的系统内部。
递归自我改进 vs. AI 自我纠错
关于 RSI 最常见的误解,是将其与自我纠错混为一谈。即便密切关注 AI 的人也常在此跌跤,因此有必要精确区分。
自我纠错
自我纠错是指模型在执行任务时批判或修订自己的答案、代码或计划。这包括发现自身推理中的错误、调试刚写的代码或打磨草稿。当前系统中,这类现象随处可见。
递归自我改进
RSI 在分类上不同。其改进影响 AI 系统自身或其后继者的能力,可能使未来的 AI 开发本身更有效。反复调试自己代码的智能体,并不自动构成递归自我改进;那只是一个能力较强的智能体。关键区别在于,这种改进是否能够持续存在,并在下一代系统的开发中产生复利。
自我纠错是系统在某项任务中使用的工具;RSI 则发生在当这项任务就是构建下一代系统时。
递归自我改进 vs. 相关 AI 概念
将 RSI 放在若干常被同时讨论的概念坐标上会更清晰,尤其在 Coxon 之争将“超级智能”和“奇点”等术语推上同一标题之后。
RSI vs. 自动化 AI 研究
自动化 AI R&D 指能运行实验、分析结果并提出下一步方案的系统。它们可为 RSI 作出贡献,但并不等于完全的 RSI。自动化研究流程的部分环节是趋势的一部分,而非终点。介于“助力研究”与“自主开发后继者”之间的差距,才是关键。Anthropic 公开发表的研究描述了 AI 承担更多这条流水线上的工作,这也是 Coxon 离职引发震动的原因。演进是真实存在的;问题在于能走多远。
RSI vs. 持续学习
持续学习是指已部署的模型随时间从新信息中更新。RSI 则是改进用于开发更强 AI 系统的过程。前者改变模型所知,后者改变下一代模型能达到的能力水平。
RSI vs. 人工超级智能
RSI 描述的是过程;超级智能描述的是一种拟议的能力水平。两者相关,因为 RSI 被假设为通往超级智能的一条路径,但它们并非同一概念,将二者混为一谈只会模糊二者。
当 Coxon 警告“自我改进的超级智能”时,他描述的是一个情景:RSI 产出一个在各领域能力超越人类的系统。这是对该过程最终可能产出的特定主张,而非对过程本身的描述。
RSI vs. AI 奇点
AI 奇点是假设中的一个时间点:AI 的改进变得极为迅速且自我维持,以至于人类无法再预测或控制接下来会发生什么。可以把它看作曲线变成垂直的那一刻:变化的速度超出我们理解或响应的能力。RSI 是被提出的通往奇点的机制之一。但奇点是推测性的结果,而非过程本身,且许多研究者认为曲线在发生类似情形之前早已趋于平缓。
我们离递归自我改进有多近?
比几年前大多数人意识到的更近;但没有一些标题所暗示的那么近。
AI 系统已参与编码、调试、运行实验、分析实验结果、模型评估以及 AI 研究助理等工作。Anthropic 公开表示,正将 AI 开发工作的越来越多部分委托给 AI 系统,其工程师如今发布的代码量也显著高于往年。同时,Anthropic 明确指出,人类在研究判断上仍发挥重要作用。这意味着要决定追求哪些问题,并评估结果是否真如表面所示。
AI 在 AI R&D 中的参与度提升,是走向更高自动化的证据;但这并不能证明一个自主的 RSI 回路已然存在。流水线中有了更多 AI,但它尚不能自我运行。正是这种既有实质进展又无清晰终点的模糊性,让 Coxon 认为远远不够。他的离职并不是宣称 RSI 已经到来,而是认为将其视为遥远之忧已站不住脚。
什么可能加速递归自我改进?
要真正缩小差距,需要什么?有几个瓶颈尤为突出,而与每个瓶颈之间的距离,也能为现实时间表提供线索。
AI 编码能力
能自主编写和修改研究代码是前提。当前模型确实在这方面表现出色,但在重要工作上仍会犯错,需人类复核。
自动化实验
自主运行实验是与编写实验代码不同的另一瓶颈。能够设计实验、执行、解释结果并决定下一步尝试的系统,能闭合相当一部分回路。当前系统能完成其中的若干环节;但在每一步推理都无需人类检查的完整闭环,仍未触及。
研究品味与创意生成
这是有趣之处。Anthropic 明确指出,人类在研究品味与判断上仍具相对优势。这包括:知道哪些实验值得做、哪些结果可信、哪些方向更有前景。研究中大量的实验性工作正在变得可自动化;而“判断层”并非如此。这亦是 Anthropic 认为目前人类增值最不可替代之处,也是离完全 RSI 最远的地方。
模型评估
判断一个模型是否真的变好,没听起来那么简单。评估需要对“重要之处”的判断,而现有基准很容易被投机或被“刷榜”。在 AI 系统能可靠评估其后继者之前,人类仍需参与此阶段,而这本身就是自主 RSI 的一个重要刹车。
算力与基础设施
约束不仅在于原始能力。要让开发周期实现自主运转,需要支撑大规模训练与评估、且无需持续人类干预的基础设施,而这依旧昂贵且组织上复杂。
模型评估
判断一个模型是否真的变好,没听起来那么简单。评估需要对“重要之处”的判断,而现有基准很容易被投机或被“刷榜”。在 AI 系统能可靠评估其后继者之前,人类仍需参与此阶段,而这本身就是自主 RSI 的一个重要刹车。
人工复核
即使 AI 系统能写代码、做实验、评估结果,最终“发版”仍需人类签字。这一步的审核,硬性限制了回路能跑多快。哪怕工作自动化了,审批仍可能成为瓶颈。在 AI 判断足够可信、能够移除此闸门之前,人工复核或许就是 RSI 进展最直接的“天花板”,而并非对未来的哲学性担忧。
递归自我改进的积极面
答案有两部分:潜在利好与严重风险。
更快的科学与技术进步
若 AI 能加速 AI 研究本身,这一效应可能延伸至更广泛的软件开发、科学发现、医学与工程。观点在于:若 AI 足以胜任研究加速,它可能压缩多个领域的时间表,而不只是 AI。
更快的 AI 能力发展
用最直白的话说,这就是反馈回路论点:对 AI 研究能力的改进,可能提高后续 AI 改进发生的速度。正是这种复利,使 RSI 在理论上重要,也让像 Coxon 这样的研究者紧张到为此辞职。值得指出的是:能力发展更快并不自动导致“智能爆炸”。回路可以真实存在,但仍然缓慢、受限,或呈现收益递减。
递归自我改进的风险
人工监督成为瓶颈
AI 生成的实验、代码与模型变更,最终可能以快于人类有效复核的速度产出。当前塑造 AI 开发的监督,取决于人类是否能跟上构建节奏。这也是 Anthropic 即便在自动化更多工作时,仍强调人类判断在其研究流水线中作用的原因之一。
对齐与控制
更强的系统参与开发其后继者,使对齐问题更为关键。若参与下一代开发的系统在目标上存在细微的失配,那些偏差可能在后继者中延续甚至加剧。Hubinger 对此风险有大量著述;当他赞同 Coxon 对未来风险的担忧、同时坚持当前系统尚未构成同等威胁时,所指即此。
网络安全
更强的自主系统也扩大了攻击面。参与自身开发流水线的系统价值更高,且随着自主性提高,其失效模式的后果也更严重。当被约束的系统同时在帮助构建下一版自身时,围堵与访问控制的设计更为困难。
能力快速提升
若反馈回路显著加速开发,机构可能有更少时间评估并应对新能力。Anthropic 表示,完全 RSI 可能增加人类对 AI 系统失去控制的风险,同时也表示 RSI 既未实现,也非必然。
为何递归自我改进登上新闻
2026 年 9 月,Jacob Coxon 从 Anthropic 离职,将问题以紧迫的方式呈现:Anthropic 与 OpenAI 正在竞逐自我改进的超级智能,而未在潜在后果面前表现出足够谨慎。Evan Hubinger 公开表示赞同(他个人给出“本年代内 AI 造成的人类灭绝”的概率超过 10%,并承认 Anthropic 尚无对齐超级智能的方案),同时将这一未来担忧与当前系统的风险区分开来。Coxon 此后表示,他与 Anthropic 管理层的核心分歧在于:朝向 RSI 的竞争性竞赛是否不可避免,因而必须参与其中。
这一分歧,与 Anthropic 早前发表的、描述 AI 自动化 AI 开发进展的工作并行不悖;后者显示 AI 承担了更多开发流水线的工作。二者彼此一致,这也是为何这场争论难以被轻描淡写。不要把 Coxon 对灾难性结果的预测当作既定事实——那是持续中的争论,而非定论。
递归自我改进会引发智能爆炸吗?
理论上的论证是:更好的 AI 带来更好的 AI 研究,进而带来更好的 AI,并使改进更快。逻辑简洁,问题在于实践中是否成立。
并不必然出现无限加速。现实的约束包括算力、能源、硬件、训练数据、算法瓶颈、实验反馈周期、收益递减,以及对人类判断的剩余依赖。智能爆炸是对足够有效的 RSI 可能产出的一个假说,而非 RSI 的定义。它是分布中的一种情景,而非显而易见的终点。包括 Anthropic 内部对此思考最深入的研究者在内,没人知道这条曲线会多陡、会在何处趋于平缓。
如何治理递归自我改进?
这种不确定性让治理既更紧迫,也更困难。核心挑战是:如果 AI 生成的研究开始超越人类复核的节奏,如何保留有意义的监督。当前的提案与研究方向包括:在部署前进行能力评估、采用模型围栏(隔离)方法、对参与 AI 开发的 AI 系统实施访问控制、监测 AI R&D 活动、对重大操作要求人类批准、独立评估、以及前沿 AI 实验室之间的协作。
这些都不是完整的解决方案,Coxon 之争也再次强调了原因:为今日 AI 参与度设计的治理框架,未必能扩展到明日的水平。工具所处位置与技术前进方向之间的鸿沟,正是让身处一线的人们感到这个时刻格外重要的原因之一。
结语
递归自我改进描述的是这样一个反馈回路:AI 参与创造更强的 AI,而后者又更擅长推动后续改进。表述直截了当,评估却充满不确定性。
当今的 AI 辅助开发真实存在且持续增长,Anthropic 的研究对此已有清晰展示。完全自主的 RSI——即 AI 系统在无人工指引下,实质性地设计并开发其后继者——尚未实现。Anthropic 本人也坚持这一判断。二者之间的差距,正是所有有趣且存在争议的问题之处:它缩小得有多快?若真的缩小,会发生什么?谁有权决定推进的速度?
Coxon 与 Hubinger 的交锋并未制造这些问题,它让它们不再只是理论。不论您觉得 Coxon 的时间表令人警惕,还是更认可 Anthropic 的克制表述,底层动态相同:AI 正日益进入构建 AI 的回路。明确理解这意味着什么,既不渲染也不轻描,这正是值得了解 RSI 的原因。
Vinod Chugani 的职业生涯始于东京,曾任摩根大通最年轻的对冲基金销售台负责人,随后在雷曼兄弟创下个人销售纪录,之后又打造了覆盖 30 个国家的电子分销业务,营收突破 1 亿新元,随后转向数据领域。他毕业于杜克大学经济学专业,亦为 NYC Data Science Academy 校友,并在 100 多名申请者中成为Hugo Bowne-Anderson 在 Maven 开设的 “Building AI Applications” 课程的三位奖学金获得者之一。目前,他为 DataCamp、KDnuggets、Machine Learning Mastery 和 Statology 撰稿,内容涵盖从统计学到代理式 AI 等主题,并在 NYC Data Science Academy 指导数据从业者,已完成超过 1,000 场一对一辅导。
关于递归自我改进的常见问答
如何用最简单的话解释递归自我改进?
这是一个反馈回路:AI 帮助开发更好的 AI,而更好的 AI 又更擅长开发 AI,进而产出更强的系统,如此循环。关键词是“递归”,因为每一轮都可能改进的是过程本身,而不仅是输出。
是否已有 AI 系统实现了递归自我改进?
尚无定论。AI 系统如今已参与 AI 开发的重要环节,包括写代码、做实验与评估模型,但研究仍由人类主导,选择问题并作出关键判断。完全的 RSI——即 AI 在很大程度上自主设计并构建其后继者——尚未得到证明。Anthropic 已明确表态。
RSI 与会随时间学习的 AI 有何不同?
从新数据中持续更新(持续学习)的 AI,改进的是“它知道什么”。RSI 改进的是用于开发未来更强 AI 系统的“过程”。前者改变模型的知识;后者改变下一代模型的能力。
RSI 与“智能爆炸”有何区别?
RSI 是一个过程:AI 促成更好的 AI 开发。“智能爆炸”是对足够有效的 RSI 可能导致能力快速且持续增长的假设性结果。RSI 可能发生而不导致智能爆炸,具体取决于回路运行的速度及其所受的约束。
为何 Jacob Coxon 的离职会影响 RSI 的讨论?
Coxon 曾在 Anthropic 与 OpenAI 任职的研究者,于 2026 年 9 月辞职,理由是领先实验室正以不足的谨慎态度竞逐自我改进的超级智能。他的离职受到关注,是因为这与 Anthropic 自身发表的研究(显示 AI 承担更多 AI 开发工作)相呼应,使两者难以切割。
要实现完全的 RSI,需要发生什么?
需要攻克多个瓶颈:AI 的编码能力必须能可靠处理研究级任务;自动化实验应能在无需持续人工监督下运行;更重要的是,AI 需形成类似“研究品味与判断”的能力,知道哪些方向值得追求。Anthropic 目前认为,最后这一点仍是人类的优势所在。
RSI 与超级智能是一回事吗?
不是。RSI 描述的是过程;超级智能描述的是拟议的能力水平。RSI 只是可能通往超级智能的一条路径,它们是不同概念。把二者混同,有点像把训练方案与运动成绩混为一谈。
研究者如何提议治理 RSI 风险?
现行提案包括:在系统被用于 AI 开发角色前进行能力评估;对最强系统实施访问控制;监测 AI R&D 活动;对高风险决策强制要求人类批准;并推动前沿实验室间的协作。难题在于:若 AI 生成的研究最终快于人类复核所能跟上的速度,如何保留有意义的监督——目前无人能完全解决。
