跳至内容

ARC-AGI-3:全新的交互式推理基准

ARC-AGI-3 的工作原理、其如何以动作效率为 AI 代理计分,以及为何在发布测试中每个前沿模型得分均低于 1% 而人类则全部解出。
已更新 2026年10月6日  · 13分钟 阅读

使用 AI 探索

ChatGPTClaudePerplexity

大多数 AI 基准遵循同一套公式:给模型一个问题,得到一个答案,再检查是否正确。多年来,这种方法相当奏效。但随着前沿模型在几乎所有主流评测中得分超过 90%,一个熟悉的问题出现了:基准逐渐失去了区分模型优劣的能力。

ARC-AGI-3 采取了不同的思路。它不再给出带有清晰输入-输出配对的静态谜题,而是把 AI 代理丢进没有说明、没有明确目标、也没有显式规则的交互式环境中。代理必须像人类拿到一款未见过的游戏那样,通过反复尝试与观察自行摸索出一切。

由 ARC Prize 基金会于 2026 年 3 月 25 日发布的 ARC-AGI-3,在发布时得出了一个引人注目的结果:所有前沿 AI 模型得分均低于 1%,而人类则解出了基准中的全部环境。

什么是 ARC-AGI-3

ARC-AGI-3 是由 ARC Prize 基金会创建的交互式推理基准,该基金会由 AI 研究者 François Chollet(Keras 的创建者)和 Mike Knoop(Zapier 的联合创始人)共同创立。该基准建立在 ARC Prize 团队所坚持的一个核心原则之上:真正的智能不在于系统知道多少,而在于它学习全新事物的效率。

早期的 AI 评测关注的是凝结性知识(检索记忆事实、应用已训练的启发式),而 ARC-AGI-3 瞄准的是流体智力,即在不依赖训练中所学内容的情况下,通过推理解决新问题并适应新情境的能力。它衡量一个AI 代理是否能够探索陌生环境、摸清规则、识别“获胜”为何物,并高效据此采取行动。

该基准包含 135 个环境,分属公开、半私有和完全私有集。每个环境都是由内部设计团队打造的回合制“类游戏”场景。代理没有任何先验信息可依赖。它只需观察世界状态、执行一个动作、看看发生了什么,然后重复这一过程。

ARC-AGI-3 交互式环境游玩演示。视频作者自制。

这篇技术论文将该基准描述为测试四项核心能力:探索、建模、设定目标与规划。

核心“先验知识”

为确保基准衡量的是推理而非训练数据回忆,ARC-AGI-3 的环境避开语言、数字、字母、文化符号或可识别的现实世界物体。相反,它仅依赖 ARC Prize 团队所称的“核心知识先验”,即所有人类共享的基本认知能力。

这些先验包括“物体性”(理解事物是可持续存在的实体,能够移动或碰撞)、基础几何与拓扑(对称、旋转、“内”与“外”)、基础物理(动量、重力、反弹)以及“主体性”(识别环境中某些事物是否带有意图地行动)。如果某个环境要求知道“钥匙能开锁”,那测试的就是训练数据,而非推理。

ARC-AGI-3 的工作方式

从静态评测转向交互式环境,改变了该基准实际能够衡量的内容。

代理能看到与能做什么

每个 ARC-AGI-3 环境呈现一个 64×64 的网格,每个单元格显示 16 种可能颜色之一。代理接收作为 JSON 对象的视觉状态(称为“帧”),然后每回合提交一个动作。动作空间很小:通常是五个方向或按键类指令,外加可选的基于坐标的“点击”动作以选择特定网格单元。

这些环境是严格的回合制。在代理行动之前,什么都不会改变,这意味着该基准奖励缜密的推理而非快速反应。重要的是,内部操作如推理步骤、重试或工具调用不计为动作。只有实际改变环境状态的指令才计入代理的得分。

关卡与环境如何衔接

每个环境包含多个难度递增的关卡。第一关充当教程,以极低复杂度引入基础机制。后续关卡叠加新规则与交互,代理必须将所学迁移并应用到更复杂的情境中。

ARC-AGI-3 的难度并非来自晦涩或规模,而是来自跨关卡学习的多种机制的组合。单机制环境太容易被穷举破解。真正的考验是把多种已学动态组合起来,解决代理从未见过的问题。

该基准运行在一个定制的基于 Python 的引擎上,在无头模式下可达 1,000 FPS 的性能门槛。开发者可通过 pip install arc-agi 入门,并通过 SDK 或 REST API 与环境交互。您也可以在浏览器中试玩公开环境,直观感受这些游戏的样貌。

模型在 ARC-AGI-3 上的表现

首先要说明的是:这些分数反映的是截至 2026 年 3 月下旬排行榜的状态,随着研究者开发新方法,这些成绩几乎肯定会发生变化。

在发布时,ARC Prize 基金会在半私有评测集上测试了多款前沿模型。

发布时分数(2026 年 3 月):前沿 AI 对比人类基线。图片作者自制。

作为背景补充,这些前沿模型在大多数其他 AI 基准上都占据主导。ARC-AGI-1 正接近“饱和”,顶尖模型得分已远超 90%。而在 ARC-AGI-3 上骤降到不足 1%,表明这里所测试的能力与当前模型擅长的内容并不相同。

Grok-4.20 的 0% 并不意味着该模型从未采取过任何行动,而是表示它在每一关都超出了该基准设定的动作上限。我将在计分部分解释该上限的运作方式。

非 LLM 路线的早期信号

预览期得分最高的代理并非语言模型。在预览赛(使用 3 个公开环境和 3 个私有环境作为隐藏评测集)中,Tufa Labs 的 StochasticGoose 系统采用强化学习与卷积神经网络的方法达到了 12.58%。

然而,当 StochasticGoose 在发布时接受官方完整基准评测,其分数降至 0.25%,与前沿 LLM 大致相当。这个结果很能说明问题:在少量已知环境上有效的方法,一旦面对更广泛的未知环境就大幅失效,进一步凸显了 ARC-AGI-3 对“通用适应性”而非“任务特定优化”的依赖。

这也暗示交互式形式可能更适合不同的架构,因为当关键信息只有在每次动作之后才会出现时,语言模型无法单凭推理走通整个问题。

您可以在ARC-AGI-3 排行榜查看最新分数。

ARC-AGI-3 与 ARC-AGI-1、ARC-AGI-2 的对比

了解早期 ARC 基准测试的内容后,这些数字会有不同的意义。ARC-AGI-1 由 Chollet 于 2019 年发布,引入了通过抽象视觉谜题来衡量流体智力的概念。其形式是静态的:模型看到若干输入-输出网格示例,推断变换规则,并给出单一输出。2025 年 3 月发布的 ARC-AGI-2 延续了静态形式,但任务更难、更具组合性。

ARC-AGI-1 帮助识别出大型推理模型这一新类别的出现,OpenAI 的 o3 是第一个明确信号。ARC-AGI-2 则跟踪了这种推理能力的快速扩展。但静态形式有一个弱点:测试时算力扩张。各实验室在推理阶段并行生成数千个候选解,使 ARC-AGI-2 的分数在一年内从个位数被推高到 50% 以上。

Timeline diagram showing the evolution from ARC-AGI-1 static puzzles in 2019 to ARC-AGI-3 interactive environments in 2026

ARC-AGI 基准的时间演进。图片作者自制。

ARC-AGI-3 让暴力采样策略难以奏效,因为正如前文所述,环境只有在代理行动后才会显露其规则。当每次动作都会改变问题本身时,您不可能在上下文窗口中预先生成 10,000 个候选解。

ARC-AGI-3 如何抵御“抄近道”

除了交互式形式外,ARC-AGI-3 还包含一些特定的设计选择,旨在对抗早期版本中出现的数据污染与合成生成“捷径”。最显著的变化是数据集比例的倒置。ARC-AGI-1 和 ARC-AGI-2 公开任务与私有任务的比例约为 10:1,为研究者提供了大量训练素材。ARC-AGI-3 则反其道而行之:仅 25 个环境公开,而绝大多数被保留在用于评测的半私有与完全私有集中。

ARC Prize 团队还指出了一些证据,表明部分前沿模型的训练集中可能包含 ARC 数据。在 ARC-AGI-2 评测中,Gemini 3 的链式思维在未被提示的情况下引用了 ARC 特定的颜色映射,这暗示了训练数据的“饱和”。通过缩小公开面并转向无法被记忆为静态模式的交互式环境,ARC-AGI-3 旨在大幅削弱此类捷径的可行性。

ARC-AGI-3 旨在衡量什么

理解该基准真正想测试的内容,有助于理解上述设计选择。该基准瞄准 ARC Prize 团队所描述的“技能获取效率”:AI 代理学习它从未遇到之事物的效率如何。

Diagram showing the four core capabilities tested by ARC-AGI-3: exploration, modeling, goal-setting, and planning

ARC-AGI-3 测试的四项核心能力。图片作者自制。

这四个方面在每个环境中同步测试,且全程没有说明、没有明示目标。

在 ARC-AGI-3 上获得 100% 意味着一个 AI 代理能以与第二优秀的人类测试者同等的效率解出每个环境。ARC Prize 团队明确表示,这不等同于通用人工智能(AGI),而是意味着 AI 与人类学习之间的某个特定差距被弥合。

ARC-AGI-3 的计分方式

计分是 ARC-AGI-3 与早期基准差异最大的地方。它不只是检查代理最终是否“误打误撞”找到答案,而是衡量代理抵达答案的效率。

RHAE 计分公式

该指标称为 RHAE,即相对人类动作效率(Relative Human Action Efficiency)。每关的公式为:

Level Score = min(1.0, (human_baseline_actions / AI_actions))²

关键在于平方项。这不是线性关系。动作次数加倍并不会让分数减半,而是降至四分之一。动作多十倍,分数几乎趋近于零。这种幂律设计对暴力尝试进行重罚,同时奖励真正学懂环境机理的代理。

Diagram illustrating RHAE scoring with three examples showing how AI action counts relative to a human baseline produce different scores

RHAE 计分公式示例。图片作者自制。

人类基线由 10 名测试者首次接触每个环境时的表现确定,取第二佳者作为基线。使用“第二佳”而非“最佳”可以滤除侥幸的极端值,同时保持源于真实游玩。

另外还存在硬性上限:若某一关代理的动作数超过人类基线的 5 倍,则被强制截断,该关记 0 分。分数亦封顶为 1.0,因此即便发现了超越人类基线的非预期捷径,也不会得到额外加分。

在同一环境内,后续关卡权重更高。计分采用加权平均:第 1 关权重为 1,第 2 关为 2,依此类推。这意味着教程关几乎不影响分数,而需要整合多种已学机制的高难关则占据主要权重。

两张排行榜

ARC-AGI-3 维护两张规则不同的排行榜。官方排行榜评测未针对 ARC-AGI-3 特别准备的通用 API 系统的前沿模型。社区排行榜允许自报结果并允许使用“外挂/脚手架”。这一区别很重要,因为正如前文所述,为已知环境手工打造的“外挂”可以大幅抬高分数,却可能在未知环境上完全失灵。官方排行榜旨在衡量 AI 的真实适应能力,而非开发者的“脚手架”水平。

ARC Prize 2026 与 ARC-AGI-3 竞赛

ARC-AGI-3 是今年竞赛的核心,但并非唯一赛道。

ARC Prize 2026 的总奖金超过 200 万美元,覆盖三大赛道。ARC-AGI-3 赛道总奖金为 85 万美元,其中最重磅的是 70 万美元“大满贯奖”,授予首个在完全私有评测集上达到 100% 的合格代理。如今年无人夺得,奖金将滚动至 2027 年。除“大满贯奖”外,还有 7.5 万美元的最高分奖,分配给前五名;并在 2026 年 6 月 30 日与 9 月 30 日两次里程碑检查点,各向当期前三名团队分配 3.75 万美元。

Overview of ARC Prize 2026 competition showing three tracks and their prize allocations

ARC Prize 2026 竞赛奖金结构。图片作者自制。

另外两大赛道为ARC-AGI-2 赛道(70 万美元,且值得注意的是这将是 ARC-AGI-2 最后一次用于官方 Kaggle 竞赛)与论文奖赛道(45 万美元,面向研究论文)。

竞赛在Kaggle 上进行,但其规则与典型 Kaggle 竞赛有所不同。所有提交均在无网络的沙箱环境中评测,这排除了调用 GPT、Claude、Gemini 等托管模型 API 的可能。所有具备获奖资格的方案必须在获得私有评测分数前,以宽松或公有领域许可(CC0 或 MIT-0)开源其代码与方法。竞赛于 2026 年 3 月 25 日开启,最终提交截止于 2026 年 11 月 2 日,结果将在 2026 年 12 月 4 日公布。

为何 ARC-AGI-3 重要

当基准能够揭示此前看似不存在的差距时,它们的价值最大。从这个标准看,前两个 ARC 基准都当之无愧:ARC-AGI-1 揭示了大型推理模型的出现,ARC-AGI-2 则追踪了测试时算力扩张的上限。ARC-AGI-3 指向了另一个问题。

这一基准之所以在当下具有意义,关键在于语境。到 2026 年初,许多广泛使用的 AI 基准正接近“饱和”。前沿模型在 MMLU、HumanEval、GSM8K 等基准上得分超过 90%,这限制了这些评测区分系统差异的能力。ARC-AGI-3 测试的是当前模型似乎缺乏的一项能力:在陌生环境中“边学边做”。AI 不足 1% 的成绩与人类 100% 的可解性之间的巨大鸿沟,足以表明这不仅仅是“更难的同类测试”,而是一种不同的挑战。

ARC Prize 将 ARC-AGI-3 定位为最重要的交互式推理测试,但需记住这种表述来自运行该基准的组织。其分量能否成立,取决于研究者在适应这一基准的过程中,它能否经受住考验。

局限与开放问题

任何基准都不完美,ARC-AGI-3 也收到了值得注意的一些批评。

一个常见担忧是计分公式本身。平方效率指标对探索施加了重罚,而探索本身在某种意义上可被视为智能的体现而非失败。如果一个代理用 50 次动作仔细勘查边界条件后才达成解答,它的得分远低于用 5 次动作就猜中规则的人类。一些社区成员认为这会使表现差距看起来被“人为放大”。

另一个问题是基线的选择。正如计分部分所述,该基准采用第二优秀的人类测试者而非平均水平作为基线,这设定了一个较高门槛。即便“普通人类”在这种设定下也会低于 100%。

  • 抽象游戏表现是否可迁移? 交互式网格游戏上的成功能否预测现实世界的自适应智能,仍是一个开放问题。该基准测试的是推理的一条特定且狭窄的维度。
  • 代理设计 vs. 基础模型。 目前尚不清楚进展会主要来自更好的代理“脚手架”(外挂、状态空间搜索、基于 RL 的方法),还是来自不同的模型架构。正如前文所述,StochasticGoose 在预览期的领先在完整基准上荡然无存,因此尚无方法显示出明确的泛化能力。
  • 该基准能否持续“抗打”? 如前所述,实验室在专注于 ARC-AGI-2 后,短短一年内就把分数从个位数推到 50% 以上。ARC-AGI-3 的设计变化(交互式形式、倒置数据集比例、动作效率计分)是否足以抵御类似的压力,仍是未知数。
  • 上下文窗口成本。 16 色的 64×64 网格如果不进行压缩,会很快耗尽语言模型的上下文窗口,使得基于 LLM 的方法在大规模运行时成本高昂。

ARC Prize 团队将该基准定位为一次科学尝试,旨在测量某项缺失能力,而非对通用智能的最终检验。以我们目前所知来看,这是一个合理的解读。

结语

ARC-AGI-3 以不同方式评估 AI 系统。通过从静态谜题转向交互式环境,它测试模型能否通过经验而非指令来探索、设定目标并摸清门道。

早期的数字相当醒目:那些在编程、数学与知识测评中称雄的模型,在这里却难以越过 1%。这一差距会否像早期 ARC 基准那样迅速缩小,或交互式形式是否更难攻克,都很值得持续关注。

想进一步了解自适应 AI 系统背后的理念,欢迎查看我们的AI 基础技能路径,或我们的课程构建可扩展的代理式系统。


Khalid Abdelaty's photo
Author
Khalid Abdelaty
LinkedIn

我是一名数据工程师兼社区建设者,专注于数据管道、云端与 AI 工具链,同时为 DataCamp 和新兴开发者撰写实用且高影响力的教程。

FAQs

什么是 ARC-AGI-3?

一项交互式推理基准,用于测试 AI 代理能否在没有任何说明的情况下探索新环境、推断目标并高效行动。

ARC-AGI-3 与 ARC-AGI-2 有何不同?

ARC-AGI-2 使用静态的输入-输出谜题;ARC-AGI-3 使用实时交互环境,其中规则与目标只会通过代理自身的行动逐步显现。

ARC-AGI-3 是一项 Kaggle 竞赛吗?

它作为 ARC Prize 2026 的一部分在 Kaggle 举办,但规则更严格:评测时不可联网;具备获奖资格的方案必须开源代码与方法。前沿模型(如 GPT-5.4、Gemini 等)的分数是通过 API 单独收集的,并非来自 Kaggle 提交。

ARC-AGI-3 衡量什么?

技能获取效率:AI 代理学习驾驭新环境的速度,按相对人类基线的动作数进行计分。

通过 ARC-AGI-3 是否意味着已达成 AGI?

不会。100% 仅表示代理在这些特定环境中达到了与人类相当的效率,并不意味着已实现通用人工智能。

主题
人工智能

与 DataCamp 一起学习

课程

理解 Artificial Intelligence

2 小时
426.1K
了解人工智能基础概念,如机器学习、深度学习、NLP、生成式 AI 等。
查看详情Right Arrow
开始课程
查看更多Right Arrow