本文要点
- 公开集 RHAE 从官方 harness 的 13.3% 变为优化 harness 的 38.3%。
- 模型权重保持不变,变量转为推理保留和上下文 compaction。
- 输出 token 约降至原来的六分之一,分数与效率同时变化。
阅读辅助
先看数字、证据和来源,再读正文。
13.3% 到 38.3% 是同一模型的 harness 对照,不是模型权重更新。
2026-03 · ARC-AGI-3 技术报告定义 RHAE、公开与私有数据集,并给出动作效率计分方法。
同一个 GPT-5.6 Sol(max),同一套 ARC-AGI-3 公开任务,RHAE 从 13.3% 变成 38.3%。OpenAI 在 7 月 29 日 15:00 UTC 发布的对照实验没有宣布新权重,也没有声称模型在当天完成能力升级;它改的是模型周围的运行系统:保留跨动作的私有推理,并在长上下文中启用 compaction。
这组结果的第二个方向同样醒目。OpenAI 称,两项设置合用后,公开任务集的输出 token 约减少 6 倍,更准确的中文含义是降至原来的约六分之一。这里的“近三倍得分”和“约六倍更少输出”都以官方 harness 为比较基线,适用对象是同一模型在 ARC-AGI-3 公开集上的这组运行,不能改写成模型本体普遍提速或 API 成本全面下降。
目前能确认的是 OpenAI 已公布完整的顶层对照结论,ARC Prize 也已公开任务定义与 RHAE 公式。尚不能确认的是第三方能否重跑出 38.3%、两项设置各自贡献多少,以及结果能否迁移到难度更高且分布不同的私有环境。核心数字目前只有 OpenAI 官方单源,二级日期卡片只能核对发布时间,不能验证性能,因此本文采用 low confidence。
对评测团队和智能体开发者,影响不在于“该不该多开两个开关”这么简单。长程任务会把记忆保留、上下文截断、状态压缩、重试与工具编排都放大;只公布模型名和最终分数,已经不足以让另一支团队复现同一个被测系统。
一组数字对应两层结论
| 指标 | 官方 harness | OpenAI 调整后的 harness | 可以得出的结论 | 不能得出的结论 |
|---|---|---|---|---|
| 公开集 RHAE | 13.3% | 38.3% | 同一 GPT-5.6 Sol 在两种运行配置下相差 25 个百分点,约为 2.88 倍 | 模型权重获得了近三倍升级 |
| 输出 token | 比较基线 | 约少 6 倍 | 在这组公开任务运行中,保留推理与 compaction 同时改善得分和输出量 | 所有任务的 token、价格或延迟都会下降六倍 |
| 平均人类 RHAE | — | 估计 48% | OpenAI 依据 ARC gameplay logs 给出一个人类参照估计 | ARC Prize 新设了 48% 的正式“人类满分线” |
| 数据集范围 | ARC-AGI-3 public set | ARC-AGI-3 public set | 两组分数的适用范围一致,都是公开演示集 | 结果已经覆盖半私有或竞赛私有集 |
| 长上下文阈值 | 175,000 字符后滚动截断 | 175,000 tokens触发 OpenAI 的处理 | 两种实现都在管理长历史,但采用不同单位与策略 | 字符与 token 是可直接互换的同一口径 |
表里最需要守住的是第一行。原文使用“tripled”概括从 13.3% 到 38.3%,按数值计算约 2.88 倍;这是一种近似描述,不是增加三个百分点,也不是在原有成绩上再加 300%。两组数字都属于 RHAE,且都限定在 public set。
“人类约 48%”也容易被误读。OpenAI 表示这是依据官方 gameplay logs 做的估计;ARC Prize 的技术报告则把 RHAE 人类基线定义为每层的“upper-median best human action count”。平均测试者不必等于这个效率基线,更不等于 ARC-AGI-3 所说的 100% 目标。官方任务页对 100% 的解释是:智能体能像人类一样高效地击败所有游戏。
证据矩阵:每份材料能证明到哪里
| 来源 | 能证明什么 | 证明不了什么 |
|---|---|---|
| OpenAI 对照实验 | 同一模型、两项设置、13.3% → 38.3%、输出 token 约少 6 倍,以及两种历史管理方式 | 独立复现、私有集效果、跨模型普适性 |
| OpenAI News RSS | 文章在 2026-07-29 15:00 UTC 发布,分类为 Research | benchmark 数字是否可复现 |
| ARC-AGI-3 官方页 | 任务是无自然语言说明的交互式新环境,强调探索、规划、记忆压缩与持续适应 | OpenAI 优化 harness 的成绩 |
| ARC-AGI-3 技术报告 | RHAE 公式、公开集 25 个环境、半私有与全私有集各 55 个,以及公开集的演示定位 | GPT-5.6 Sol 的本次运行细节 |
| OpenAI API 文档 | Responses API 可管理跨轮会话状态;compaction 用于长交互中的上下文压缩 | 在 ARC-AGI-3 上固定产生三倍分数或六倍 token 改善 |
这张矩阵把“官方一手”进一步拆开:OpenAI 是实验结果的第一方,ARC Prize 是 benchmark 定义和计分方法的第一方。两边材料可以互补,却不能互相替代。ARC 技术报告能说明为何长程记忆重要,但不能替 OpenAI 背书 38.3%;OpenAI 能描述自己的 harness,却不能把公开演示集自动变成正式私有评测。
RHAE 为什么会放大遗忘
ARC-AGI-3 不是一次性回答静态题。智能体进入陌生二维环境后,没有自然语言规则说明,需要通过动作探索机制、推断目标、形成世界模型,再用后续动作完成各层。一次“走错”不仅可能浪费当前回合,还会增加相对人类动作基线的分母。
RHAE 的全称是 Relative Human Action Efficiency。技术报告按每层计算 AI 动作数与人类基线动作数的比值,并对效率比取平方;报告举例称,人类基线用 10 步完成、AI 用 100 步完成时,该层得到 ((10/100)^2),即 1%。每层分数可在超过人类效率时封顶于 115%,环境分数还会按层加权,并受到已完成层数的上限约束;最终 benchmark 分数是各环境分数的平均。
这种设计同时惩罚三类失败:没完成后续层、为了找规则做过多无效动作、学到规则后又忘记并重复探索。于是,harness 若在每个游戏动作后丢弃模型的私有推理,模型下一步即使看见历史动作,也可能需要重新解释“刚才为何这么做”;历史再被滚动截断,早期发现的规则和失败路径还可能彻底退出上下文。
这也解释了为什么模型权重不变,RHAE 仍可能大幅波动。模型生成下一步动作的能力没有被重新训练,但每一步拿到的信息状态变了:一套系统让它不断重建局部理解,另一套系统允许它携带此前推理,并在历史变长后压缩已有信息。对按动作效率计分的长程任务,这不是无关紧要的包装层。
从“保留历史”到“保留可用状态”
OpenAI 描述的第一项变化是 retained reasoning。官方 harness 在每个游戏动作之后丢弃私有推理;OpenAI 改用 Responses API,让推理在工具调用和多轮交互之间继续存在。官方 Conversation state 文档也把跨消息或轮次保存信息列为会话状态管理的核心用途。
第二项变化是 compaction。官方 harness 在历史超过 175,000 字符后滚动截断旧动作;OpenAI 的实现以 175,000 tokens为阈值,用 compaction 处理长历史。原文说明,游戏网格使字符与 token 在这一场景里接近 1:1,但这只是特定数据形态下的近似,报道时仍要保留两个单位,不能写成双方都使用同一个“17.5 万 token 上限”。
Compaction 也不等于简单删除最旧内容。OpenAI 的 API 文档把它定义为支持长运行交互、减少上下文并在质量、成本和延迟之间权衡的机制。放到 ARC-AGI-3,它的价值在于把历史里的发现压成后续仍可利用的状态,避免上下文增长只能靠硬截断解决。
两项设置合用后,得分与输出 token 朝同一方向改善并不矛盾。若模型不再反复推断相同规则,它可能用更少文字和更少探索动作推进更远;压缩也减少了长历史带来的重复处理。不过,这只是与结果一致的机制解释。OpenAI 没有在公开材料里给出完整的二乘二消融,也就是“只保留推理”“只开 compaction”“两者都关”“两者都开”四组数据,因此还不能量化每个设置的独立贡献。
反方限制:优化 harness 也可能改变公平边界
一种支持 OpenAI 的观点是,商业智能体本来就会针对模型特性设计运行层。若 benchmark 使用会主动丢失模型状态的通用 harness,测到的可能是一个人为受限系统,而不是用户在 ChatGPT、Codex 或 Responses API 中实际能获得的能力。让评测接近生产部署,可以提高结果的现实相关性。
反方问题则是:一旦允许厂商使用私有推理保留、专有 compaction 和定制提示,不同模型比较的对象就从“权重加统一接口”变成“厂商完整系统”。这未必不合理,但榜单含义会变化。具备服务端状态能力的闭源 API 可能获得开源权重或无状态接口难以复制的优势;评测方也更难判断提升来自模型、压缩器、提示、重试政策还是其他未披露组件。
公开集本身是第二项边界。技术报告列出 25 个 Public Demo 环境,并明确说它们用于展示格式和基础机制,倾向于更清晰、更有趣,且不全面代表私有集。半私有集和全私有集分别有 55 个环境,难度更高,并有意与公开集保持分布差异。因此,公开集适合做可见的 harness 对照,却不足以证明对 ARC-AGI-3 整体泛化的提升。
第三项限制是复现材料。OpenAI 给出了顶层配置与关键数字,但外部团队还需要模型快照、完整系统提示、动作编码、重试策略、随机性参数、compaction 触发和内容、停止条件、每个环境的原始轨迹与计分卡。缺少这些材料时,38.3%是重要的官方实验信号,不是已经完成独立审计的 leaderboard 事实。
这次对照最有价值的地方,是把 harness 从 benchmark 脚注推到了被测系统的一部分。静态问答里,少一段旧上下文可能只影响一道题;交互任务里,状态丢失会让每一步都在更差的起点上继续,误差经过几十或上百次动作累积,最终同时伤害完成率、动作效率和 token 使用。
早报判断是,智能体榜单接下来需要“双层报告”。第一层是尽量统一 harness 的模型对比,用来回答相同外部条件下谁更强;第二层是允许各家优化完整系统的部署对比,用来回答现实产品能做到什么。两层都有价值,但不能混成一个排名。前者牺牲部分产品特性以换取可比性,后者接受系统差异以换取现实性。
对 OpenAI 的结果应保持两面判断。13.3% → 38.3%足以证明运行配置不是可忽略噪声,也足以要求旧评测检查是否系统性低估长程能力;但单一厂商、单一模型、公开演示集和缺少完整消融,又不足以证明 retained reasoning 与 compaction 会普遍带来同量级收益。
更深一层的竞争变量是“可恢复的任务状态”。未来智能体的差距不只来自单步推理,还来自系统能否以低成本保存已经学到的规则、压缩长历史、在工具调用后继续原计划,并让外部审计者看清这些机制。模型权重仍然重要,只是权重不再能单独解释最终成绩。
一份可执行的复现清单
复现方首先应固定模型标识和推理档位,明确使用 GPT-5.6 Sol(max),并记录 API 版本、系统提示、采样参数、随机种子与并发策略。若模型服务会在后台更新,还要给出可追踪的 snapshot;否则“同名模型”在不同日期未必是同一被测对象。
其次应把状态管理写成实验变量。至少需要四组运行:两项都关闭、只保留推理、只启用 compaction、两项都开启。每组分别记录 RHAE、完成层数、动作数、输出 token、输入 token、墙钟时间与失败类型。只有这样才能知道 25 个百分点差异由哪项设置贡献,是否存在两项合用才出现的交互效应。
上下文策略也要逐项留档。报告不能只写“开启压缩”,还应公开触发阈值、压缩输入范围、压缩结果怎样回填、是否保留原始动作、失败时是否重试,以及 175,000 字符与 175,000 tokens的单位差异。截断和压缩处理的是同一资源约束,但它们保留下来的信息结构并不相同。
最后要把 public set 与 private evaluation 分开报告。公开集可用于调试和机制消融;若要证明泛化,需在不暴露环境机制的半私有或全私有集合上预注册配置后运行。跨模型比较还应同时提供统一 harness 与模型优化 harness 两组结果,避免把“谁更适合某家专有 API”误写成“谁的模型权重更聪明”。
这组实验已经足以改变评测实践,却还没有结束争论。下一份更有分量的证据不会是再报一个更高数字,而是让其他团队用同一配置重跑、让各项设置有独立消融,并观察排名在统一 harness、优化 harness、公开集和私有集之间如何移动。