AI Radar先替你读,再把 AI 变化讲明白
EN
模型与 Harness

同一个 Claude,30 分变 96 分:真正限制 AI 的可能已经不是模型,而是 Harness

最后更新 2026-08-24编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
同一个 Claude Opus 5 在 ARC-AGI-3 裸模型得分 30.16%,放进 Claude Code 得分 96.2%,另一套 Skill 达到 100.00 的原创信息图
编辑绘图:ARC 官方 30.16% 是 model-only 结果,96.2% 与 100.00 是独立 Harness 系统实验,不能混为同一排行榜。
一句话结论

ARC Prize 官方的 model-only 评测中,Claude Opus 5 (High) 在 ARC-AGI-3 得到 30.16%;独立开发者把同一个模型放进 Claude Code 后跑到 24/25、96.2%,另一套 arc-skill 经 ARC replay 验证达到 25/25、183/183 levels、RHAE 100.00。这些不是同一排行榜的可比成绩,却显示在陌生环境探索任务里,Harness、外部记忆、工具和反馈循环可能与模型本身同样重要。

结论

ARC Prize 官方的 model-only 评测里,Claude Opus 5 (High) 在 ARC-AGI-3 得到 30.16%,完成了 25 个公开环境中的 5 个此前没有模型完成的环境。随后,独立开发者 Jeremy Berman 把同一个 Opus 5 放进接近原生的 Claude Code,只提供 shell、文件系统、动作命令和日志,跑到 24/25、96.2%;另一套由 Poobesh Gowtham 制作的 arc-skill 又在 ARC 服务器 replay 后验证为 25/25、183/183 levels、RHAE 100.00

这不是 Claude 官方把 ARC 分数从 30% 更新到 100%,也不是三个数字可以直接排进同一张排行榜。30.16% 测的是裸模型,96.2% 和 100.00 测的是模型加 Harness、外部记忆、工具和反馈循环。它们共同说明:在需要探索陌生环境的任务里,模型如何工作,可能和模型本身一样重要。

同一个模型,成绩为什么差这么多

ARC-AGI-3 不给游戏规则。Agent 要观察一个陌生环境,尝试动作,记录画面变化,推断目标和机制,再修正自己的假设。它更像第一次拿到一款没有说明书的游戏,而不是回答一道已经定义好的题。

ARC Prize 的官方 model-only 结果是:

| 评测设置 | ARC-AGI-3 分数 | | --- | ---: | | Claude Opus 5 (High) | 30.16% | | GPT-5.6 Sol (Max) | 7.78% | | Claude Opus 4.8 (High) | 1.5% |

这个测试有意把工具和工程脚手架压到最低,目的是观察模型本身的泛化能力。它回答的是“这个模型裸跑时能做到什么”,不是“给它一套长期工作环境后,整个系统能做到什么”。

第一个反转:Claude Code 让它自己写 Solver

Jeremy Berman 的实验没有重新训练 Opus 5,也没有给它 ARC 专用解题器。他使用 stock Claude Code,批准的工具只有 Bash、Read、Write、Edit、Grep 和 Glob,另外通过一个动作命令与游戏交互。

模型可以读写文件、查看日志、运行自己的 Python 程序。于是它在每个游戏里临时制造需要的工具:解析器、规则模型、模拟器、路径搜索和验证脚本。一次 25 游戏的运行中,它写出了 269 个程序、约 12,700 行代码,游戏结束后再丢弃。

第一次完整运行:

| 系统 | ARC 分数 | 完成游戏 | 动作数 | 估算成本 | | --- | ---: | ---: | ---: | ---: | | Claude Code + Opus 5 | 96.2% | 24/25 | 8,789 | 约 $540 | | Claude Code + GPT-5.6 Sol | 73.7% | 19/25 | 26,971 | 至少约 $424 |

唯一失败的游戏重跑一次后成功,Opus 5 的 pass@2 达到 99.3%。但这仍是一轮初步实验,不是几十次重复后的稳定均值;两边 reasoning effort 也不同,Sol 用的是 xhigh,Opus 用 high。

第二个反转:另一套 Skill 直接拿到满分

如果 96.2% 只有一个人跑出来,仍然可以怀疑 Prompt 调优或偶然性。随后 Poobesh Gowtham 做了另一套 arc-skill,没有复制第一套实现,也没有在指令中写入 25 个游戏的答案。

它的规则很朴素:每次消耗动作前,先写出这个动作预计会让哪些格子如何变化。Harness 拒绝没有预测的动作;预测错了,就把发生变化的棋盘记录下来,迫使 Agent 修正模型。

最终结果是:

  • 25/25 games 完成;
  • 183/183 levels 完成;
  • RHAE 100.00,达到该指标上限;
  • 总计 7,645 actions,ARC 给出的中位人类基线约为 17,135
  • 全部操作通过 ARC 服务器 replay,公开 scorecard 为 24ddb219

这套 Skill 本身只有 129 行指令和一个 4,343 行的命令行工具,作者称没有写入任何一个游戏的专用答案。它不是证明“一个 Prompt 能解决 ARC”,但至少让 96.2% 不再像一个孤立截图。

真正变化的,是模型工作时的环境

把这些实验拆开看,Claude Code 给 Opus 5 的并不是神秘外挂,而是几件很具体的东西。

外部记忆。 日志和笔记写进文件,模型可以用 grep、Python 和文本文件找回半小时前的观察,不必把所有状态塞在当前上下文里。

临时工具。 工程师没有提前写好一个通用 ARC Solver,模型可以根据当前游戏自己写 parser、simulator 或 search。它把“解题草稿”变成了可运行的软件。

反馈循环。 每个动作都会返回新的棋盘和日志。arc-skill 又加了一道可证伪预测:先说预期,再按按钮,结果不符就更新假设。

停止条件。 这类任务不只考能不能猜对,还考什么时候已经理解规则、可以批量执行。Berman 的记录里,Opus 5 用更少动作完成更多游戏,说明探索和计划执行之间的切换也很重要。

这不等于“模型排行榜没用了”

裸模型评测仍然有价值。它让不同模型在相近条件下比较基础能力,也能避免把工程师写的 Solver 误算成模型能力。

但用户实际购买的是系统,不是 model card 上的一行分数。一个 30 分的裸模型,配上日志、终端、动作工具和验证循环,可能完成 96 分的工作;另一个基础分更高的模型,如果不会保存状态、不会写临时程序或不愿验证假设,真实任务未必更好。

这也是为什么同一个模型放进 Cursor、Claude Code、Codex 或 OpenCode,会出现不同体验。差异不只来自模型版本,还来自 Harness 如何管理上下文、工具、权限、记忆和失败恢复。

但 100 分也不能直接外推到所有 Agent

ARC-AGI-3 的社区成绩与官方 model-only 榜单是两条赛道。ARC 社区已有专门为 ARC 设计的系统拿到更高分;arc-skill 的 100.00 也只说明这套公开环境和这次 replay 全部通过。

Berman 的实验作者明确把结果称为 preliminary。完整运行成本、崩溃恢复、不同 reasoning effort 和跨模型可迁移性都还需要更多重复。更重要的是,陌生小游戏的探索能力能否迁移到代码库、ERP、科研环境,不能靠 25 个游戏自动证明。

我们的判断

这轮实验最值得记住的不是 30.2 → 96.2 这个夸张箭头,而是箭头中间发生了什么:模型拥有终端、文件、日志和可观察反馈后,开始在运行时为每个任务制造自己的小型工具链。

过去 Agent 工程常把聪明写进 Harness:预设 Planner、Retriever、World Model、Solver 和 Memory。现在更强的模型可能把其中一部分重新“吃回去”,自己决定要写什么脚本、保存什么状态、验证哪一个假设。

这会改变产品比较方式。以后问“哪个模型 ARC 分数最高”仍然有意义,但还要问:它在什么环境里工作?能否把状态写到外部?能否自己造工具?错误后会不会改变计划?完成一件任务的总动作、时间和成本是多少?

仍然要观察

  • 96.2% 和 100.00 能否在更多独立重复运行中保持;
  • 同一套薄 Harness 换到其他陌生任务后,优势能否迁移;
  • Agent 自己写的临时工具是否会带来新的安全、权限和审计问题;
  • 更强的模型是否真的需要更少的预置工具,还是只是在 ARC 上恰好适配;
  • 总成本、失败恢复和人为监督时间,能否成为比单次 Benchmark 分数更稳定的系统指标。

来源与证据边界

  • 一手评测:ARC Prize,Claude Opus 5 ARC-AGI-3 model-only 结果
  • 独立实验:Jeremy Berman 的 arc-code,96.2% 运行记录与代码
  • 独立 Skill / replay:Poobesh Gowtham 的 arc-skill,25/25、100.00 与 ARC scorecard

本文把 ARC 官方的 30.16% 与社区 Harness 的 96.2% / 100.00 分开呈现。后两者是独立开发者的系统实验,不是 ARC 官方 model-only 排行榜成绩;成本、跨任务泛化和重复稳定性仍待继续验证。