Nvidia 把 Claude 从 30% 推到 100%:真正决定 AI Agent 的,可能不是模型
Nvidia 研究称,Claude Opus 5 在 ARC-AGI-3 互动推理测试中从约 30% 提升到 100%,关键变化是 AVO Harness 的记忆、工具循环和监督 Agent,而不是更换模型。这是单一基准与厂商自研配置,不能直接外推到所有生产任务,但它说明 Agent 的记忆、重试和监督层可能比模型排行榜更重要。
先说结论
Nvidia 这次没有发布一个新模型,却把同一个 Agent 的分数从 30% 推到了 100%。
8 月 21 日公开的 AVO 研究,把 Claude Opus 5 放进一套更复杂的 Agent Harness:更好的记忆、工具循环,以及一个负责把主 Agent 从死胡同里拉回来的“监督者”。在 ARC-AGI-3 互动推理测试里,裸模型约 30%,加上这套 Harness 后达到 100%。
这不是“Claude 已经全面碾压所有模型”,也不是所有任务都会提升 70 个百分点。它真正证明的是:长任务的表现,很大一部分来自模型外面的执行系统。
发生了什么
Nvidia 把 Harness 定义为包住模型的工具、记忆、运行时和规则。它决定 Agent 如何读取上下文、调用工具、记录尝试、发现失败,以及什么时候重新规划。
这次研究使用的 Agentic Variation Operators(AVO)还加入了一个监督 Agent。主 Agent 负责解题,监督者则像一个小型项目负责人:当主 Agent 重复走旧路、偏离目标或卡住时,提醒它换方向。
ARC-AGI-3 是一组没有说明书的互动 2D 游戏。Agent 不能只生成答案,而要观察环境、猜规则、连续行动,再根据反馈修正策略。它很适合暴露长任务里的“记忆断裂”和“错误累积”。
最容易被误读的数字
TechCrunch 转述 Nvidia 的结果:Claude Opus 5 在不使用这套 Harness 时约为 30%,使用 AVO 后达到 100%。这组数字很大,但它来自 Nvidia 选择的一个基准和一套自研配置。
它不能直接说明:
- AVO 在真实软件工程里也会得到 100%;
- Claude Opus 5 综合能力已经超过其他模型;
- 普通用户只要换一个 Prompt 就能复制结果。
比较稳妥的事实是:同一模型换执行系统,结果会大幅变化。 OpenAI 今年早些时候也报告过,调整 ARC-AGI-3 的上下文保留和压缩策略后,GPT-5.6 Sol 的分数从 13.3% 升到 38.3%。两项研究不是同一套实验,但方向一致。
反转:模型价格可能也不是模型价格
Agent 运行成本不只由每百万 Token 决定。
如果 Harness 会反复读取文件、保存更长记忆、启动监督者、失败后重试,那么同一个模型在不同系统里可能消耗完全不同的 Token。Databricks 此前也指出,选错 Harness 可能让同一个模型的成本翻倍。
所以“便宜模型”与“昂贵模型”的比较,至少要改成:
- 每次任务消耗多少 Token;
- 多少次尝试后成功;
- 返工和人工审核花多少时间;
- 最后每个可合并结果要花多少钱。
这对开发者有什么用
如果你在做 Coding Agent、浏览器 Agent 或企业自动化,最值得先改的可能不是模型,而是四个环节:
- 把关键状态写进可恢复的记忆,而不是只依赖上下文窗口。
- 让工具返回结构化结果,减少 Agent 靠猜测理解失败原因。
- 为长任务设置独立的检查者,发现重复动作时及时打断。
- 记录每一步的成本、失败原因和最终是否需要人工返工。
这并不等于所有产品都需要多 Agent。监督层也会增加延迟、复杂度和成本。短问答、一次性代码补全可能根本不值得使用。
我们的判断
Nvidia 这项研究最重要的价值,不是证明某个模型拿了满分,而是把大家的注意力从“模型排行榜”推向了“完整 Agent 系统”。
这也解释了为什么同一个 Grok、Claude 或 GPT,在不同 Coding 工具里的体验会出现明显差异。模型是大脑,Harness 才决定它有没有记忆、手脚和刹车。
但目前仍然不能把 AVO 当作通用生产方案。结果来自厂商自研 Harness,测试规模有限,真实软件项目中的安全、权限和维护成本还没有被同等验证。
仍然要观察
- Nvidia 是否会公开足够代码,让外部团队复现实验。
- AVO 在代码、浏览器和企业流程基准中是否仍然有效。
- 监督 Agent 带来的准确率提升,是否值得增加的 Token 和延迟。
- 开源 Harness 会不会比闭源模型本身更快形成生态壁垒。
对普通用户来说,下一次换模型前,先看看你正在用的 Agent 有没有好的记忆、重试、审批和验证机制。