AI Radar先替你读,再把 AI 变化讲明白
EN
Nvidia Harness 反转

Nvidia 把 Claude 从 30% 推到 100%:真正决定 AI Agent 的,可能不是模型

最后更新 2026-08-22编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
Nvidia 用 AVO Harness 将同一模型在 ARC-AGI-3 的结果从约 30% 推到 100% 的原创信息图
编辑绘图:30% 与 100% 来自 Nvidia 研究在同一模型、不同 Harness 下的结果,不代表所有生产任务。
一句话结论

Nvidia 研究称,Claude Opus 5 在 ARC-AGI-3 互动推理测试中从约 30% 提升到 100%,关键变化是 AVO Harness 的记忆、工具循环和监督 Agent,而不是更换模型。这是单一基准与厂商自研配置,不能直接外推到所有生产任务,但它说明 Agent 的记忆、重试和监督层可能比模型排行榜更重要。

先说结论

Nvidia 这次没有发布一个新模型,却把同一个 Agent 的分数从 30% 推到了 100%。

8 月 21 日公开的 AVO 研究,把 Claude Opus 5 放进一套更复杂的 Agent Harness:更好的记忆、工具循环,以及一个负责把主 Agent 从死胡同里拉回来的“监督者”。在 ARC-AGI-3 互动推理测试里,裸模型约 30%,加上这套 Harness 后达到 100%。

这不是“Claude 已经全面碾压所有模型”,也不是所有任务都会提升 70 个百分点。它真正证明的是:长任务的表现,很大一部分来自模型外面的执行系统。

发生了什么

Nvidia 把 Harness 定义为包住模型的工具、记忆、运行时和规则。它决定 Agent 如何读取上下文、调用工具、记录尝试、发现失败,以及什么时候重新规划。

这次研究使用的 Agentic Variation Operators(AVO)还加入了一个监督 Agent。主 Agent 负责解题,监督者则像一个小型项目负责人:当主 Agent 重复走旧路、偏离目标或卡住时,提醒它换方向。

ARC-AGI-3 是一组没有说明书的互动 2D 游戏。Agent 不能只生成答案,而要观察环境、猜规则、连续行动,再根据反馈修正策略。它很适合暴露长任务里的“记忆断裂”和“错误累积”。

最容易被误读的数字

TechCrunch 转述 Nvidia 的结果:Claude Opus 5 在不使用这套 Harness 时约为 30%,使用 AVO 后达到 100%。这组数字很大,但它来自 Nvidia 选择的一个基准和一套自研配置。

它不能直接说明:

  • AVO 在真实软件工程里也会得到 100%;
  • Claude Opus 5 综合能力已经超过其他模型;
  • 普通用户只要换一个 Prompt 就能复制结果。

比较稳妥的事实是:同一模型换执行系统,结果会大幅变化。 OpenAI 今年早些时候也报告过,调整 ARC-AGI-3 的上下文保留和压缩策略后,GPT-5.6 Sol 的分数从 13.3% 升到 38.3%。两项研究不是同一套实验,但方向一致。

反转:模型价格可能也不是模型价格

Agent 运行成本不只由每百万 Token 决定。

如果 Harness 会反复读取文件、保存更长记忆、启动监督者、失败后重试,那么同一个模型在不同系统里可能消耗完全不同的 Token。Databricks 此前也指出,选错 Harness 可能让同一个模型的成本翻倍。

所以“便宜模型”与“昂贵模型”的比较,至少要改成:

  • 每次任务消耗多少 Token;
  • 多少次尝试后成功;
  • 返工和人工审核花多少时间;
  • 最后每个可合并结果要花多少钱。

这对开发者有什么用

如果你在做 Coding Agent、浏览器 Agent 或企业自动化,最值得先改的可能不是模型,而是四个环节:

  1. 把关键状态写进可恢复的记忆,而不是只依赖上下文窗口。
  2. 让工具返回结构化结果,减少 Agent 靠猜测理解失败原因。
  3. 为长任务设置独立的检查者,发现重复动作时及时打断。
  4. 记录每一步的成本、失败原因和最终是否需要人工返工。

这并不等于所有产品都需要多 Agent。监督层也会增加延迟、复杂度和成本。短问答、一次性代码补全可能根本不值得使用。

我们的判断

Nvidia 这项研究最重要的价值,不是证明某个模型拿了满分,而是把大家的注意力从“模型排行榜”推向了“完整 Agent 系统”。

这也解释了为什么同一个 Grok、Claude 或 GPT,在不同 Coding 工具里的体验会出现明显差异。模型是大脑,Harness 才决定它有没有记忆、手脚和刹车。

但目前仍然不能把 AVO 当作通用生产方案。结果来自厂商自研 Harness,测试规模有限,真实软件项目中的安全、权限和维护成本还没有被同等验证。

仍然要观察

  • Nvidia 是否会公开足够代码,让外部团队复现实验。
  • AVO 在代码、浏览器和企业流程基准中是否仍然有效。
  • 监督 Agent 带来的准确率提升,是否值得增加的 Token 和延迟。
  • 开源 Harness 会不会比闭源模型本身更快形成生态壁垒。

对普通用户来说,下一次换模型前,先看看你正在用的 Agent 有没有好的记忆、重试、审批和验证机制。