AI Radar先替你读,再把 AI 变化讲明白
EN
Faraday AI 科学家

27B小模型“打败Claude”刷屏,但真相更有意思:它把GPT-5.5当下属用了

最后更新 2026-08-24编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
Faraday 27B 研究负责人调用 GPT-5.5 Codex 编码,并在 Replica 测试中取得 0.791 分的原创信息图
编辑绘图:Faraday 负责科研判断,GPT-5.5 Codex 负责编码执行;Replica 是 Inherent 自建评测,结果仍待外部复现。
一句话结论

Inherent 的 Faraday 基于 Qwen3.6-27B,在自建 Replica 论文复现 Benchmark 的 held-out AI-for-science 测试中得到 0.791,高于 Claude Opus 4.8 的 0.748 和 GPT-5.5 Codex 的 0.729。它并非 27B 单挑大模型:Faraday 负责科研判断,会调用 GPT-5.5 Codex 写代码和执行实验。真正值得关注的是 Manager + Specialist 的 Agent 组织方式;Replica 与评分体系仍需外部独立复现。

结论

Inherent 发布的 Faraday 是一个基于 Qwen3.6-27B、专门训练来复现科研论文的 AI Scientist。在 Inherent 自建的 Replica Benchmark 上,Faraday 的 held-out AI-for-science 平均分为 0.791,高于 Claude Opus 4.8 的 0.748 和 GPT-5.5 Codex 的 0.729

但“27B 小模型击败 Claude”不是这项工作的准确摘要。Faraday 会把代码实现和执行交给 GPT-5.5 Codex,自己负责读论文、定实验方向、判断结果和决定下一轮动作。更值得关注的结论是:一个较小的 Manager Agent,学会组织更强的 Specialist Agent 后,可能比旗舰模型从头到尾单干更有效。

Replica 是 Inherent 自己设计的 Benchmark,评分也依赖经过人工校验的 LLM rubric judge,目前还缺少外部团队的独立复现。Faraday 证明的是一条很有潜力的 Agent 组织路线,不是 27B 参数已经全面超过 Claude 或 GPT。

27B 模型为什么会被写成“打败 Claude”

Inherent 找了 100 篇机器学习与 AI for Science 论文,抽取出 310 个复现任务。它给 Agent 论文正文,但删掉一张关键结果图,让模型自己推断原作者做了什么实验。

模型要读方法、猜缺失细节、设计可行的缩小版实验,写代码,运行实验,再根据结果调整方案。242 个任务属于训练分布,另外 68 个 AI-for-science 任务作为 held-out 测试。

最终结果如下:

| Agent | 训练分布 242 题 | Held-out 68 题 | | --- | ---: | ---: | | Qwen3.6-27B Base | 0.678 | 0.554 | | GPT-5.5 Codex | 0.796 | 0.729 | | Claude Opus 4.8 | 0.828 | 0.748 | | Faraday | 0.856 | 0.791 |

所以 Faraday 确实领先:held-out 上比 Claude 高约 5.7% 相对分数,比 Codex 高约 8.5%。这不是“27B 参数碾压 400B 参数”的证据,但足以说明它在这类任务上学到了有用的工作方式。

真正的反转:它把 GPT-5.5 叫来写代码

Faraday 的身份更像研究负责人,而不是一个单体模型。

它负责理解论文、提出假设、决定实验先后、检查结果是否可信;需要落地时,它调用 GPT-5.5 Codex 写代码、修改实现和执行具体工程工作。结果返回后,Faraday 再决定继续、回退还是换一个实验。

因此,论文里的对照其实是两种工作流:GPT-5.5 Codex 自己完成整个科研复现,或者 Faraday 负责研究判断、GPT-5.5 Codex 负责编码执行。后者分数更高,并不等于 Faraday 的内部知识超过了 GPT-5.5。

换句话说,这不是小学生单挑博士,更像一个科研判断力很强的负责人,带着一个顶级程序员做项目。团队分工本身成为了能力的一部分。

它学到的可能是“怎么带 Agent”

Faraday 训练阶段主要学习调用 GPT-5.4-mini,测试时却可以换成更强的 GPT-5.5 Codex。这个细节很重要:如果结果稳定,它说明 Manager 学到的可能不是某个模型的固定提示词,而是更通用的科研工作流。

一个 Manager 可以长期在线,负责目标、上下文、进度和验收;Coding、搜索、视觉、数学和数据库任务则交给不同 Specialist。底层工具升级时,上层 Manager 不一定要全部重训。

这也是 Agent 产品正在走向的结构:模型像员工,Harness、工具和验收循环像公司制度,Manager 决定什么时候该让谁工作。

同一个 27B 基座,训练后涨了 43%

Faraday 最漂亮的数据,不是它领先 Claude 的几个百分点,而是同一个 Qwen3.6-27B 基座在 held-out AI-for-science 测试上从 0.554 提升到 0.791,相对提升约 43%

变化主要来自长程强化学习。模型不断尝试科研决策,等实验完成后再获得反馈,逐渐学会哪些假设值得验证、哪些错误应该尽快放弃。

这提示我们,很多 Base Model 可能还没有被充分训练成真正的工作型 Agent。下一轮竞争未必只是继续堆参数,也可能是把模型训练成更好的负责人。

但它还没有证明自己会发现新科学

Replica 复现的是已经发表的论文。答案存在,只是结果图被隐藏了。Faraday 需要找回作者没有写进论文的实验细节,但它还没有证明能发现新材料、提出新药物或找到未知规律。

Inherent 自己也把 Replica 定位成从 replication 走向 innovation 的台阶。先让 Agent 学会稳定做科研,再谈真正的发现,这个顺序是合理的,但不能把两者混为一谈。

这组分数要怎么读

Replica 是 Inherent 自己构建的 Benchmark,Faraday 又在同类任务上做了强化学习。最终分数依赖 Inherent 设计的 rubric-based LLM judge。团队做了人工验证,称这套 judge 比普通 baseline 更稳定、更接近研究者判断,但自动评分与训练奖励仍共享一套 rubric,存在一定循环性。

所以目前最稳妥的说法是:Faraday 在 Inherent 自建、并进行人工校验的 Replica Benchmark 上超过 Claude Opus 4.8 和 GPT-5.5 Codex;这项结果还需要外部任务、不同评分器和独立团队复现。

我们的判断

Faraday 真正有意思的地方,不是 27B 这个数字,而是它把模型竞争从“谁的大脑更聪明”改成了“谁更会组织一群 AI”。

一个便宜的 Manager 负责长期判断,遇到编码、搜索或极难推理时再临时调用贵模型,可能比每一步都让旗舰模型亲自做更划算。对企业 Agent 来说,这直接关系到延迟、成本、失败恢复和权限边界。

它也提醒我们,Benchmark 的比较单位不一定应该是单个模型。未来更值得比较的,可能是:一个 Manager 加上若干 Specialist,最终花多少钱,完成了多少件可以验收的工作。

仍然要观察

  • 外部团队能否在不同科研论文和不同 judge 上复现 Faraday 的领先;
  • Faraday 换用其他 Coding Agent 后,Manager 能力是否仍然成立;
  • 训练分布之外的生物、材料和气象任务能否继续保持优势;
  • Manager + Specialist 是否能稳定降低每个成功科研任务的总成本;
  • Faraday 何时从复现已有论文,进入可验证的新发现任务。

来源与证据边界

  • 一手研究:Inherent《Training AI Scientists to Replicate Research》
  • 研究论文:arXiv 2608.13331
  • 独立解读:AI Adventurer 对 Replica 分数和训练方式的整理
  • 论文评论:Pith 对评分体系、循环性和外部复现的提醒

本文把“Faraday + GPT-5.5 Codex 的 Agent 系统”与“GPT-5.5 Codex 单独完成任务”分开比较。Replica 是 Inherent 自建评测,当前没有大规模独立复现;论文结果不能直接推出 Faraday 已经全面超过 Claude、GPT 或其他科研系统。