同一个 DeepSeek,换个 Harness 掉 33 分:模型排行榜最容易骗人的地方暴露了
DeepSeek V4 Pro 0813 的官方模型卡在 DeepSeek Harness minimal mode、max reasoning effort 下报告 Terminal-Bench 2.1 为 87.9%;Vals 独立评测同一模型得到 54.68% ±1.50,相差 33.22 个百分点。它又在 Vals 统一 mini-swe-agent 的 SWE-bench Verified 上得到 96.4% ±0.83、排名第二。证据不支持“官方分数造假”或“已经全面追平 Claude”,更准确的结论是:它在边界明确的代码修补任务上很强,而 Agent 排名必须连同 Harness、工具、推理档位与运行规则一起读。
结论
同一个 DeepSeek-V4-Pro-0813,同一个 Benchmark 名字,出现了两张完全不同的成绩单。
DeepSeek 官方模型卡报告 Terminal-Bench 2.1 为 87.9%。Vals AI 独立测试得到 54.68% ±1.50,相差 33.22 个百分点。但在 Vals 用统一 mini-swe-agent 跑的 SWE-bench Verified 上,它又拿到 96.4% ±0.83,排在 86 个系统中的第二名,只比 Claude Opus 5 低 0.6 个百分点。
这不是“官方造假”或“DeepSeek 已经全面追平 Claude”的二选一。87.9% 和 54.68% 不是同条件复现,差别里混着 Harness、工具、Prompt、推理档位和运行规则。更稳妥的判断是:DeepSeek V4 Pro 在目标和验收都清楚的代码修补任务上非常强,但它的长程 Agent 能力还不能靠一张厂商表下结论。
87.9% 很亮眼,但小字不能省
DeepSeek 在 8 月 13 日发布 V4 Pro 0813。Hugging Face 模型卡显示,这是一个约 1.7T 参数、1M 上下文、MIT License 的开放权重模型。官方称 0813 相比 Preview 重点加强了 Agent 能力。
最抢眼的一行是 Terminal-Bench 2.1:
- DeepSeek V4 Pro 0813:87.9;
- Claude Opus 4.8:85.0;
- Claude Fable 5(带 fallback):88.0。
只看这张表,DeepSeek 已经贴住 Claude 的最强档。但模型卡也明确写了配置:公开代码 Agent Benchmark 使用 DeepSeek Harness minimal mode,reasoning_effort = max,temperature = 1.0,top_p = 0.95。
所以 87.9% 的准确说法不是“裸模型得到 87.9%”,而是:DeepSeek V4 Pro 加上 DeepSeek 选定的 Harness 和推理配置,在这次厂商评测里得到 87.9%。
第一个反转:独立测试只剩 54.68%
Vals 的 DeepSeek V4 Pro 0813 模型页给出的 Terminal-Bench 2.1 结果是 54.68% ±1.50,当前页面列为 57 个系统中的第 36 名。Vals 的更新说明称,这个结果来自三次完整运行,困难任务得分为 28.89%。
从 87.9% 到 54.68%,差了 33.22 个百分点。这已经不是四舍五入、随机种子或一两道题造成的小波动。
但这里也要踩住刹车。Vals 没有在该模型页证明自己逐项复制了 DeepSeek 的 System Prompt、Harness 版本、超时、重试和停止条件。因此这组差距可以证明“换一套评测系统,结果大幅变化”,不能单独证明“官方结果无法复现”或“厂商故意抬分”。
Harness 到底替模型做了什么
传统问答评测接近“给一道题,模型交一个答案”。Terminal-Bench 测的是一个会持续行动的系统。最终成绩至少受到这些部分影响:
- System Prompt 如何告诉模型规划、验证和结束;
- Shell、文件和其他工具如何暴露,返回结果是否容易理解;
- Context 满了以后保留什么、压缩什么;
- 命令失败后是否重试,重复几次会被打断;
- 每道任务的 Token、时间和步骤上限;
- Harness 什么时候判定已经完成,什么时候继续检查。
这些不是装饰。它们会决定模型能否找到文件、记住失败、修正路径,以及在做对以后及时停手。Terminal-Bench 上的 33 分差距,至少说明 Harness 不能再被当成排行榜脚注。
第二个反转:SWE-bench 上它又真的很强
如果 DeepSeek 的能力只存在于自家 Harness,换到统一环境后应该全面掉队。Vals 的 SWE-bench Verified 结果并不支持这个说法。
Vals 给所有模型同一个 mini-swe-agent,只开放 Bash 工具,让模型在隔离的 Docker 容器中处理 500 个经过人工核验的真实 GitHub Issue。8 月 19 日的榜单是:
- Claude Opus 5:97.0% ±0.76;
- DeepSeek V4 Pro 0813:96.4% ±0.83;
- GPT-5.6 Sol:96.2% ±0.86;
- Grok 4.6:95.6% ±0.92;
- GPT-5.6 Terra:95.4% ±0.94。
这里没有 DeepSeek 专用 Harness。它仍然排第二,而且 0.6 个百分点的差距落在两边误差线附近。至少在这套“读 Repo、定位问题、生成补丁、用测试验收”的任务上,DeepSeek 已经进入最强一档。
为什么两个 Benchmark 会画出相反画像
SWE-bench Verified 的任务边界相对清楚:给定真实 Issue 和代码库,最终补丁能否通过测试。模型当然仍要搜索、编辑和运行命令,但成功条件很明确。
Terminal-Bench 更依赖终端中的连续决策。Agent 要理解环境、组合命令、处理意外输出、恢复失败,再判断什么时候完成。任务越长,前面一次读错、忘记或误判就越容易在后面放大。
因此这三组数字可以同时成立:
- 87.9%:DeepSeek 选定系统下的厂商 Agent 成绩;
- 54.68%:Vals 独立 Terminal-Bench 系统下的成绩;
- 96.4%:Vals 统一 SWE-bench 修补环境下的成绩。
它们测量的不是一个抽象的“代码智商”。它们测的是模型在三种工作安排里的交付结果。
成本很诱人,但别拿冲突口径硬算倍数
DeepSeek 的价格优势仍然值得关注。不过 Vals 当前页面自己出现了一个需要保留的口径问题:模型页的更新文字写 SWE-bench 每次测试 $0.02,SWE-bench 榜单表格当前显示 $0.10;Claude Opus 5 的表格值为 $1.29。
在 Vals 解释这两个 DeepSeek 数字的差别前,本文不采用“便宜 60 倍”这样的精确结论。可以确认的是:按当前榜单表格,DeepSeek 的单测成本明显更低;不能确认的是,$0.02 和 $0.10 哪一个应作为长期可比口径。
对开发者怎么选
如果任务长得像 SWE-bench:Issue 明确、仓库明确、测试明确、修好就结束,DeepSeek V4 Pro 很值得进入候选。不要只跑公开题,拿团队自己的历史 Bug、重构和小功能做一组盲测,记录成功率、返工时间和每个可合并 PR 的总成本。
如果任务需要跨服务探索、打开网页、查日志、处理模糊需求,或者连续自主工作数小时,就不要把 96.4% 当成通用成功率。此时应测试完整产品,包括 Harness 的记忆、权限、重试、审批和失败恢复,而不只是更换 API 模型名。
更实用的路由可能是:边界明确的批量修补先用低成本模型,复杂任务交给长程表现更稳的系统,最后再由另一个模型或人工 Review。选择单位应是“每个可交付结果”,不是“每百万 Token”或“榜单最高分”。
我们的判断
这批结果反而提高了我对 DeepSeek V4 Pro 底层能力的评价。拿掉厂商专用 Harness 后,它没有在所有 Coding Benchmark 上崩掉,反而在统一 SWE-bench 环境中做到 96.4%。这是一条很硬的独立证据。
同时,87.9% 到 54.68% 也说明,它还不能被简化成“一个便宜版 Claude”。同一个 Checkpoint 放进不同执行系统,结果可能相差 33 分。今后引用 Agent 排行榜,至少要把模型、Harness、工具、推理档位、超时和成本一起写出来。
仍然要观察
- DeepSeek 是否会向 Terminal-Bench 官方榜单提交可复核配置;
- 87.9% 在公开 Harness、Prompt、超时和重试规则下能否被外部复现;
- Vals 的 $0.02 与 $0.10 成本口径如何统一;
- SWE-bench 接近饱和后,96% 左右的模型能否在更长、更模糊的真实任务中拉开稳定差距;
- 不同 Harness 对 DeepSeek、Claude、GPT 和 Qwen 是否存在系统性偏好。
来源与证据边界
- 一手来源:DeepSeek Hugging Face 模型卡,支持模型规格、厂商成绩和 Agent 配置;
- 独立评测:Vals DeepSeek 模型页,支持 Terminal-Bench 54.68% 与误差线;
- 独立统一评测:Vals SWE-bench Verified 页面,支持 96.4%、排名、统一 mini-swe-agent 和当前成本表;
- 评测方法:Vals methodology,说明误差线、成本和 Agent 系统评测边界。
本文没有把 87.9% 与 54.68% 写成同条件复现实验,也没有用两套不同 Benchmark 推导通用代码成功率。最确定的事实是:DeepSeek V4 Pro 在统一 Repo 修补测试中很强,而 Terminal-Bench 的巨大分差暴露了 Harness 对 Agent 成绩的实际影响。