Grok 4.6 真追上 GPT-5.6 了?跑分赢 Sol,真实写代码却出现完全不同答案
Grok 4.6 High 在 CursorBench 3.2 以 69.9% 领先 GPT-5.6 Sol Max 的 67.2%,两者在 Artificial Analysis Intelligence Index 同为 61;但 Sol 在 DeepSWE 和 Terminal-Bench 明显领先,一位 Cursor 用户的约 2500 行后端个案也以 60:40 选择 Sol。Grok 已进入第一梯队,是否更适合你取决于任务、Harness、返工率和每个可合并 PR 的总成本。
先说结论
Grok 4.6 的跑分已经摸到 GPT-5.6 Sol,但真实 Coding 用户没有因此达成共识。 CursorBench 3.2 里,Grok 4.6 High 为 69.9%,GPT-5.6 Sol Max 为 67.2%;Artificial Analysis Intelligence Index 两者同为 61。可一换到 DeepSWE 1.1,Sol 以 73% 对 65.9% 拉开差距;Terminal-Bench 3.0 也是 Sol 领先,34.6% 对 26%。
这不是“Grok 全面超过 Sol”,而是一个更实用的反差:排行榜测的是特定任务、特定推理档位和特定 Harness;真实用户要交付的,却是边界条件、并发安全和能不能放心合并的代码。
第一幕:Grok 4.6 确实进入了第一梯队
8 月 12 日,xAI 与 Cursor 发布 Grok 4.6。官方定位不是普通聊天升级,而是长时间运行的 Agent、复杂 Coding、知识工作和交互式视觉项目。
Cursor 的公开表格给出了一组很容易被转发的数字:
- CursorBench 3.2:Grok 4.6 High 69.9%,Sol Max 67.2%;
- FrontierCode 1.1 Extended:61.3% 对 60.6%;
- APEX-Agents:57.5% 对 56.7%;
- Artificial Analysis Intelligence Index:两者都是 61。
因此,“Grok 4.6 已经是顶级 Coding Agent”是有公开依据的。它不再只是比上一代多几个百分点的追赶者。
但“进入第一梯队”和“全面打赢 Sol”是两句话。
第二幕:换一场考试,排名马上反转
同一张官方表格里,DeepSWE 1.1 的结果是 Sol 73%、Grok 65.9%;Terminal-Bench 3.0 则是 Sol 34.6%、Grok 26%。这两个差距比 CursorBench 的领先更醒目。
原因并不神秘。Agent Benchmark 不是一门统一考试:有的偏跨文件改代码,有的偏终端操作,有的更重长轨迹和软件工程,有的还会把 Harness 的检索、重试和上下文管理一起算进最终体验。
所以“Grok 超过 Sol”既可以是真的,也可以是误导。你必须先问:测的是什么任务,开的是什么档位,模型被放进了哪套工具链?
第三幕:2500 行后端代码把排行榜的盲区照了出来
排行榜发布后,一位 Cursor 用户把 Grok 4.6 Extra High 和 GPT-5.6 Sol Medium 放进同一个约 2500 行后端功能任务,使用相同代码库、方案和起点,再让另一个模型独立评审。
他的结论不是 Grok 完不成,而是 Sol 约 60:40 占优:在金额边界情况、race condition 风险、整体架构和测试质量上更成熟。
这只是单用户实验,不能证明 Sol 在所有项目都更好。但它提出了 Coding Agent 最容易被跑分掩盖的问题:
“把任务做完”不等于“交付一份敢上线的代码”。
真实团队还要看错误处理、维护成本、隐含竞态、测试是不是只为过关,以及改动有没有把别的模块变复杂。许多 Benchmark 很难把这些质量差异压成一个 0/1 的成功分数。
真正有杀伤力的数字,可能是每个成功任务多少钱
Grok 4.6 的 API 起价是每百万输入 token $2、每百万输出 token $6,快速版本价格翻倍。Cursor 页面还公开了 CursorBench High 档的一组成本:约 69.9% 的得分、$2.34/task、32,449 tokens 和 39 steps。
社区进一步整理过 Extra High 的约 70.8%、$2.81/task 估算,并拿它和更贵的配置比较。这个数字来自社区整理,不是 Cursor 的独立成本审计,因此只能当作线索。
但问题本身很关键:企业最后买的不是“每百万 token 便宜多少”,而是完成一个可合并 PR 的总成本。
如果 Sol 一次成功率略高,却贵很多;Grok 偶尔需要返工,但单次便宜,答案就不再是“谁的榜单分更高”,而是“哪个配置的成功任务成本更低”。
便宜模型也可能用更多推理把账单吃回来
多名 Cursor 用户反馈,Grok 4.6 比 4.5 更吃 reasoning token。这个观察目前主要来自社区,不是统一受控实验;但它提醒我们,每百万 token 价格并不等于每个任务价格。
模型 A 每百万 token $10,一次任务用 1M,成本是 $10。模型 B 每百万 token $3,看起来便宜 70%;如果它反复读文件、回滚和重试,最后用了 5M,实际账单就是 $15。
对 Agent 更有意义的指标应当是:
- 每个成功任务的成本;
- 每个可合并 PR 的成本;
- 返工后的总耗时;
- 最终需要人工审查的风险。
还要把 Cursor 这套 Harness 放进公式里
Grok 4.6 与 Cursor 联合训练,Cursor 也披露训练覆盖不同 Agent Harness 的轨迹。因此 CursorBench 很强,不能自动解释成“底层模型在任何地方都一样强”。
Coding Agent 的实际能力更像:模型 + System Prompt + 文件检索 + 工具 + 上下文管理 + 压缩策略 + 失败重试 + 测试循环。
同一个 Grok 4.6,换一个 Harness 后可能得到不同结果。反过来,Sol 在另一个工具链里也未必保留同样优势。现在社区问“CursorBench 测的是 Grok,还是 Grok 加 Cursor”,这是合理的测量问题,不是阴谋论。
我们的判断:值得试,但不值得立刻退订 Sol
对普通实现、前端原型、批量修改和成本敏感的 Coding 任务,Grok 4.6 已经足够强,值得在自己的仓库里试一轮。它的公开榜单成绩、价格和长任务定位都给了这次试用一个充分理由。
但复杂后端、金额系统、并发控制、架构决策和生产前最终 Review,当前证据还不足以让我们建议直接取消 Sol。单用户 2500 行实验不是科学 Benchmark,却准确提醒了高风险任务的代价:一个被漏掉的边界条件,可能比省下几美元更贵。
更聪明的用法可能不是二选一:普通实现交给 Grok,难 Bug 和架构审查交给 Sol 或其他强模型,再让独立模型做一次 Review。你买的不是“世界第一模型”,而是一支按任务分工的 AI 开发团队。
仍然要观察
- Grok 4.6 在独立 Harness、不同代码库和更大样本上的表现是否稳定;
- CursorBench 的成本数字能否在真实项目复现,而不是只在官方任务分布中成立;
- 社区关于 reasoning token、返工率和测试质量的观察能否变成受控对比;
- “$/成功任务”和“$/可合并 PR”是否会取代每百万 token 价格,成为团队选型的主指标;
- Grok 与 Sol 在高风险后端任务上的边界条件和并发缺陷,是否出现更多公开复核。
*编辑说明:官方分数与价格来自 xAI、Cursor 页面;2500 行后端对比和 token 消耗观察来自社区个案,不代表总体结论。本文把已确认事实、编辑判断和仍未知部分分开,读者应带着自己的代码库做小规模实测。*