AI Radar先替你读,再把 AI 变化讲明白
EN
AI 榜单吃瓜

K3 106、Grok 111:这个 AI 榜单开始“自己打脸”了

最后更新 2026-08-20编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
K3、Grok 和 DeepSeek 通过不同 Harness 进入真实任务,并按 IQ、时间和成本比较的原创信息图
编辑绘图:Codex Radar 的 IQ 是自定义展示尺度;动态众测会持续刷新,公开内测成绩不参与正式推荐。
一句话结论

Codex Radar 不只比较模型,还把 Harness、推理档位、真实任务完成率、耗时和成本一起公开。K3、Grok 和 DeepSeek 的分数会实时变化,内测数字不能直接封神。

先说结论

K3 106、Grok 111、DeepSeek V4 Pro 92——这张榜单看起来像 AI 版智商排名,真正离谱的却是:它不让模型做选择题,而是让网友自己烧额度,拿真实任务把模型按在电脑前干活。

我第一次看到群里的截图时,第一反应是:K3 已经把 Grok 和 DeepSeek 按在地上了吗?

再打开分布式雷达(Distributed Radar)看,事情马上反转:榜单会每 60 秒刷新;Kimi Code、ZCode、Grok 仍是公开内测 Harness;所谓 IQ 是站方自定义的换算尺度,不是人类智商;而且某个档位的 111 分,并不等于整个模型已经赢了。

这就比一张“某模型天下第一”的海报有意思多了。

因为它测的不是发布会上的模型,而是:模型带着哪套壳、开了多高推理、花了多少时间和钱,最后能不能把活干完。

一张榜单,先把 AI 圈的“第一名”搞得有点尴尬

用户提供的截图里,数字是:

  • K3:106 IQ
  • Grok 4.6:97 IQ
  • DeepSeek V4 Pro:92 IQ
  • DeepSeek V4 Flash:80 IQ
  • GLM-5.3:77 IQ

但我在 2026 年 8 月 20 日重新查看 DeepSWE 看板时,当前页面已经出现另一组动态观测:K3 总体仍显示 106,Grok 4.6 总体显示 98;某些 Grok 4.6 档位则达到 110、111。DeepSeek V4 Pro 在 DSH 下显示 92,max 档位约 97。

数字变了,不是网站出错,而是这本来就是一个活榜单。新任务、新样本、新 Harness 会不断把旧成绩往前推。你今天截下来的“王座”,可能几个小时后就换人。

所以本文不把 K3 写成永久第一,也不把 Grok 的某个高分写成全面反超。更准确的说法是:这些配置在当前公开众测里表现亮眼,但样本、档位和测试壳都必须一起看。

106 IQ 到底是什么?先别把它当人类智商

分布式雷达的 IQ 是站方自己的展示尺度。按页面说明,测试完成百分比乘以 1.5,会换算成 Radar IQ。

换算一下,106 IQ 大约对应 70.7% 的任务完成率;100% 完成率则约等于 150 IQ。

它表达的是:在这套任务和评分规则里,某个模型配置完成了多少工作。

它不是心理测量学意义上的 IQ,更不能据此说 K3 “智商 106”、Grok “智商 111”。如果把截图直接发成“AI 智商超过人类”,那就已经从有趣的跑分滑向标题党了。

最刺激的反转:Grok 111 也不能封神

当前看板里,Grok 4.6 的 high、medium 档位出现过高于总体分数的结果,high 甚至达到 111。但这类结果来自公开内测 Harness,页面明确标注为暂定分数,样本不足,不参与正式推荐、排序和曲线。

这意味着 111 分更像一条值得追踪的线索,而不是冠军奖杯。

K3 + Kimi Code 也一样。K3 当前总体 106,页面同时展示 max、high、low 等不同档位,完成题数和成功率并不相同。模型名称只是半个答案,另一半藏在 Harness 和推理档位里。

这正是传统“模型排行榜”最容易漏掉的东西。

这个网站测的其实不是模型,而是一整套工作流

分布式雷达当前把 Codex、DSH、Kimi Code、ZCode 和 Grok 分开观察。它还把 max、xhigh、high、medium、low 等推理档位拆开。

换句话说,它比较的不是抽象的“DeepSeek vs Grok”,而是:

某个模型 + 某套 Harness + 某个推理档位 + 一组工具和上下文,能否在真实工程任务里交付结果?

同一个模型换一套壳,表现可能完全不同。Harness 负责工具调用、文件读写、上下文管理、记忆和 Agent 循环;模型负责生成判断,但最终能不能落地,要看整辆车有没有接好。

所以 DeepSeek V4 Pro 在 DSH 下的成绩,不能和另一种 provider 配置简单视为同场对决。它们的 API、工具链、样本量和成本可能都不同。榜单最有价值的地方,恰恰是把这些差异摆在明面上。

它不问“会不会答”,而是直接把题丢进代码库

目前重要的 DeepSWE 测试不是几道数学选择题,而是软件工程任务。页面展示的任务包括 FastAPI 选项处理、Bandit 跨过程污点分析、类型绑定和数据快照差异等真实代码问题。

模型要读项目、理解上下文、修改文件、运行测试,然后提交补丁。最后评分的是补丁在干净环境里能不能通过验证。

这和“请写一个冒泡排序”不是一个物种。

普通 Benchmark 测模型会不会给出漂亮答案;这种测试追问的是:

你能不能在半小时后还记得自己改了什么,并且没有顺手把项目的另一处弄坏?

最赛博朋克的部分:网友自己烧额度给全网跑分

分布式雷达不是站长租一堆机器关起门来测。用户可以用 GitHub 登录,选择自己的 Codex 订阅档位,认领任务,把提示词交给 Codex 或对应 Agent 执行,再把结果贡献回公共看板。

站点把这个动作叫“蹬雷达”,贡献者排行榜叫“雷达天梯”。页面当前显示总蹬速约 135,419 刀、累计约 3,296 亿词元、约 770 名贡献者。

这意味着榜单背后不是一张静态宣传图,而是一群人用自己的订阅额度做公共实验:有人跑一题,有人连续跑几十题,结果慢慢汇成模型、Harness、时间和成本的地图。

当然,这也意味着数据不是实验室里一次性锁死的标准答案。用户贡献的任务分布、账号额度、网络环境和执行策略,都会影响样本。

客户端说成功不算,服务器还要重新验

如果用户只要点一下“成功”,榜单早就会变成大型自我安慰现场。

分布式雷达的设计是:客户端提交补丁后,服务端把它放回干净环境重新验证;任务运行在一次性隔离 Docker 容器里,同时做轨迹审计和敏感信息检查。站点也明确写着,客户端自报成功不会直接成为最终成绩,有问题的提交会冻结并复核。

这让它比“网友投票谁最强”严肃不少,但仍然不等于经过完整同行评审的科学实验。任务分布、样本偏差、公开内测和不同 Harness 的配置差异,都应该出现在读者的判断里。

为什么榜单还在测庞贝壁画?AI 不只会写代码

分布式雷达另一个频道测试的是庞贝壁画碎片邻接恢复:模型看到破碎的壁画片段,判断哪些碎片原本相邻,再用 Precision、Recall 和 F1 评分。

这不是把视觉题硬塞进代码榜,而是单独观察另一种能力:空间关系、碎片匹配和不完整信息下的推理。

主站进一步尝试用 Composite Intelligence 把软件工程和视觉空间推理放进同一张雷达。这个方向还谈不上成熟的“综合智力排名”,但它透露出一个很重要的判断:未来的 Agent 竞争,不会只发生在代码补全窗口。

普通人打开这个榜单,应该看哪五件事?

第一,看完成率或 F1,不要只看 IQ 大数字。

第二,看 Harness。Codex、DSH、Kimi Code 和 Grok 不是同一个执行环境。

第三,看 reasoning effort。max 可能更稳,也可能只是更慢、更贵。

第四,看样本数和是否内测。7/8 和 174/269,可信度不是一个量级;公开内测暂定分数不能拿来盖棺定论。

第五,把时间和成本一起算。对真实工作来说,“成功率高 3 分但多花 6 倍钱”未必是胜利。

我认为这个排序比“谁最聪明”实用得多:给它一美元和半小时,它到底能替你完成多少工作?

我们的判断:最值得追的不是 K3,而是这套民间测功机

K3 的 106 很吸睛,Grok 的 111 更适合做传播截图,DeepSeek V4 Pro 的 92 则让人看到模型和 Harness 组合的现实差异。但这篇文章真正推荐的不是某个冠军,而是 Codex Radar 这条路线。

厂商发布会会挑最好看的 Benchmark;民间榜单至少愿意把失败、耗时、费用和内测标签一起摆出来。它不一定永远正确,却更接近我们真正想知道的问题:这个 AI 能不能在我的项目里把事情做完?

如果你今天打开分布式雷达,看到 K3 106、Grok 111 或 DeepSeek 92,请先别急着转发“某模型封神”。记下时间、Harness、档位、样本数和成本,过一天再回来看看。

因为这个榜单最像现实的地方就是:

今天的王,可能一个小时后就换人;真正不会过时的,是你终于开始看模型怎么干活,而不是只看它在发布会上怎么自夸。

仍然要观察

  • Kimi Code、ZCode 和 Grok 何时结束公开内测,并把成绩纳入正式推荐。
  • 同一模型在不同 Harness、推理档位下是否能积累足够大的可比样本。
  • DeepSWE 与庞贝壁画两个频道,能否形成更稳定的跨任务能力画像。
  • 成本、耗时和成功率是否会成为普通用户选择 Agent 的主指标。
  • 社区贡献规模扩大后,服务端复核和任务隔离能否继续保持可信。

常见问题

Codex Radar 的 IQ 是人类智商吗?

不是。它是站方按测试完成百分比换算的展示指标,不能用于和人类心理测量 IQ 直接比较。

K3 106 是否代表它已经是第一?

不能。榜单实时变化,且 Kimi Code 目前是公开内测,暂定分数不参与正式推荐。106 只能说明当前公开观测表现亮眼。

Grok 4.6 的 111 比 K3 更强吗?

不能直接下结论。111 是某个推理档位的动态观测值,样本、Harness 和内测状态都要一起看。

分布式雷达的数据从哪里来?

来自用户用自己的订阅额度或 API 余额认领任务后提交的结果,服务端会在干净环境重新验证补丁,并展示时间、成本和完成情况。

这个榜单适合拿来选生产工具吗?

适合作为线索,不应当是唯一依据。最好带着自己的代码库、预算和任务类型做小规模实测。

网站入口在哪里?

  • 分布式雷达:https://deng.codexradar.com/?benchmark=deepswe
  • Codex Radar 主站:https://codexradar.com/en/

*注:本文数据来自 2026 年 8 月 20 日对公开页面的观测及用户提供的截图。Codex Radar 是动态社区众测平台,成绩会持续变化;Kimi Code、ZCode、Grok 当前属于公开内测,暂定分数不参与正式推荐、排序与曲线。*

证据与原文