“牛来”终于掉马:全网猜了 6 天,竟是智谱 GLM-5.3-Flash

Z.ai 已正式确认 Ox Alpha 就是 GLM-5.3-Flash,并在 Hugging Face 以 MIT License 开放权重。它有 320B 总参数、18B 激活参数,官方 DeepSWE 为 63.4;Bloomberg 称匿名期间用量一度超过 DeepSeek 两倍。但跑分、任务成本和国产芯片承载细节仍主要来自厂商口径。
结论
全网猜了 6 天的神秘模型 Ox Alpha,这次真的掉马了。
8 月 26 日,智谱 Z.ai 正式确认:它在 OpenCode 和 OpenRouter 上用 ox-alpha 这个匿名身份测试的,就是新模型 GLM-5.3-Flash。模型卡、参数和权重已经出现在 Hugging Face,采用 MIT License。
这个故事不只有“网友猜对了”的乐子。匿名期间,Ox Alpha 登上 OpenRouter 热度榜首;Bloomberg 报道其用量一度超过 DeepSeek 的两倍。身份揭晓后,又冒出三个很有杀伤力的数字:320B 总参数、18B 激活参数、DeepSWE 63.4。
但“接近 Opus 4.8”是智谱的产品定位,不等于它已经在所有 Agent 任务上全面击败 Claude。真正值得关注的是:一个中国开源模型先把品牌藏起来,让全球开发者在不知道厂牌的情况下,先用脚投了票。
匿名 6 天,它把发布会顺序完全倒了过来
Ox Alpha 在 8 月 20 日左右出现时,没有公司 Logo,没有参数表,甚至没有告诉开发者正在用谁的模型。它只给了一个免费入口、百万 token 级上下文,然后让人把真代码库丢进去。
传统发布是厂商先给出 Benchmark,媒体跟进,开发者最后试用。智谱这次把顺序倒了过来:先匿名、先免费、先让大家在 OpenCode 和 OpenRouter 里狂跑,等流量和争论都起来后,才公布身份和权重。
对中国模型来说,这个玩法很聪明。如果第一天就挂上“智谱”,一部分海外用户可能连点都不点。品牌拿掉后,大家只能先判断它会不会干活。
开发者真把它“验了 DNA”
正式揭晓前,社区已经用黑盒方法把范围缩到了 GLM-5 家族。最有力的不是问模型“你是谁”,而是数 tokenizer 如何切分中文、日文、emoji、代码和特殊空格。
公开取证仓库的 44 组区分字符串中,Ox Alpha 与 GLM-5 世代 tokenizer 44/44 全部匹配,而 GLM-4.x 在两个 emoji 上失配。API 错误信息、推理开关和上下文边界也继续指向同一家族。
这些指纹当时能锁定“GLM-5 世代”,不能单独证明精确 checkpoint,因为 GLM-5、5.1 和 5.2 共享有力的 tokenizer 特征。现在官方确认才把最后一格补上:Ox Alpha 不只“像”GLM,它就是 GLM-5.3-Flash 的发布前匿名测试。
320B 总参数,为什么每次只叫醒 18B
GLM-5.3-Flash 是一个 320B 总参数的混合专家模型,但每个 token 只激活 18B。这不是“18B 小模型装成 320B”,而是模型有一个很大的专家库,每次只调用其中少数模块。
智谱说,它不是简单把 GLM-5.3 削小,而是重新训练了 Base Model,首次在 GLM-5 系列加入原生多模态,并混合稀疏注意力与线性注意力。它还使用 mHC,并在 30T token 多模态预训练语料上训练。
这解释了为什么一个总参数很大的模型,仍然敢用“Flash”来定位:它要争的不只是最高分,而是每个 Agent 任务需要花多少算力。
63.4 很强,但别把官方表格写成“吊打 Opus”
智谱公布的 DeepSWE v1.1 成绩是 63.4,相比 GLM-5.2 的 46.2 提升很大;AutomationBench 是 48.8,GLM-5.2 为 26.2。模型卡还列出 Terminal Bench 2.1 的 84.3。
这些数字有实验配置,比一张只有排名的宣传图好,但仍然是厂商发布的结果。DeepSWE 使用 mini-swe-agent,超时 6 小时,上下文 400K;Terminal Bench 又用 Claude Code harness。换一个脚手架、并发策略或成本上限,结果都可能变。
智谱对它的准确表述是“在 Coding 和 Agent 基准上接近 Claude Opus 4.8”。我们没有足够证据把这句话升级成“全面超越”。对开发者更有用的问题是:在你的代码库、工具和时间预算里,它能否用更低成本做到“足够好”。
价格才是 Flash 真正的杀伤力
官方模型卡把 GLM-5.3-Flash 定义为:以约十分之一的价格超越 GLM-5.2 的多项表现,并向 Opus 4.8 的 Coding 和 Agent 区间靠近。智谱还声称,在 Artificial Analysis Intelligence Index v4.1.1 中,它以折扣价约 0.045 美元/任务拿到 57 分,类似智能区间过去需要约 10 倍任务成本。
“只有 Opus 1/40”是很好的标题数字,但它依赖首发折扣、任务长度和计费方式,不应当成永久、所有负载通用的固定比例。更稳妥的结论是:GLM-5.3-Flash 正在用“接近高端 Agent 能力,但任务成本大幅更低”抢默认模型位置。
匿名期间的流量由国产芯片承载,这是官方声明
Z.ai 在官方博客中明确写道,Ox Alpha 成为 OpenCode 和 OpenRouter 当周最受欢迎的模型,“所有这些流量”由中国 AI 芯片提供服务。官方还说,过去一周使用了大规模国产芯片集群、高带宽互连和针对底层硬件优化的推理栈。
这条信息很重要,因为它不是小规模 Benchmark,而是一次免费、高流量的全球真实试用。但当前证据仍来自智谱自述。公开材料没有列出具体芯片型号、集群规模、单机效率、能耗与故障率,所以现在可以写“官方称已用国产芯片承载”,不能顺手推导出具体供应商或与 Nvidia 的效率比较。
今晚不只是认领,权重也真的放出来了
Bloomberg 披露身份时,智谱的说法还是“当晚开放权重”。现在 Hugging Face 已经能看到 zai-org/GLM-5.3-Flash,模型卡标注 MIT License,并给出 vLLM、SGLang、TokenSpeed 和 KTransformers 等部署路径。
开放权重让这条新闻进入下一阶段。社区可以检查架构、尝试量化,并在不同硬件上重跑任务。不过 320B 总参数仍意味着它不是一个普通游戏电脑轻松完整加载的“18B 小模型”。激活参数决定单次计算量的重要部分,总权重大小仍决定存储和显存压力。
我们的判断
“牛来掉马”比“智谱又发了一个模型”更值得写,因为这次多了一层厂商无法自己造出来的证据:开发者在不知道品牌的情况下,确实大量使用了它。
这不证明它是世界最强模型,却证明了一个更现实的产品命题:很多日常 Agent 工作不需要每次都支付最贵模型的价格。如果 GLM-5.3-Flash 能在更多独立测试里稳住大约 60%+ DeepSWE 这一档,它抢的将不是“最强王冠”,而是数量更大的默认日常任务。
匿名发布本身也很可能被更多厂商模仿。先让真实使用数据和社区口碑出现,再公布品牌,对一个需要突破地域偏见的模型尤其有效。代价是,免费期的数据政策、可用性和营销透明度也会成为新争议。
仍然要观察
接下来 24–72 小时最值得看的,是权重开放后的独立复测:同一个 DeepSWE 版本、同一个 harness、同一个成本和时间上限下,它与 Claude、GPT、DeepSeek、Kimi 和 Qwen 的差距到底有多大。
第二个问题是真实 API:高并发下的速度、首 token 延迟、缓存命中率、错误率与限流。匿名免费期已经有用户报告过拥堵和长时间卡住,这些体感不能被平均 Benchmark 遮住。
第三个问题是硬件:具体是哪些国产芯片、多大集群、多少能耗承载了匿名流量,以及这个推理栈能否在商用价格下长期维持。
来源与证据边界
- 一手模型卡与权重:Z.ai Hugging Face 支持 320B/18B、MIT License、原生多模态、架构与部署路径;
- 一手发布说明:Z.ai 官方博客支持 Ox Alpha 身份、官方跑分、任务成本与国产 AI 芯片承载声明;
- 信誉媒体:Bloomberg 支持智谱确认身份、OpenRouter 登顶与用量超过 DeepSeek 两倍;
- 可复现社区取证:公开 GitHub 仓库支持 44/44 tokenizer 指纹和“能锁定世代、不能独立锁定 checkpoint”的边界;
- 文中 63.4、48.8、84.3 与 0.045 美元/任务均是厂商发布口径,并非 AI Radar 独立重跑。