AI Radar先替你读,再把 AI 变化讲明白
EN
国产模型价格战

DeepSeek 没掉队,但国产模型已经打成一锅粥:GLM 真正狠的是价格

最后更新 2026-08-27编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
GLM-5.3-Flash 模型塔连接图片、PDF 和 Agent 能力,并标出 57 分与公开 API 价格的原创插图
AI Radar 原创 AI 插图:57 为 Artificial Analysis 当前综合指数;0.15/0.50 美元分别为每百万输入/输出 token 公开价格,不代表所有负载的最终账单。
一句话结论

Artificial Analysis 当前同口径对比中,GLM-5.3-Flash 得 57 分、混合成本约 0.10 美元/百万 token;DeepSeek V4 Pro 得 53 分、约 0.69 美元,V4 Flash 得 52 分、约 0.23 美元但输出接近 119 token/s。DeepSeek 没掉队,GLM 也没有全面碾压;真正的变化是质量、速度、多模态和价格已经分成四条赛道。

结论

DeepSeek 没有掉出第一梯队。真正发生的事,是国产模型的差距已经挤到几分、几毛钱和几十个 token/s 里,过去那种“一个模型包打天下”的说法越来越不靠谱。

Artificial Analysis 当前的统一对比里,GLM-5.3-Flash 得 57 分,DeepSeek V4 Pro 0813 得 53 分,DeepSeek V4 Flash 0731 得 52 分。但这张表最值得看的不是 57 对 53,而是三种完全不同的取舍:GLM 能看图且价格最低,DeepSeek Pro 更快,DeepSeek Flash 则快到接近前两者的两倍半。

三组数字,先把“谁吊打谁”放一边

GLM-5.3-Flash、DeepSeek V4 Pro 与 DeepSeek V4 Flash 的分数、价格和速度对比插图
编辑核验:图中的 57、53、52 是综合指数,不是 token/s;Flash 的约 125 token/s 为插图生成时的近似值,正文采用当前页面约 119 token/s。

同一套 Artificial Analysis 口径下,GLM-5.3-Flash 的综合 Intelligence Index 是 57,实测输出约 50 token/s,混合价格约 0.10 美元/百万 token;DeepSeek V4 Pro 是 53 分、约 68 token/s、0.69 美元;DeepSeek V4 Flash 是 52 分、约 119 token/s、0.23 美元。

这里的 0.10 美元不是简单的官网输入价。Artificial Analysis 按 7:2:1 的缓存输入、普通输入和输出比例计算混合成本。GLM 的公开输入、输出价分别约为 0.15 和 0.50 美元/百万 token。你的任务如果输出很长、缓存命中低,实际账单会高于 0.10 美元。

所以,4 分领先不能直接翻译成“全面吊打”,119 token/s 也不能直接翻译成“回答质量最好”。跑分、速度、模态和价格回答的是四个不同问题。

GLM 真正狠的不是 4 分,是价格曲线

GLM-5.3-Flash 有 320B 总参数,但每个 token 只激活 18B;它还把图片输入、100 万上下文和 MIT 开放权重放在同一款 Flash 模型里。Z.ai 称它经过 30T 多模态 token 预训练,并使用稀疏注意力与线性注意力降低长上下文开销。

这些仍然包含厂商口径,不能只看发布稿。不过独立对比至少确认了一件事:在当前被测供应商与那套混合负载里,GLM 用约 DeepSeek Pro 七分之一的价格拿到更高的综合分数。对要跑大量 Agent、文档和图片任务的团队,这比榜单上多 4 分更有杀伤力。

第一处反转:DeepSeek Flash 快了两倍多

如果你的任务是代码补全、批量分类、结构化抽取,或者任何“人正坐在屏幕前等结果”的工作,DeepSeek V4 Flash 仍然很难忽略。它的综合分数比 GLM 低 5 分,混合价格也更高,但输出速度约 119 token/s,是 GLM 的 2.3 倍左右。

这就是为什么“GLM 赢了,所以 DeepSeek 过时了”站不住脚。GLM 赢的是当前综合分与成本组合;DeepSeek Flash 赢的是等待时间。对高频交互产品来说,延迟本身就是功能。

第二处反转:更尴尬的是 DeepSeek Pro

DeepSeek V4 Pro 的位置反而难解释一些。它比自家 Flash 只高 1 分,速度从约 119 降到 68 token/s,混合价格却从 0.23 涨到 0.69 美元。它可能在部分复杂任务上更稳,但公开的统一总分没有体现出三倍价格对应的普遍优势。

这不等于 Pro 没用。它意味着采购者不能再凭“Pro”三个字买单,应该拿自己的代码库、长任务和失败案例做 A/B 测试。只看产品名,最容易多花钱。

第一梯队已经不是一张固定座次表

Claude Opus 5、GPT-5.6 Sol、Claude Fable 5 与 Grok 4.6 并列成多座模型塔的原创插图
原创 AI 插图:这里表达的是前沿模型拥挤,不是固定名次;榜单会随评测版本、推理档位和 Harness 变化。

Artificial Analysis 当前总榜前部还有 Claude Opus 5、Claude Fable 5、GPT-5.6 Sol、Grok 4.6、Kimi K3 等模型。不同榜单、推理档位、Agent Harness 和供应商会改变结果;四分或五分的差距,远没有跨代差距那么稳。

更麻烦的是,综合榜单会把编程、数学、知识和 Agent 任务揉成一个数字。一个法律检索团队、一个前端 Agent 和一个中文客服,并不生活在同一条排行榜上。所谓“第一梯队”,更适合表达一组有竞争力的模型,不适合当成永久座次。

普通人和开发者怎么选

要图片、PDF、长文档和低成本,先试 GLM-5.3-Flash;要文本任务的高吞吐和短等待,先试 DeepSeek V4 Flash;已经在用 DeepSeek Pro,则应把 Flash 拉进同一套真实任务重测,看看那 1 分是否值得三倍混合价格。

对企业团队,更稳妥的做法是准备 20 到 50 个自己的任务:保留输入、正确答案、人工返工时间、首字延迟、总耗时和账单。公开榜单负责缩小候选范围,内部评测才负责下单。

我们的判断

GLM-5.3-Flash 这次最有价值的变化,不是把 DeepSeek 从桌上赶走,而是把“便宜模型就只能做轻任务”的边界又往前推了一截。原生多模态、100 万上下文和开放权重,开始和极低 API 价格同时出现。

DeepSeek 仍在第一梯队,而且 Flash 的速度优势很实在。只是它不再拥有一个让所有人停止比较的答案。国产模型的竞争已经从“谁能追上”进入“同样够用时,谁更便宜、更快、更方便部署”。

仍然要观察

第一,GLM 的低价能维持多久,是否覆盖所有主要供应商和高峰时段。第二,320B/18B 架构在自部署时需要怎样的显存、并行和工程成本。第三,多模态 Agent 的真实成功率、失败恢复与长任务稳定性,还需要独立团队复测。

DeepSeek 下一次模型或价格调整也可能迅速改写这张表。本文数字是 2026 年 8 月 27 日的可核验快照,不是永久排名。

来源与证据边界

参数、开源许可和架构描述来自 Z.ai 官方发布与 Hugging Face 模型卡;综合分、速度、上下文和混合成本来自 Artificial Analysis 当前模型页与同口径比较。厂商自报 benchmark 只作为产品声明,不拿来替代独立测量。

价格会随供应商、缓存比例、输入输出结构和促销变化;综合分也会随榜单版本更新。文章中的选择建议是编辑判断,不是对所有工作负载的保证。