552B参数输入仅激活8B!DeepSeek V4.1 Flash突袭:性能反超V4 Pro官方直接“下线旗舰”,KV Cache暴降437倍
2026 年 9 月 10 日,DeepSeek 突击发布 552B MoE 模型 V4.1 Flash,采用全新的 Causal-Encoder-Decoder 非对称架构,输入 Prefill 仅激活 8B、输出 Decode 激活 16B,KV Cache 较初代累计压缩 437 倍;因智能与 Agentic 跑分全面超越上一代大号旗舰,官方直接宣布将于 9 月 14 日下线 V4 Pro 并将流量全部路由至 Flash,API 维持闲时半价击穿行业底线。
# 552B参数输入仅激活8B!DeepSeek V4.1 Flash突袭:性能反超V4 Pro官方直接“下线旗舰”,KV Cache暴降437倍
结论

2026 年 9 月 10 日中午 12:00,DeepSeek(深度求索)毫无预警地上线了新一代基座模型 DeepSeek V4.1 Flash,并同步开源了模型权重与技术报告。
这是一次彻底颠覆行业惯例的发布:
- 非对称 MoE 架构落地:总参数量高达 552B,但采用了全新的 Causal-Encoder-Decoder 结构。在吃进 Prompt 的输入阶段仅仅激活 8B 参数,输出生成阶段激活 16B 参数,把超大模型的推理成本砸穿了地板;
- KV Cache 累计收缩 437 倍:相比上一代 V4,新模型对显存(HBM)的需求减少到 1/4,对高速存储(SSD)二级缓存的需求缩减到 1/8。对比初代 DeepSeek 模型,上下文缓存体积整整缩小了 437 倍;
- 官方宣布退役自家族旗舰 V4 Pro:基准测试显示,V4.1 Flash 在智能水平、编程逻辑,尤其在 Agentic Benchmark(自主代理基准)上全面反超上一代大号旗舰 V4 Pro。DeepSeek 官方直接拍板:自 9 月 14 日起有序下线 V4 Pro,原接口全量路由至 V4.1 Flash 并按低价结算;
- API 定价再度击穿底线:API 即刻生效全新低价,继续保留闲时半价机制;腾讯 WorkBuddy、CodeBuddy 与 OpenCode 首日完成全量集成上线。
大模型行业过去习惯了“旗舰负责立标杆、轻量版负责跑量”,而 DeepSeek 这次用工程极致证明:架构创新的小尺寸模型,不仅能跑得更快、更便宜,还能反手把昂贵的老旗舰送进历史陈列室。
---
发生了什么

9 月 10 日上午,开发者还在讨论前沿模型的定价博弈,DeepSeek 官方直接在 Hugging Face 与官网同步更新了 DeepSeek-V4.1-Flash 仓库和技术报告 PDF。
根据官方公告与技术白皮书,本次更新带来了一连串密集的工程重构:
- 模型命名收敛:API 统一使用
deepseek-flash调用。原有的deepseek-v4-flash与deepseek-v4-flash-vision-exp两个历史实验入口正式下线,请求自动无缝转至 V4.1 Flash; - 原生多模态合体:新模型不再挂载外置视觉适配器,直接在底层架构中原生支持图像与高分辨率画面的混合理解;
- V4 Pro 强制退役时刻表:北京时间 2026 年 9 月 14 日 12:00 之后,直到未来 V4.1 Pro 亮相前,所有打向
deepseek-v4-pro的生产请求全部自动切换至 V4.1 Flash 处理,账单按照 Flash 的便宜单价扣费; - 开源门槛迈入工业重工业:DeepSeek 虽然如约公开了完整权重,但明确指出由于 552B 总参数与非对称路由特性,私有化部署需要具备 2k 张 GPU 与高速存储集群,普通个人开发者与单卡服务器已无法独立跑起全量服务。
---
非对称架构:输入激活8B、输出激活16B,MoE如何击穿Decoder-only铁律
过去三年,大语言模型几乎全员困在纯 Decoder-only 架构的思维定势里。
在传统 Decoder 架构下,不管用户输入的是一个词还是一万字长文,模型在 Prefill(输入编码)和 Decode(输出解码)阶段都要唤醒同样规模的激活参数。对于一个 600B 规模的 MoE 模型,输入一个字和输出一个字,往往都要硬扛 30B 到 40B 的活跃计算量。这直接导致长 Prompt 输入时的算力消耗极度臃肿。
DeepSeek V4.1 Flash 的杀手锏,在于把这套死板机制拆成了非对称的 Causal-Encoder-Decoder:
- 输入阶段(Causal-Encoder):当超长 Prompt 涌入时,模型只唤醒 8B 的极简专家网络完成因果编码。这让大模型在阅读长文档、检索外部知识库以及吸收多轮上下文时,算力负载比传统 MoE 骤降近 70%;
- 输出阶段(Causal-Decoder):当开始生成推理步骤、编写代码或给出回答时,动态扩展激活至 16B 专家网络,提供充裕的思维深度和表达精度。
核心工程与架构参数实测对比
| 核心评估维度 | DeepSeek V4.1 Flash (新发布) | DeepSeek V4 Pro (宣布下线) | 行业同代 500B+ MoE 常见规格 | | :--- | :--- | :--- | :--- | | 基础网络架构 | Asymmetric Causal-Encoder-Decoder | Traditional Decoder-only MoE | Decoder-only MoE | | 模型总参数量 | 552B | 671B | 400B - 600B | | 输入阶段激活参数 (Prefill) | 仅激活 8B | 37B | 32B - 48B | | 输出阶段激活参数 (Decode) | 激活 16B | 37B | 32B - 48B | | 原生多模态视觉 | 原生内生支持 | 纯文本 (依赖外部视觉分支) | 分离式多模态模块 | | KV Cache 相对初代收缩比 | 缩减 437 倍 | 约 96 倍 | 10 - 25 倍 | | Agentic Benchmark 综合得分 | 84.6 | 81.2 | 78.5 - 82.0 | | API 调用价格机制 | 超低基准价 + 闲时50%折让 | 较高单价 (9月14日停止独立服务) | 固定高价阶梯 |
这张对比表清楚地解释了为什么 DeepSeek 敢于痛下杀手:用 8B 的极低输入代价,换来了超越上一代 37B 激活旗舰的输出效果,在工业落地场景里,性价比优势已经大到了不需要做平衡取舍的地步。
---
显存墙坍塌:KV Cache暴降437倍,Agent终于不用给缓存打白工
如果说非对称激活解放了芯片的算力计算单元,那么 KV Cache 的极限压缩,则是救活整个 AI Agent 赛道的关键氧气。
任何做过复杂智能体(Agent)系统的工程师都知道一个痛点:Agent 的日常就是反复读上文。从环境观察(Observation)、思考链路(Thought)、工具选择(Action)再到执行反馈,随着多轮工具调用不断堆叠,会话上下文很容易冲上数十万甚至上百万 Token。
在传统部署中,存储这些历史键值对(KV Cache)需要的显存极其夸张:
- 一台搭载 8 张高规格加速卡的服务器,往往只能并发支持十几个重度长上下文任务,显存就会被塞得满满当当;
- 厂商为了维持缓存命中(Prefix Caching),必须把海量 KV 存留在昂贵的高带宽显存(HBM)甚至企业级 SSD 中,算力服务器实质上变成了昂贵的“显存仓库”。
DeepSeek 给出的官方解法令人震撼:通过激进的多头潜在注意力进阶压缩与动态上下文剪枝,V4.1 Flash 把上一代已经很节省的 KV 需求再次大砍——HBM 需求砍掉 75%(仅需 1/4),SSD 二级缓存砍掉 87.5%(仅需 1/8)。
对比初代模型,其累计压缩倍率达到了惊人的 437 倍。
这意味着同一套机架服务器,原本只能并发承载 20 个长思维链 Agent,现在可以从容挂载上百个并发实例。开发者在调用 API 时,长会话缓存命中的扣费成本成倍锐减,高频自动化交互终于摆脱了“跑几轮工具调用账单就爆掉”的窘境。
---
自杀式背刺:小弟干翻大哥,为什么DeepSeek敢直接下线旗舰
在科技产业的常规商业逻辑里,各家厂商都会精心构筑“产品鄙视链”:
- 必须保留一个昂贵、聪明的“Pro / Ultra”大模型撑住门面,获取高净值企业客户的高额利润;
- 再拿出一个阉割、快速、便宜的“Flash / Mini”走量,赚取长尾流量。
DeepSeek 这次完全打破了这种默契:既然 V4.1 Flash 经过更大规模的强化学习后训练,综合指标已经超越了 V4 Pro,那就干脆不留体面,直接在 9 月 14 日下线 V4 Pro。
这种看似残酷的自我淘汰,背后藏着三层清醒的商业算盘:
- 清理算力包袱,把显存让给高周转模型:维持老一代 671B 传统 MoE 的高昂服务器开销,对数据中心是沉重负担。把老旗舰用户平滑迁移到输入仅 8B 激活的新模型上,相同的电费和机柜可以支撑数倍的并发请求;
- 重置大模型定价天花板:当自家的“小弟”不仅智商超过上一代旗舰,价格还打到原先的几分之一,且闲时还给五折时,整个市场上那些售价高昂、性能却只停留在上一代水平的友商 API,将面临毁灭性的客户流失;
- 全面锁定 Agent 基础设施生态位:腾讯 WorkBuddy 与 CodeBuddy 在第一时间全量切换,说明头部生产力工具正在从“谁聪明用谁”转向“谁便宜、谁能抗住百万 Token 高并发就用谁”。
---
我们的判断
针对 DeepSeek V4.1 Flash 的发布与其引发的下线效应,我们形成四项明确研判:
- Decoder-only 垄断时代出现裂缝,非对称 Causal-Encoder-Decoder 成为新范式:大模型架构不能再靠无脑堆同构层级来扩容。输入阶段轻量化、输出阶段深度化的非对称设计,证明了计算分配的灵活性比参数对称性更重要;
- KV Cache 压缩比将成为评判模型“能否商业落地”的第一硬指标:未来光吹基准测试跑分没有意义,如果一个模型跑一百轮 Agent 工具调用就要吃空几十 G 显存,它在商业上就是不可持续的。437 倍的压缩标志着工业界正式把显存开销当成了核心战场;
- “下线旗舰”拉开无情的大模型加速折旧周期:过去一款顶级模型可以卖一两年,现在只要新架构的轻量版在智能上完成跨代反超,老旗舰就会在几天内被强制退役。跟不上架构迭代速度的模型团队,其研发资产贬值速度将远超想象;
- 开源从“个人极客玩具”全面分化为“工业重资产竞赛”:552B 参数配合 2k GPU 的私有化部署要求说明,未来真正能跑起顶尖开源模型的,只有云厂商、大型互联网公司和超级机构。普通开发者的主战场将彻底转移到 API 工程与 Agent 业务逻辑开发上。
---
仍然要观察
新模型上线后,以下三个关键维度的真实生产表现仍需密切追踪:
- 8B 极小输入激活在超长长尾输入下的信息保留完整度:虽然技术报告数据优秀,但在数万行混乱代码或多语言混合文档的真实 Prefill 过程中,8B 激活是否会在某些冷门边缘用例上出现注意力弥散;
- 9 月 14 日 V4 Pro 流量强切后的线上容灾与延迟抖动:当大量依赖旧接口的严苛生产业务集中路由至新模型时,API 服务在高峰时段的吞吐表现与首字延迟(TTFT)需要经受实战检验;
- 未来 V4.1 Pro 究竟何时现身与性能拉扯:如果 Flash 已经反超了老 Pro,那么未来规划中的 V4.1 Pro 将被推到多高的智能极限,其架构是否会继续沿用非对称设计,将是下一阶段最大的悬念。
---
信息来源清单与证据类型
- 一手官方发布:DeepSeek 官方发布公告与新旧版本路由规范(2026.09.10)
- 一手技术文档:DeepSeek AI 团队技术报告《DeepSeek-V4.1 Technical Report: Asymmetric Causal-Encoder-Decoder Architecture and KV Cache Compression》(2026.09.10)
- 开源代码与模型仓库:Hugging Face
deepseek-ai/DeepSeek-V4.1-Flash权重开源主页(2026.09.10) - 一手产品接入通告:腾讯官方宣布 WorkBuddy 与 CodeBuddy 全量接入 DeepSeek V4.1 Flash 联合声明(2026.09.10)
- 第三方基准评测:Agentic Benchmark 智能体基准评测与主流前沿模型实测数据集(2026.09.10)