16万张华为昇腾进驻乌兰察布:DeepSeek包圆吉瓦级算力,“训推分家”撕开国产芯片真相
2026 年 9 月 5 日,行业供应链确认 DeepSeek 已与内蒙古乌兰察布达成战略协议,独占一座 1GW 绿色数据中心,分四期部署 160,000 张华为昇腾 950DT 加速芯片(单卡 144GB 显存、4.2 TB/s 带宽)。该订单单体吞掉华为全年超 50% 高端产能。DeepSeek 展现了彻底的工程清醒:前沿基座预训练死守英伟达 CUDA 保证零容错,16 万张华为卡 100% 专职承担低成本在线推理与长思维链外推,撕开“训推一体”神话,为国产芯片找到了最扎实的“以推养训”商业闭环。
# 16万张华为昇腾进驻乌兰察布:DeepSeek包圆吉瓦级算力,“训推分家”撕开国产芯片真相
结论

2026 年 9 月 5 日,行业供应链传出一则重磅消息:中国头部独立大模型实验室 DeepSeek(深度求索) 已与内蒙古乌兰察布地方政府及基础设施合作伙伴达成战略托管协议,独占一座规划容量达 1GW(吉瓦)的超级绿色数据中心。在该中心内,DeepSeek 将分期部署高达 160,000 张华为昇腾 950DT 加速卡,构成迄今为止全球规模最大的单一国产芯片算力集群。
这笔超级订单的落地,彻底打破了此前外界对国产大模型底层算力的诸多猜想与争议:
- 乌兰察布吉瓦级算力超级基地:DeepSeek 锁定了内蒙古乌兰察布核心风电光伏枢纽区的一座 1GW 数据中心,从 2026 年第四季度至 2027 年底分四期部署,累计交付 160,000 张华为最新款昇腾 950DT 芯片,总投资规模达数百亿元人民币;
- 昇腾 950DT 核心架构曝光:单卡集成 144 GB HiZQ 2.0 超高带宽显存,显存物理带宽达到 ~4.2 TB/s,不仅补齐了此前国产芯片在低精度(FP8/MXFP8)矩阵计算上的短板,其显存容量与吞吐规格更是直逼英伟达高端产品;
- “训推分家”撕开最大潜规则:与厂商对外宣传的“训推一体”神话截然不同,DeepSeek 在工程上执行了彻底清醒的“训推分家”路线——前沿基座模型预训练依然死守英伟达 CUDA 集群,16 万张华为昇腾卡 100% 专职用于高并发在线推理与长思维链外推;
- 算力挤兑重塑国内竞争版图:16 万张订单几乎一口吞掉了华为昇腾未来一整年超过 50% 的高端交付产能,直接引发国内其他互联网巨头与 AI 创企的配额恐慌,也标志着国产芯片替代正式告别概念炒作,步入以高并发推理自负盈亏的残酷决战期。
这场商业与工程联姻的本质,不是一场盲目的“为了国产而国产”的表态,而是中国顶级大模型团队用极限工程学把硬件性价比压榨到极致后,所做出的最务实商业抉择。
---
发生了什么

在过去半年里,业内关于 DeepSeek 下一代万卡集群究竟花落谁家的传闻不绝于耳。随着内蒙古乌兰察布集宁绿电工业园区相关备案与大功率供电专线合同的完成,这一谜底终于彻底揭晓。
乌兰察布素有“草原云谷”之称,常年平均气温仅 4.3 摄氏度,坐拥极为充沛的风力与光伏绿色能源。DeepSeek 此次锁定的 1GW 数据中心园区由三家大型央企与地方算力平台联合代建,专为超大规模液冷高密机柜定制。
根据多方供应链交叉核验,华为与 DeepSeek 达成的是一份涵盖芯片、液冷整机柜、自研网络交换机及底层算子定制优化的全栈交付协议。华为将分四个季度向该基地交付 16 万张昇腾 950DT 芯片。
16万张万卡集群硬件配置与交付节奏
华为昇腾 950DT 是华为海思针对超大规模模型推理痛点量身打造的专用衍生型号(DT 代表 Dual-Engine / Deep-Throughput)。与英伟达主流产品对比,其核心工程参数呈现出极其鲜明的场景针对性:
| 核心评估维度 | 华为昇腾 950DT | 英伟达 H200 (Hopper) | 英伟达 B200 (Blackwell) | | :--- | :--- | :--- | :--- | | 显存规格与容量 | 144 GB HiZQ 2.0 | 141 GB HBM3e | 192 GB HBM3e | | 显存物理带宽 | ~4.2 TB/s | 4.8 TB/s | 8.0 TB/s | | 低精度推理算力 (FP8) | ~2.8 PFLOPS | ~2.0 PFLOPS | ~4.5 PFLOPS | | 片间互联通信协议 | HCCS 3.0 (392 GB/s) | NVLink 4 (900 GB/s) | NVLink 5 (1800 GB/s) | | 底层软件生态成熟度 | CANN 8.2 (推理深度调优) | CUDA 12.8 (全生态通用) | CUDA 12.8 (全生态通用) | | 单卡综合采购与运行成本 | 约为 H200 的 35% | 约 2.8 万至 3.2 万美元 | 约 3.5 万至 4.5 万美元 |
从上表可以看出,华为昇腾 950DT 在片间互联带宽与通用软件生态上依然落后于英伟达 NVLink 体系,但在显存容量(144GB)、显存带宽(4.2 TB/s)以及 FP8 算力性价比这三项直接决定大模型推理吞吐的硬指标上,已经形成了极其扎实的工业级竞争力。
---
“训推分家”背后的残酷工程账本
消息曝光后,技术圈最大的争议在于:既然 DeepSeek 采购了整整 16 万张华为芯片,是否意味着其下一代前沿多模态与推理旗舰(如 DeepSeek-V4/R2)将完全摆脱对英伟达的依赖,实现全流程国产化预训练?
答案是否定的。来自核心工程团队的反馈非常明确:这 16 万张昇腾卡不会参与前沿基座模型的万卡预训练,它们的目标只有一个——彻底包圆 DeepSeek 全网暴增的商业 API 与网页端推理流量。
为什么预训练死守英伟达,推理包圆华为
这种“训推分家”的选择,恰恰揭示了真实工业级 AI 研发中两类任务的截然不同本质:
- 万卡并行预训练的容错死线无法妥协:预训练千亿、万亿级参数模型需要数万张芯片进行持续数月的全量梯度同步(All-Reduce)。在此过程中,任何一张卡掉线、通信阻塞或数值溢出,都会导致整个集群暂停并回滚至上一个检查点(Checkpoint)。英伟达 CUDA 搭配 NVLink 经历了十余年的工业淬炼,平均无故障运行时间(MTBF)极高。在预训练阶段贸然切换生态,一旦遭遇不可逆的训练发散,损失的将是数以亿元计的算力电费与致命的市场时间窗口;
- 大模型推理本质上是“显存带宽受限(Memory Bound)”:与预训练需要频繁跨节点同步权重梯度不同,推理阶段的计算负载高度集中在本地显存访问上——特别是超长上下文(KV Cache)读取与密集矩阵向量乘法。此时,芯片的显存容量越大、带宽越高、单卡单价越低,每生成一个 Token 的实际成本就越低。昇腾 950DT 凭借 144GB 显存和 4.2 TB/s 带宽,配合 DeepSeek 擅长的多头潜在注意力(MLA)与 FP8 极致量化,在推理端跑出了极佳的能效比;
- 乌兰察布绿电将用电成本打至地板:乌兰察布年平均气温低,该 1GW 数据中心采用自然间接蒸发冷却配合冷板式液冷,全年电源使用效率(PUE)压至 1.15 以下。叠加当地直供的低谷风电与光伏配额,每度电运行成本仅为沿海或一线城市的三分之一。当 16 万张芯片全天候满负荷跑推理时,仅电费一项每年就能节省数亿元人民币;
- 商业 API 长期价格战的终极支柱:为什么 DeepSeek 敢在全球市场上把高质量推理 API 价格打到 OpenAI 和 Anthropic 的十分之一?如果全部采用租金昂贵的英伟达 GPU,这种定价无异于自杀。但如果底层 80% 以上的日常推理流量被跑在自建、低成本、高显存带宽的昇腾集群上,DeepSeek 不仅不会亏损,反而能维持 40% 以上的健康毛利率。
---
行业踩踏:国产高端算力迎来“零和博弈”
DeepSeek 这笔 16 万张的大单,在供应链上引发了剧烈的连锁地震。
受制于先进封装工艺与高带宽显存(HBM)颗粒的产能瓶颈,业界测算华为海思在 2026 年至 2027 年期间的昇腾 950DT 年化交付能力大致在 25 万至 30 万张左右。这意味着,仅 DeepSeek 一家,就锁定了华为未来一年多时间内超过半数的最高端算力产能。
这直接导致国内其他大模型参与者陷入了罕见的算力踩踏: - 百度、腾讯、阿里巴巴以及各大地方智算中心原本都在向华为争取更多的 950 系列分配额度,如今可供自由流通的现货配额被瞬间压缩; - 部分拿不到足够昇腾交付周期的互联网大厂,被迫转而加价向二手租赁市场抢购存量英伟达算力,或者加速向壁仞、摩尔线程、天数智芯等第二梯队国产 GPU 厂商分散下达推理订单; - 算力资源从“雨露均沾”加速走向“向超级买家集中”,没有足够自研算法优化能力、无法自负盈亏的模型团队,在算力获取成本上将处于全面劣势。
---
我们的判断
针对 DeepSeek 16万张昇腾集群的曝光与“训推分家”的工程选择,我们给出四项核心研判:
- “训推一体”是公关神话,“训推分家”才是中国 AI 工业走向成熟的里程碑:那种宣称国产芯片能瞬间在所有环节全面平替英伟达的论调,既不尊重半导体规律,也不符合工程常识。DeepSeek 承认差距、精准切入优势场景的做法,用务实主义代替了盲目狂热,为整个行业确立了“用英伟达攻前沿、用国产卡跑量产”的标准模板;
- 华为 CANN 生态将迎来最具价值的“万亿 Token 真实流量大考”:过去国产算子库最欠缺的不是纸面跑分,而是没有顶级互联网业务的持续实战打磨。16 万张卡每天承载数千亿 Token 的严苛业务冲击,将迫使华为软件团队在极其具体的生产现场修补驱动 Bug、优化显存泄漏,这比任何单纯的实验室联合攻关都要管用百倍;
- 低成本推理护城河将加速清退国内“套壳与空想型”模型创企:当 DeepSeek 依靠乌兰察布 1GW 绿电集群和 16 万张专用卡把 Token 成本打入绝对底线,国内那些既没有自研模型能力、又缺乏低成本基础设施的创业公司,其商业生存空间将被彻底挤压殆尽;
- 国产算力替代的务实演进路径是“以推养训、梯次渗透”:芯片产业是吞金兽,仅靠政策补贴无法实现良性循环。先在确定性极强、商业回报清晰的在线推理领域实现大规模出货与盈利,让芯片厂商赚到钱、让模型公司降了本,再用滚动的利润反哺下一代高互联预训练芯片的研发,这才是真正的正向产业闭环。
---
仍然要观察
在乌兰察布吉瓦级集群逐步通电与上架的过程中,以下三个关键风险与变量仍需持续追踪:
- 华为先进封装与 HiZQ 2.0 显存的真实量产良率:首期 4 万张卡能否在 2026 年底前如期足额完成下线与点亮,是检验供应链抗压能力的第一道生死大考;
- 16万张万卡液冷集群在内蒙古极寒气候下的运维稳定性:乌兰察布冬季室外气温可低至零下 30 度,高密液冷管路的防冻、防腐、热交换平衡以及大功率电网的调峰稳定性,对基础设施运维构成了前所未有的工程挑战;
- 外部地缘政治针对供应链材料与封装工具的次级制裁风险:随着单体吉瓦级集群的曝光,美国商务部是否会借机对国产 HBM 上游原材料与关键封装耗材施加更具针对性的出口管制,仍是悬在全行业头顶的达摩克利斯之剑。
---
信息来源清单与证据类型
- 商业供应链信源:内蒙古乌兰察布集宁区绿色算力园区 1GW 专项供电与机房租赁备案公示文件(2026.09)
- 芯片架构与供应链调研:华为海思昇腾 950DT 芯片规格白皮书与半导体封测产业链调研纪要(2026.09)
- 企业基础设施披露:DeepSeek 算力架构团队关于多头潜在注意力(MLA)在国产 NPU 上的推理算子优化论文与开源技术报告(2026.08)
- 行业分析与产能测算:集邦咨询(TrendForce)与 IDC 2026-2027 年中国 AI 加速芯片先进封装产能跟踪研报(2026.09)
- 电费与基础设施能效:国家电网内蒙古电力乌兰察布 1GW 绿电专线 PUE 监测与电价测算公开数据(2026.09)
- 独立实测与成本分析:AI Radar 算力经济学模型:主流前沿大模型推理单 Token 硬件与电费综合成本拆解(2026.09)