
本文选自 Horizon 2026年9月5日技术简报。
关键词:DeepSeek、华为昇腾950DT、Atlas 950、AI推理、超节点、国产算力、数据中心
9月4日,多家媒体援引彭博消息称,DeepSeek计划在内蒙古一座大型数据中心部署至少16万颗华为昇腾950DT,用于大模型推理。如果最终按这一规模落地,它会成为已知规模最大的昇腾AI芯片集群之一。报道同时称,DeepSeek仍计划在模型训练阶段继续使用英伟达GPU,昇腾950DT更多承担推理侧工作。DeepSeek和华为截至报道发布时均未公开确认这一采购计划,因此具体数量、建设周期和上线节奏仍应以企业后续披露为准。
即便只把它当成一份大规模部署方案来分析,也足够有技术价值。16万颗芯片并不是“把更多卡插进机房”这么简单。到这个量级,决定系统效率的因素会从单芯片峰值算力扩展到HBM容量与带宽、卡间互联、跨机柜网络、模型并行策略、KV Cache调度、故障恢复、电力、冷却以及推理服务软件栈。
这恰好对应华为过去一年反复强调的技术路线:在先进制程和单芯片性能受约束的情况下,通过超节点、高带宽互联和大规模资源池化提高系统级有效算力。DeepSeek如果成为大规模使用者,这套路线将第一次接受接近“互联网头部大模型生产负载”的长期考验。
一、先看950DT:它并不是简单的“下一代910C”
华为在2025年公布的昇腾路线图中,把Ascend 950拆成了两个面向不同负载的版本:950PR和950DT。
950PR更偏向推理Prefill与推荐场景,强调降低大容量内存成本;950DT则针对Decode和训练等对访存、互联更敏感的负载。华为公开信息显示,950DT配套自研HiZQ 2.0高带宽内存,内存容量144GB,内存访问带宽4TB/s,芯片互联带宽2TB/s,并支持FP8、MXFP8、MXFP4、HiF8等多种低精度数据格式,规划于2026年第四季度上市。
这些参数为什么对大模型推理重要?因为LLM推理并不是单纯比FLOPS。
一次用户请求大致可以分成Prefill和Decode两个阶段。Prefill需要处理整段输入Prompt,矩阵计算密集,通常更接近算力受限;Decode阶段每次生成少量新Token,却需要反复读取模型权重和KV Cache,更容易受到显存容量、显存带宽和通信效率影响。模型越大、上下文越长、并发用户越多,内存系统的重要性越明显。
因此950DT把144GB容量、4TB/s访存带宽和2TB/s互联作为重点,并不意外。它瞄准的就是大模型推理里最难通过单纯增加算力解决的“数据搬运”问题。
二、16万颗芯片的关键不是总FLOPS,而是能不能组成一台“逻辑计算机”
大规模AI集群最容易被误解的指标是芯片数量。
16万颗芯片的理论峰值算力当然惊人,但如果每颗芯片之间通信效率低、任务分布不均、网络拥塞严重,实际模型吞吐可能远低于峰值。MoE模型尤其依赖通信:一个Token可能需要被路由到不同专家所在的加速卡,专家负载又会随输入不断变化。如果跨卡传输成本太高,增加芯片数量反而会让系统在等待通信上消耗更多时间。
华为这两年的应对方案是SuperPoD,也就是超节点。它试图把大量物理服务器通过高带宽互联组合成一个更大的逻辑计算单元。
2025年推出的Atlas 900 A3可把384颗Ascend 910C组合成一个超节点,CloudMatrix 384则是在这一基础上形成的云服务形态。华为和合作研究者公开的CloudMatrix-Infer论文显示,在DeepSeek-R1等MoE模型上,系统通过统一高速互联、专家并行、Prefill/Decode解耦和KV Cache资源池化等方式提高推理效率。
下一代Atlas 950进一步把单超节点规模提升到8192颗950DT。华为公开数据称,满配Atlas 950由128个计算柜和32个互联柜组成,占地约1000平方米,FP8峰值算力达到8 EFLOPS,FP4达到16 EFLOPS,总互联带宽16PB/s。
如果16万颗950DT最终全部采用类似超节点架构组织,粗略看相当于接近20个满配8192卡Atlas 950的芯片数量。此时真正困难的问题已经上升到“超节点之上的超集群”:多个大规模逻辑节点怎样统一调度、故障怎样隔离、模型怎样跨节点切分、请求怎样路由,以及网络和存储怎样避免成为瓶颈。
三、DeepSeek为什么可能更适合先把国产算力放在推理侧
报道中一个很有意思的安排,是据知情人士称,DeepSeek目前不计划用950DT训练,此前训练仍主要依赖英伟达加速器,而950DT拟更多承担推理侧工作。
这并不意味着国产芯片只能做推理。950DT本身也被华为定位为Decode与训练芯片。更现实的原因是,训练和推理对生态成熟度、稳定性和成本结构的要求并不相同。
前沿模型训练是一项高度同步的超大规模计算任务。数千甚至数万张卡需要连续运行数周,任何通信性能、算子实现、编译器稳定性或故障恢复问题都会放大。训练代码还会快速变化,新架构、新Attention实现、新并行策略和定制算子层出不穷,因此开发工具链与软件生态极其重要。
推理则更容易标准化。一个训练完成的模型,其算子图、精度策略和服务模式相对稳定,可以投入更多时间做硬件适配、图优化、量化、算子融合和部署调优。一旦完成适配,推理负载会持续产生大量Token,硬件利用率和单位Token成本直接决定商业化效率。
DeepSeek这类高流量模型服务商如果采用“训练保持最成熟平台、推理迁移到国产大规模集群”的混合策略,可以降低一次性迁移风险,同时把最庞大的长期算力消耗逐步切换到自主可控体系。
从产业角度看,这比一次性宣布“全面替代”更符合工程规律。
四、真正决定16万卡价值的,是每百万Token成本
AI算力产业已经从“训练冠军”逐渐进入“Token工厂”阶段。
训练一个模型可能持续几周,但一个热门模型会连续几年处理用户请求。随着Agent、多模态、代码生成和长上下文使用量增长,推理总算力消耗可能远高于一次训练。企业最终关心的指标也会从“这张卡有多少TFLOPS”转向“在指定延迟和可靠性下,每百万输出Token需要多少电、多少硬件、多少机柜和多少钱”。
CloudMatrix 384相关论文给出过很有参考价值的系统级数据:在特定DeepSeek-R1服务配置中,作者报告Decode吞吐可达到每NPU约1943 generated tokens/s,同时满足约50ms TPOT条件;Prefill阶段则给出更高的输入Token处理吞吐。需要注意,这些数字来自特定模型、精度、批量和并行配置,不能直接外推为950DT性能,但它说明华为的优化重点已经从理论算力转向完整推理服务指标。
950DT拥有更高的内存与互联规格之后,决定下一阶段竞争力的将是整套软件是否能把硬件资源持续压榨出来:CANN编译器是否高效,算子库是否完备,MoE路由能否均衡,KV Cache能否跨卡池化,推理框架能否进行Prefill/Decode分离,故障卡能否快速剔除并恢复服务。
大模型基础设施正在越来越接近运营商网络:硬件只是底座,长期运行效率来自调度、监控和运维系统。
五、吉瓦级AI基础设施意味着电力和冷却已经进入模型架构讨论
据彭博报道,DeepSeek在内蒙古的AI基础设施目标达到吉瓦级,16万颗950DT只占其中一部分容量。对于AI数据中心来说,吉瓦级已经是非常大的电力等级。
这类基础设施不能只看服务器采购成本。芯片满载功耗、互联系统、电源转换、冷却泵、存储、网络以及备用容量共同决定PUE和总能源需求。芯片性能如果提升20%,但系统为了实现同等吞吐需要更多卡、更复杂互联和更高冷却负担,最终每Token能源成本未必更低。
内蒙古等地区具备风光资源、土地和大型能源基地优势,也适合部署对时延不极端敏感的大规模计算设施。AI算力向能源富集地区布局,本质上是“东数西算”在大模型时代的一次升级:过去转移的是通用云计算和离线数据处理,未来转移的可能是全天候运行的推理产能。
不过推理业务又具有用户时延约束。模型请求来自全国乃至全球,如果计算节点远离用户,需要通过骨干网络设计分层服务。可以把高频、低时延请求放在靠近用户的边缘推理节点,把长任务、批量Agent、异步生成和部分Decode工作放到能源成本更低的超大集群。算力调度与网络调度会越来越紧密。
六、国产AI芯片的竞争单位已经从“芯片”升级到“系统”
先进AI芯片竞争过去最受关注的是制程、晶体管数量和单卡算力。但在出口限制和供应链约束长期存在的环境下,中国厂商越来越倾向于用系统架构补偿单点差距。
CloudMatrix 384和Atlas 950的思路都非常明确:如果单颗芯片无法在所有指标上对标最先进GPU,就通过更多芯片、更大的内存池、更高的互联带宽和软硬件协同构建整体吞吐。
这条路线的代价也很清楚。更多芯片意味着更高功耗、更复杂网络、更高故障概率和更困难的软件调度。因此系统工程能力必须同步提升。只追求“堆卡规模”很容易获得漂亮的峰值数据,却未必能获得好的模型有效算力利用率。
未来国产算力真正需要比较的指标,应至少包括:单位机柜有效Token吞吐、单位功耗吞吐、MoE通信效率、长上下文KV Cache效率、故障恢复时间、集群可用率、软件迁移成本以及模型开发者的调试效率。
一旦这些指标能够稳定进入生产,芯片生态才算跨过从“可用”到“规模可用”的门槛。
七、对DeepSeek来说,掌握基础设施会改变模型研发方式
DeepSeek早期因高效模型架构而受到关注,其中MoE、注意力优化和工程级训练效率一直是核心特点。如果未来拥有自己的超大推理集群,它对模型设计的约束条件也会变化。
模型团队可以围绕硬件特点共同设计架构。例如根据950DT的内存容量和带宽决定专家大小,根据超节点互联拓扑设计专家并行策略,根据低精度数据格式调整量化训练,根据集群故障模型设计弹性推理。
这就是所谓hardware-aware model design。模型不再被视为一个可以任意搬到不同芯片上的抽象神经网络,而是从训练阶段就考虑目标基础设施。
英伟达的优势长期来自CUDA、GPU、NVLink/NVSwitch、通信库和框架共同形成的整体生态。国产算力如果要建立自己的竞争力,也需要模型公司参与反向优化。一个拥有海量真实请求的客户能够提供最重要的反馈:哪些算子慢、哪些通信模式拥塞、哪些错误最常见、哪些低精度格式最适合生产。
如果DeepSeek与昇腾形成深度联合优化,其意义会超过一次芯片采购。
八、这笔潜在订单最值得观察的四个后续指标
第一是交付节奏。950DT规划在2026年第四季度上市,大规模供货还受到HBM、先进封装、服务器制造和数据中心建设进度影响。16万颗芯片不可能像采购普通服务器一样一次性交付。
第二是实际负载。最终到底主要运行DeepSeek在线推理、Agent后台任务,还是兼顾训练和微调,将直接决定系统架构。
第三是软件迁移效率。DeepSeek当前模型生态广泛支持CUDA,如果大规模迁移到昇腾,CANN、MindSpore以及PyTorch适配层如何处理自定义算子和推理优化,会是决定项目成败的关键。
第四是单位Token经济性。只有在稳定延迟、可用率和精度约束下,国产集群能够给出具有竞争力的每百万Token成本,这种部署模式才会被更多互联网企业复制。
九、结语:AI算力竞争正在进入“集群即计算机”的阶段
16万颗昇腾950DT这个数字很吸引眼球,但它真正对应的技术趋势,是AI基础设施从服务器集群向超大逻辑计算机演进。
模型规模和推理量持续增长后,单卡指标的重要性会下降,系统级互联、内存池、任务调度和软件栈的重要性持续上升。华为押注SuperPoD,DeepSeek擅长模型效率优化,两条路线如果在大规模生产环境汇合,会形成一个很有代表性的中国AI基础设施样本。
它最终能否成功,不应只看“用了多少国产芯片”。更重要的评价标准是:这些芯片能否在长期运行中形成稳定、高利用率、低单位Token成本的推理产能。
如果答案是肯定的,那么国产AI算力跨过的将不只是芯片替代的一步,而是从单点硬件能力走向完整系统能力的一步。
参考资料
- Bloomberg, DeepSeek Plans Big Huawei AI Chip Order to Power New Data Center, 2026-09-04
https://www.bloomberg.com/news/articles/2026-09-04/deepseek-plans-big-huawei-ai-chip-order-to-power-new-data-center - Huawei, 以开创的超节点互联技术,引领AI基础设施新范式
https://www.huawei.com/cn/news/2025/9/hc-xu-keynote-speech - Huawei Cloud, 华为云发布CloudMatrix 384超节点 多项性能全面突破
https://www.huaweicloud.com/intl/zh-cn/news/20250424094932570.html - Serving Large Language Models on Huawei CloudMatrix384, arXiv:2506.12708
https://arxiv.org/abs/2506.12708 - Horizon Daily, 2026-09-05 中文摘要
https://thysrael.github.io/Horizon/2026/09/05/summary-zh.html