智谱被曝建设1GW国产算力数据中心,国产AI芯片开始接受大集群考验

摘要:智谱被曝落地1GW级国产AI算力数据中心,并完成对中科加禾的收购。1GW首先是电力规模,不等于模型算力指标。国产AI芯片下一阶段的考验,将从单卡性能转向大集群稳定运行、异构调度和有效利用率。

7月21日,据第一财经等媒体报道,智谱AI已落地1GW级国产AI算力数据中心建设,项目全部采用国产AI芯片。报道还提到,智谱当天完成了对国产AI异构算力软件公司中科加禾的收购。

截至本文发稿时,智谱方面尚未看到针对上述事项的完整官方披露。因此,数据中心的建设地点、投资规模、芯片构成、投产比例和建设周期,目前都缺少官方说明。媒体报道使用的表述是“已落地建设”,也不能直接理解为一座1GW数据中心已经全部建成并投入运行。

即便暂时放下项目规模,这条消息仍值得关注。

过去讨论国产AI芯片,话题经常集中在单卡性能、峰值算力和参数指标。随着模型公司开始部署万卡集群、适配多种国产芯片,问题已经转向另一层面:几千张、几万张不同型号的加速卡,能否长期稳定地完成训练和推理任务。

芯片只是算力系统中的一个部件。网络、存储、通信库、编译器、算子、任务调度、故障恢复和模型架构,共同决定集群最后能够提供多少有效算力。

1GW首先是电力规模,不是模型算力指标

“1GW级数据中心”很容易给人一种直观印象:它拥有极高的AI计算性能。

这里需要区分两个概念。

GW是吉瓦,描述数据中心的电力容量。它反映机房供电、制冷和基础设施可能承载的规模,并不直接代表模型训练速度,也不能直接换算成多少张AI芯片。

不同芯片的功耗差异很大,服务器、网络、存储和制冷系统同样需要用电。数据中心即使具备1GW供电规划,也可能采用分期建设方式,首期只启用其中一部分。

因此,判断一座AI数据中心的能力,还需要查看:

部署了多少张加速卡;

单卡和服务器采用什么架构;

节点之间使用什么网络;

集群能够支持多少张卡并行训练;

训练过程中的有效利用率有多高;

故障发生后能否自动恢复;

推理服务可以承载多大并发。

第一财经目前披露的信息只说明了电力规模和国产芯片方向,没有公布这些工程数据。把1GW当作一个建设信号更合适。模型公司已经不满足于租用零散算力资源,而是开始参与大规模算力基础设施的规划、适配和运营。

智谱此前已经在国产算力上做了多轮准备

智谱与国产芯片的合作并非从这座数据中心开始。

智谱官方文档显示,图像生成模型GLM-Image的完整训练过程使用了国产芯片。该模型采用“自回归模型加扩散解码器”的混合架构,面向海报、PPT和知识型图像生成等任务。

2026年2月,GLM-5上线后访问量快速增加。智谱表示,公司已经多次扩容国产芯片集群,但依然无法完全解决排队、响应延迟和服务卡顿问题。随后,公司发起“算力合伙人”计划,希望与芯片厂商、算力企业和推理服务商共同优化GLM-5。

6月发布的GLM-5.2,继续强化长程任务、代码生成和智能体能力。公开报道显示,GLM-5.2上线时已经完成对华为昇腾、平头哥、摩尔线程、寒武纪、昆仑芯、沐曦、海光、壁仞等国产算力平台的推理适配。

这条路线可以分成三个阶段:

先让模型能够运行在国产芯片上;

再完成训练和推理的性能优化;

随后把多种芯片纳入更大规模的算力系统。

第三个阶段的难度明显增加。

“能够运行”和“能够高效运行”之间差距很大

一款模型完成芯片适配,通常说明模型可以在对应硬件和软件环境中加载、推理或训练。

这只是起点。

实际部署时,企业会继续关注吞吐量、首字延迟、并发能力、显存利用率、通信效率和长期稳定性。

同一个模型在两种芯片上都能运行,单位时间处理的请求数量可能相差数倍。模型在几十张卡上表现正常,扩大到几千张卡后,也可能遇到新的通信和故障问题。

大模型训练需要频繁交换参数、梯度和中间结果。当集群规模扩大时,计算节点之间的通信时间会快速增加。部分芯片等待其他节点完成任务,昂贵的计算资源就会处于空闲状态。

如果单纯增加芯片数量,训练速度未必按相同比例提升。

国产AI芯片企业各自拥有不同的软件栈、编译器和算子库。模型公司需要针对不同平台处理算子兼容、内存管理、并行策略和通信优化。

这些工作很少能够通过一次适配永久解决。模型结构改变、上下文长度增加、推理框架升级或芯片版本更新,都可能要求重新测试。

国产算力的竞争因此逐渐从“有没有芯片”,延伸到“模型能否方便地迁移和稳定运行”。

异构算力会成为一个长期问题

报道中另一个值得关注的信息,是智谱收购国产AI异构算力软件公司中科加禾。该交易目前同样以媒体报道为主要来源,智谱尚未公开披露交易细节。

所谓异构算力,是指一个计算系统中存在不同架构、不同型号或不同厂商的处理器。

在国产算力环境下,这种情况很常见。一家公司可能同时拥有昇腾、寒武纪、摩尔线程或其他芯片资源。不同地区的智算中心采用的硬件也不相同。模型服务如果只能绑定某一种芯片,算力调度范围就会受到限制。

异构算力软件需要处理几类问题:

把同一个模型转换到不同芯片环境;

根据任务特征选择合适的硬件;

统一管理不同集群的资源;

屏蔽部分底层软件差异;

监控不同节点的运行状态;

在芯片故障或资源紧张时迁移任务。

这类软件相当于模型与硬件之间的中间层。没有统一的软件层,模型团队需要分别维护多套部署方案。芯片类型越多,测试和运维成本越高。

收购异构算力软件公司,显示智谱可能希望把国产芯片适配能力沉淀成一套内部基础设施。该判断仍属于基于现有报道的推测,需要等待双方进一步披露。

大集群难在长期稳定运行

大模型训练任务可能持续数周甚至数月。

在这个时间尺度下,硬件故障无法完全避免。芯片、网卡、光模块、存储设备和服务器节点都可能出现异常。集群规模越大,某个部件发生故障的概率越高。

如果训练程序无法自动识别故障并从检查点恢复,一次节点异常就可能浪费数小时甚至数天的计算。

大规模集群因此需要具备:

节点健康检查;

故障自动隔离;

训练状态定期保存;

任务自动续训;

网络异常检测;

数据一致性检查;

备用节点快速接管。

中国移动哈尔滨智算中心提供了一个公开案例。该中心部署超过1.8万张AI加速卡,并将全部加速卡组织为单一集群,支持万卡并行训练、智能断点续训和分钟级故障定界定位。

这些指标比单卡峰值算力更接近生产环境。

企业购买芯片,最终需要的是按期完成模型训练,并持续向用户提供推理服务。训练中断频率、任务恢复时间和集群有效利用率,都会进入成本核算。

国产算力需要模型、芯片和软件共同调整

长期以来,AI模型主要围绕英伟达GPU和CUDA软件生态开发。

大量训练框架、算子库和开源项目默认优先支持CUDA。开发者遇到问题时,也能从社区中找到较多资料。

国产芯片进入大模型训练后,需要补齐对应的软件能力。

这项工作不能全部交给芯片厂商。芯片厂商了解硬件结构,模型公司了解模型负载,框架团队掌握编译和运行环境。三方需要共同调整算子、通信方式、显存分配和并行策略。

模型结构也可能根据硬件特点发生变化。

例如,混合专家模型在运行时只激活部分参数,可以降低单次计算量,但会增加跨节点路由和通信压力。长上下文模型需要处理更大的注意力缓存,对内存容量和带宽提出更高要求。智能体服务会产生大量长短不一的请求,又要求调度系统兼顾吞吐和响应速度。

同一个芯片平台,很难通过一套固定参数覆盖所有模型。

模型与芯片之间的联合优化,会成为国产算力项目的日常工作。新华社对2026年中国AI发展趋势的前瞻报道中也提到,算力不是芯片堆砌,而是硬件、软件、能源与网络协作的系统。

训练和推理需要两套不同的思路

建设大规模数据中心时,还要区分训练需求和推理需求。

训练任务通常追求高带宽、低延迟通信,要求大量芯片长时间共同完成一项任务。集群中的慢节点会拖累整体进度。

推理任务面对的是大量用户请求。它更关心并发数量、首字延迟、服务稳定性和单位请求成本。不同模型、不同上下文长度和不同服务等级,可以被分配到不同型号的芯片上。

智谱2026年2月因GLM-5需求增加而出现排队和响应延迟,反映出推理容量规划的重要性。即使模型已经完成国产芯片适配,访问量突然增长时,服务仍可能受到影响。

因此,一座大型算力中心不能只看总算力。

它还需要建立分层资源池:

高性能集群负责旗舰模型训练;

稳定集群承担核心在线推理;

成本较低的芯片运行轻量模型;

闲置资源处理批量任务;

不同地区的节点分担用户访问;

异构调度系统根据负载动态分配任务。

算力中心的运营能力,会直接影响模型服务的价格和体验。

对国产芯片厂商来说,这是一次集中考试

大型模型公司的算力中心能够给国产芯片提供稳定订单,也会提出严格要求。

芯片必须有足够产量;

服务器交付要保持一致;

软件版本需要长期维护;

故障部件要能够快速更换;

模型升级后要及时完成适配;

多代产品之间还要保持兼容。

实验室测试中表现良好的芯片,进入万卡集群后,细小问题会被放大。

单机偶尔发生一次错误,放到几万台设备中可能每天都会出现。某个算子只有少量性能损失,在持续运行的推理服务中也会带来较高成本。

模型公司深度参与算力建设,可以把问题更快反馈给芯片企业。芯片企业也能依据真实模型负载调整下一代产品。

这种合作会改变国产AI产业的分工。模型公司不再只购买服务器,芯片公司也不再只交付硬件。双方需要共同维护一套持续迭代的计算系统。

数据中心还要回答能源和利用率问题

1GW级项目对电力、土地、制冷和网络资源都有较高要求。

如果服务器利用率不足,大量投入会停留在机房和设备层面。

数据中心需要有持续的训练任务、稳定的推理需求和外部客户,才能支撑长期运营。智谱既提供模型API和编码服务,也发布开放权重模型。开放模型可以扩大用户规模,但部分用户会选择自己部署,不一定形成智谱数据中心的直接收入。

因此,算力中心需要承担多种功能:

服务智谱自身模型训练;

承载在线API和智能体产品;

向企业提供私有化算力;

为国产芯片提供适配测试;

与地方智算中心连接;

向第三方开发者提供推理服务。

这些业务能否形成稳定负载,比规划规模更重要。

对于地方政府和产业园区,评估AI数据中心项目时,也需要查看模型客户、算力订单、利用率和运营团队,不能只看机柜数量与投资额。

国产算力进入系统能力竞争

智谱1GW国产算力数据中心的消息,目前仍缺少官方完整说明。

项目是单体园区还是多个节点组成,1GW是规划容量还是已启用容量,采用哪些国产芯片,训练和推理各占多大比例,都需要等待后续信息。

现有信息已经呈现出一条产业路线。

智谱先完成多种国产芯片适配,又使用国产芯片完成GLM-Image全流程训练,随后为GLM系列扩充国产推理集群。此次报道把数据中心和异构算力软件收购放在一起,说明模型企业开始同时处理硬件资源与软件调度问题。

国产AI芯片下一阶段的评价标准会更加具体:

能否组成大规模集群;

能否支持主流模型稳定训练;

能否在不同芯片之间调度任务;

能否控制推理成本;

能否在故障后快速恢复;

能否保持较高的有效利用率。

一座大规模数据中心不会自动解决这些问题。它会把芯片、网络、软件和模型中的问题集中暴露出来,也为国产算力提供持续优化的环境。

当国产芯片能够在大型集群中长期承担训练和推理任务,模型企业才会获得更稳定的算力选择,芯片企业也会得到来自生产环境的反馈。

1GW是一个醒目的数字。接下来更值得观察的,是这个数字能够转化成多少可用算力、多少稳定服务,以及多少经过验证的国产软硬件方案。

参考资料

第一财经相关报道转载:《智谱AI落地1GW国产算力中心 同步完成对中科加禾的收购》,2026年7月21日。

智谱开放文档:GLM-Image模型说明。

财联社:《智谱:全球范围内对GLM-5的需求激增 全网寻找“算力合伙人”》,2026年2月16日。

中国证券报:《智谱上线并开源GLM-5.2,适配华为昇腾、摩尔线程、沐曦等国产算力平台》,2026年6月17日。

黑龙江省人民政府:《全球运营商最大单集群智算中心在哈尔滨建成投用》,2024年8月31日。

新华网:《新华深读|2026年中国AI发展趋势前瞻》,2026年1月28日。

分享到