AI基础设施的第一阶段,市场用GPU数量衡量实力。第二阶段,企业会越来越频繁地发现:卡已经买到,算力却没有按理论值释放。
数据要在加速器、交换芯片、内存和存储之间持续移动。集群扩大后,网络拥塞、链路功耗、光模块温度、误码、连接器损耗和故障定位都会拉低有效利用率。新增GPU若不能获得稳定带宽,只是在机房里增加昂贵的等待者。
Coherent在ECOC 2026展示3.2T可插拔收发器、6.4T Near-Packaged Optics光引擎和面向CPO、NPO及芯片间连接的平台;Keysight同期展示覆盖1.6T收发器验证、3.2T光研究和量产测试的方案。两组发布共同说明:AI扩容正在把竞争压力传导到光互连、封装和测试。
光互连不会简单复制GPU的单一龙头叙事。它是一条由激光器、调制器、硅光、DSP、封装、光纤、连接器、交换芯片、测试仪器和系统软件共同决定的链。稀缺的是把高速、低功耗、可制造和可运维同时做到生产规模的工程能力,不是某个峰值速率。
一、为什么带宽增长快于传统网络的承受能力
大模型训练依赖大量并行加速器。每一步计算后,不同设备需要交换参数、梯度或激活,最慢链路会让整个同步任务等待。推理也在走向多卡、多机和专家模型,路由、KV Cache和远程内存访问增加了东西向流量。
单卡计算性能提升后,网络必须同步升级,否则计算与通信比继续恶化。800G、1.6T、3.2T不是营销上的数字接力,而是交换芯片SerDes速率、通道数量和集群规模共同推动的结果。OIF的CEI-224G工作把224Gbps每通道进一步拆成封装内XSR、芯片到模块VSR、芯片间MR和背板/铜缆LR,分别规定不同距离与架构目标。这说明“一个224G接口”并不存在,物理距离会直接改变功耗、均衡、连接器与光学放置方式。速率翻倍时,信号完整性、热和误码不会按线性难度增长,往往出现更陡峭的工程门槛。
铜连接在短距离仍有成本和功耗优势,但距离增加或速率提高后,损耗、串扰和均衡功耗迅速上升。光互连因而不断向机柜内部、板级甚至封装附近推进。问题也随之变化:光引擎离计算芯片越近,电连接越短,但封装、散热、维修和良率更难。
数据中心不能只按端口带宽采购。应从训练和推理拓扑出发,测量通信模式、拥塞、尾延迟和重传,判断瓶颈位于网卡、交换层、光链路还是软件。盲目把所有链路升级到最高速率,可能花费巨大却未解决作业调度和拓扑不匹配。
二、可插拔、NPO与CPO不是简单替代关系
可插拔光模块的优势是成熟、可更换、供应商选择多。模块损坏时可以现场更换,系统和光学相对解耦。随着速率上升,SerDes从交换芯片走到面板模块的电通道越来越长,功耗和信号完整性压力增大。
Near-Packaged Optics把光引擎放到交换芯片附近,缩短高速电连接,同时保留一定模块化。Co-Packaged Optics进一步把光学与交换ASIC集成在同一封装或紧邻封装,理论上能降低每比特功耗、提高面板密度,但热、封装良率、光纤连接和维修模式更复杂。
行业不会在某一天统一切换到CPO。不同场景会并存:成熟可插拔继续服务大量机架和代际过渡;NPO在密度、维护和工程风险之间寻找折中;CPO先在极高带宽和功耗敏感的平台采用。芯片间、板间和机柜间也可能选择不同光学方案。
采购方需要避免押注抽象技术名词,应比较完整系统指标:每比特功耗、有效距离、端口密度、链路预算、模块或光引擎可更换性、故障隔离、供应商互操作和全生命周期成本。峰值速率相同的两套方案,运维成本可能完全不同。
三、6.4T光引擎的难点在封装与热,而不只在光学
高速光引擎要在有限面积内集成更多通道、更高速调制器、激光耦合和电驱动。通道密度上升后,器件差异和封装误差会直接影响光功率、眼图和误码。
封装必须同时处理电、光、热和机械四类接口。高速电连接需要低损耗和阻抗连续,光耦合需要微米级精度,芯片和激光器产生的热要及时导出,封装还要承受运输、插拔和长期温度循环。任何一项失控都会降低良率。
CPO和NPO把光引擎放到高功耗交换芯片附近,热环境更严苛。温度变化会影响激光波长、调制效率和器件寿命。系统设计要把散热器、冷板、光纤路由和维护空间一起考虑,不能在交换机结构定型后再“塞进光学”。
这会改变产业分工。光模块厂商需要更早进入系统与封装设计,交换芯片厂商要理解光学和热,先进封装企业要掌握光电协同,数据中心运营方则需要新的现场诊断和备件策略。光互连从标准模块采购,逐步变成跨企业联合工程。
四、测试设备为什么会成为关键瓶颈
速率从800G进入1.6T和3.2T后,不能靠“能亮、能通”判断质量。研发需要观察高速电信号、光眼图、抖动、噪声、误码、前向纠错和长时间稳定性;量产还要在有限测试时间内筛出边缘器件。
测试带宽和精度必须领先于被测产品。Keysight展示220GHz光电测试和从设计到生产的自动化链路,反映仪器需要覆盖更高速器件与复杂调制。测试系统本身也要校准连接器、探针、光纤和夹具带来的误差,否则测到的是测试链问题。
研发测试与量产测试目标不同。研发阶段追求完整可见性,用于定位材料、器件、封装和算法问题;量产阶段关注吞吐、重复性、自动判定和成本。企业若直接把研发仪器搬到产线,测试时间和设备投资会失控;若产测过度简化,又会把边缘缺陷带到客户现场。
更合理的做法是建立相关性:用高精度研发测试定义关键特征,再设计快速产测指标,并持续验证两者与现场故障的关系。测试数据回到工艺控制,识别晶圆、封装、耦合和老化环节的偏差。
测试能力也决定新供应商能否进入高端市场。产品样品达到峰值速率只是第一步,客户需要跨温度、跨批次、长时间误码和互操作数据。没有仪器、自动化软件和标准方法,研发成果很难转化为稳定订单。
五、AI光互连会带动一批“非明星”环节
市场容易关注光模块整机厂商,但扩容会同时拉动多类环节。
激光器和光源决定功率、效率和寿命;硅光与调制器决定集成度和传输性能;DSP和驱动芯片负责均衡、编码和信号处理;光纤、连接器及阵列接口影响插损和现场可靠性;先进封装、贴装和耦合设备决定量产良率;测试仪器、探针、夹具和自动化软件决定验证效率;热管理则贯穿模块、交换机和机柜。
这些环节的价值不会平均增长。能满足低功耗、高带宽的产品可能获得溢价,传统通用器件未必同步受益。投资和企业战略应观察三项更硬的指标:是否进入客户联合验证,是否具备量产与测试能力,是否能在下一代封装形态中保留位置。
标准与互操作同样重要。如果每家系统厂商形成封闭光引擎接口,供应链会碎片化,客户被锁定;若接口过早冻结,又可能限制创新。产业联盟需要在机械、电气、光纤和管理接口上逐步收敛,同时允许核心光学实现差异化。
国产产业链的机会也不只是“做出替代模块”。更有价值的是在测试设备、封装工艺、自动耦合、连接器和可靠性数据库上补齐能力。这些环节决定产品是否能持续出货,也是进入全球客户体系的长期门槛。
六、数据中心采购要从器件价格转向有效算力成本
一条光链路的采购价容易比较,真正成本却包括功耗、故障、更换、停机、备件和对作业效率的影响。便宜模块若误码和温度问题导致训练频繁重启,损失远高于器件差价。
运营方应把网络指标与作业指标关联。观察链路错误时,同时看GPU利用率、集合通信时间、任务尾延迟和重跑次数;识别慢链路、抖动链路和热敏感端口。网络团队不能只保证端口“Up”,还要保证集群在真实负载下达到目标效率。
采购测试应使用接近生产的拓扑和持续时间。短时线速流量无法覆盖热稳定、FEC边缘和间歇错误。需要在不同温度、不同光纤长度、不同厂商互联和故障注入下运行,并验证监控系统能否定位问题。
合同中可加入误码、功耗、温度范围、互操作、故障更换和遥测接口要求。对NPO和CPO方案,还要明确光引擎或交换板故障后的维修边界、备件粒度和服务时限。维修一次要更换整板还是单个光引擎,会显著影响总成本。
最终应计算每个训练或推理任务的网络成本:通信等待消耗了多少GPU小时,网络与光学占多少电力,故障导致多少任务重跑。这样才能判断升级到更高速率是否真正创造价值。
七、设备和元器件企业该怎样行动
第一,不要孤立开发单个器件。尽早与交换芯片、系统、封装和测试伙伴建立联合平台,在目标链路预算和热环境下验证。只在理想实验台上取得指标,无法预测系统表现。
第二,把可测试性写进设计。预留监测点、校准路径和状态遥测,建立从晶圆、封装到整机的序列号关联。若产品进入现场后只能判断“坏了”,无法快速区分光源、耦合、电驱动和连接器问题,服务成本会很高。
第三,建设自动化可靠性数据库。记录温度循环、老化、振动、插拔和长时间误码,关联材料、批次和工艺。可靠性不是认证前一次性测试,而是每批产品持续学习。
第四,谨慎规划产能。高速光产品迭代快,专用设备和工艺可能在下一代变化。扩产要看客户验证和订单可见性,产线尽量模块化,避免按峰值预测一次性重投入。
第五,培养跨学科团队。高速电、光学、封装、热、固件和测试必须共同评审。任何团队单独优化自己的指标,都可能把问题转移到下一环。
八、产业判断:测试与运维会比峰值速率更早形成利润
新一代光互连初期,最确定的需求往往不是所有数据中心立即大规模换代,而是研发机构、芯片厂、模块厂和系统厂先购买测试能力、建设验证线和进行互操作。测试仪器、夹具、自动化软件和工程服务会提前受益。
量产后,运维工具又会形成新的市场。光链路数量巨大,人工逐端口排查不可行;需要数字诊断、光功率与误码关联、故障预测、拓扑定位和自动降级。能够把物理层状态映射到AI作业影响的软件,会成为数据中心可观测性的重要组成。
峰值速率仍是进入市场的门票,但持续利润来自良率、测试效率、可靠性和服务。厂商若只追求“首个3.2T样品”,可能赢得新闻;能把每批产品稳定测完、把现场故障快速定位,才会赢得规模订单。
九、建立从晶圆到作业的分层验证栈
光互连验证不能只在模块出厂时做一次。晶圆级先测调制器、探测器和无源器件,筛除明显缺陷;封装级验证耦合损耗、电气通道和热特性;模块级测发射、接收、误码和FEC裕量;系统级再测交换机、光纤、连接器和不同供应商互操作;集群级最终观察真实集合通信和AI作业。
各层需要共享序列号与测量上下文。现场某端口在高温下出现间歇误码,应能追溯到光引擎、激光器批次、封装线和出厂边缘指标。若研发、产线和数据中心各自保存不兼容数据,可靠性改进只能靠猜。
测试策略也要采用风险分层。所有产品执行快速基础测试,边缘器件、工艺变更批次和高价值客户产品增加长时间压力测试;利用统计过程控制监测参数漂移,而不是只按固定上下限判断合格。模型可用于识别多参数异常,但放行规则和校准链必须可解释、可复核。
对运营方,集群验证应建立“链路—拓扑—作业”映射。一次训练变慢时,系统自动关联路径上的误码、FEC纠错、温度和拥塞,判断是单链路退化、拓扑热点还是软件通信问题。只有把光学指标映射到损失的GPU小时,基础设施团队才能决定何时降级、迁移或更换。
结语
GPU仍是AI基础设施的核心,但集群规模越大,单卡的重要性越会被系统效率重新定义。数据移动、光电转换、封装、功耗和验证共同决定昂贵算力能否被真正使用。
3.2T可插拔、6.4T近封装光引擎和220GHz测试,不只是速率升级,也意味着产业从模块化采购走向光电热协同工程。企业需要把研发、量产测试和现场运维连起来,数据中心则应以有效算力成本而不是端口价格做决策。
AI基础设施下一轮竞争,不只发生在GPU机柜里,也发生在每一条光链路、每一个封装界面和每一次误码测试中。
参考资料
- Coherent|AI Infrastructure at ECOC 2026|2026-09-20:3.2T可插拔、6.4T NPO与光互连平台。https://www.globenewswire.com/news-release/2026/09/20/3365104/11543/en/coherent-showcases-optical-innovations-to-scale-ai-infrastructure-at-ecoc-2026.html
- Keysight|ECOC 2026 AI Infrastructure Testing|2026-09-20:1.6T/3.2T光互连与量产测试。https://www.streetinsider.com/Business+Wire/Keysight+to+Demonstrate+End-to-End+Solutions+for+Scaling+AI+Infrastructure+at+ECOC+2026/27081851.html
- OIF|Common Electrical I/O CEI-224G:XSR、VSR、MR、LR等224Gbps每通道接口工作。https://www.oiforum.com/technical-work/hot-topics/common-electrical-i-o-cei-224g/
- OIF|Implementation Agreements:电气、光学、机械、协议和软件接口互操作规范目录。https://www.oiforum.com/technical-work/implementation-agreements-ias/
- OIF|CEI-05.3 Common Electrical I/O|2025:112G及以下代际电气与抖动互操作基线。https://www.oiforum.com/wp-content/uploads/OIF-CEI-05.3.pdf
- NIST|Smart Manufacturing Systems Design and Analysis Program:从研发到量产的测量、建模和性能保证方法参考。https://www.nist.gov/programs-projects/smart-manufacturing-systems-design-and-analysis-program