
今年的CIOE逛完朋友圈几乎被1.6T光模块刷屏。从光芯片到模块厂从交换芯片到测试仪表展台摆件不约而同换成了1.6T三个字。但比起谁家又发了多少个新品更值得琢磨的问题是1.6T到底走哪条路LPO继续砍DSPNPO往交换机芯片边上挤还是CPO一步到位共封装这届展会上三派都有玩家也各有各的理由和难处。作为一个从100G时代一路做到现在、几乎年年都去光博会蹲几天的人我这次给自己定的任务就是把这些技术路线彻底捋清楚。下面这篇算是CIOE展后的完整盘点和思考把LPO、NPO、CPO三条路线的原理、厂商进度、成本差异、落地节奏和运维影响通通说透给正在做技术规划或产品选型的朋友一个参考。1. 为什么1.6T成了绕不开的坎需求驱动的必然升级1.1 带宽焦虑AI集群把光模块逼到了墙角过去几年数据中心内部的光模块升级节奏虽然快但还算有章可循100G到400G到800G基本是四年一个代际。但AI大模型训练集群的出现把节奏彻底打乱了。大模型训练需要海量GPU并行计算集群规模从千卡级别一路扩展到万卡甚至十万卡级别而GPU之间要无阻塞通信网络带宽就是硬约束。简单算一笔账如果单台GPU互联带宽需求是400G或800G那么万卡集群内部就是P级别的总带宽需求这不是把交换芯片做大就完事的事而是要每个端口都能喂得饱。我经常用一个比喻算力是水的源头光模块就是水管。GPU的算力再强如果数据在GPU之间传不动整个集群的利用率就会被网络拖住。业界在AI集群里最怕的一件事就是算力等网络网络带宽一旦成为瓶颈再贵的GPU也只能干等。所以这两年光模块厂商的订单逻辑发生了根本变化——以前是运营商招标驱动现在是AI算力基建驱动需求侧的爆发力完全不同。到了2024到2025年800G光模块刚开始放量但更大的问题已经来了新一代交换芯片按照102.4T容量来设计64个端口要跑到1.6T800G端口数量要么翻倍、要么带宽翻倍而交换芯片在功耗、面积、走线密度上都已经逼近物理极限。单端口800G已经喂不饱下一代核心交换设备了1.6T成了一个绕不开的坎。展会上几乎所有厂商都明白这个窗口期拼的不只是产能更是技术路线的判断力。1.2 从800G到1.6T不只是一次简单的翻倍很多人以为1.6T就是800G在速率上乘以2芯片光芯片封装全部照搬把通道数翻一倍就行。实际远没那么简单。从800G到1.6T行业普遍采用的是8×200G PAM4架构也就是说单通道速率从100G/lambda提升到200G/lambda。这不是把调制器多开几个窗口就行而是整个信号链路都得重新设计。单通道100G/lambda对应约53GBaud的PAM4信号200G/lambda就到106GBaud左右波特率翻倍意味着带宽需求、信号完整性难度、功耗和热设计压力全面上升。尤其是接收端的TIA和Driver要在更宽的带宽下保持低噪声、高线性度难度比上一代高了一个数量级。再加上EML和硅光调制器在200G速率下的啁啾、消光比、带宽响应都变得敏感光芯片和电芯片的联合调优比800G时代更加关键。这还只是可插拔模块这一层。真正让行业分裂出LPO、NPO、CPO三条路线的深层原因是如果继续按传统方式把DSP、Driver、TIA、光引擎全部塞进一个可插拔模块1.6T单模块的功耗有可能冲到30瓦以上。对超大规模数据中心来说高功耗意味着高散热成本、高电费、高机架密度压力。所以大家都在寻找一个能不能少用电、少用DSP、少走高速链路的办法。也正是在这种集体焦虑下三条技术路线才真正分道扬镳。2. 三条技术路线的底层逻辑拆解2.1 LPO砍掉DSP把功耗和成本一起打下来LPO的全称是Linear-drive Pluggable Optics线性驱动可插拔光模块。字面上看它仍是可插拔形态但核心变化是模块里不再放DSP。传统光模块靠DSP完成重定时、时钟恢复、均衡、信号整形和部分FEC功能DSP是模块的大脑。LPO把这块大脑拿掉发送端用线性Driver直接去驱动EML或硅光调制器接收端用线性TIA加简单的CTLE连续时间线性均衡做信号放大和粗均衡剩下的信号恢复工作全部交给交换机主芯片上的SerDes去处理。这么做的好处非常直接。首先是功耗传统1.6T可插拔模块如果带DSP业内预估功耗要突破30瓦LPO版本可以压到20瓦以内甚至更低。其次是延迟DSP的处理会引入微秒级甚至更大的额外延迟LPO把这一层省掉对AI训练这类对延迟敏感的分布式计算场景很有利。第三是成本DSP在模块BOM里往往是单价最高的芯片省掉DSP等于直接砍掉一大块成本整体模块BOM能降20%到30%。但LPO不是没有代价。最核心的问题是责任转移模块里没有DSP做重定时和均衡Host侧交换芯片的SerDes必须足够强能扛起链路均衡和信号恢复的工作。这就意味着光模块厂商和交换芯片厂商必须深度联合调优不能像以前那样买来插上就能用。我在展会上看到不少做LPO的厂商都在强调我们和博通、英伟达的交换芯片做了兼容性验证因为如果不针对特定SerDes调优误码率很难压到符合要求的水平。另外LPO对链路预算也更敏感光路插损稍微偏大一点性能就可能劣化到不可接受所以它更适配距离短、链路简单的机房内互联场景。2.2 NPO站在可插拔与CPO之间的折中派NPONear-Packaged Optics近封装光学这个路线通俗理解就是把光引擎从机箱面板挪到交换芯片封装的家门口。不像LPO还是传统面板可插拔也不像CPO那样把光引擎彻底和ASIC焊在一起NPO把光引擎放置在交换芯片的基板边缘或附近通过基板上的短距离高速走线与ASIC互联。电信号从ASIC到光引擎的传输距离从传统方案的几十厘米缩短到几厘米信号损耗大幅降低因此对DSP和高功耗SerDes的依赖也跟着降下来。NPO的聪明之处在于它既不像LPO那样需要Host侧SerDes承担巨大均衡压力又不必马上跳进CPO的深水区。光引擎本身的封装设计、激光器方案、耦合工艺都可以沿用可插拔模块积累的经验。维护性上也有讲究部分NPO方案把光引擎设计成相对独立的单元故障后还有机会单独更换光引擎或光连接器不需要整机报废。展会现场讨论NPO的人不少但实际展出的成品方案比LPO和传统可插拔要少很多厂商还停留在技术预研/演示阶段量产产品不多。不过NPO也面临明显的挑战。一是标准化程度还很低每家实现方式各不相同有点像当年可插拔模块标准分裂的场面。二是测试和良率问题当光引擎与ASIC封装基板集成在一起后光引擎的状态检查、故障定位、质量检验都要依赖新的测试方案这比测试一个独立的可插拔光模块麻烦多了。三是产业链协作深度完全不同原先光模块厂可以独立交付一个器件NPO时代必须和交换芯片厂商深度绑定供应链话语权格局会发生很大变化。2.3 CPO终极形态还是过渡方案CPOCo-Packaged Optics共封装光学的说法这几年被反复炒热基本思路是把光引擎和交换ASIC放在同一个封装基板上让光信号和电信号在芯片级直接交汇。ASIC到光引擎的电走线只有毫米级别几乎不需要重定时功耗、带宽密度和延迟都是三条路线里理论最优的。这也是为什么谷歌、Meta这类超大规模玩家一直对CPO有兴趣——单个机柜能塞进的互联带宽大幅提升电费还能省一大截。但CPO的难点也恰恰是把光引擎封进去这六个字。首先是散热问题交换ASIC动辄上百瓦功耗而光引擎里的激光器对温度非常敏感两者放在同一封装里热管理难度陡增。其次是良率和可维护性ASIC和光引擎同时制造、共同封装任何一方的缺陷都可能导致整个封装件报废成本风险太高一旦运行中光引擎故障也不可能像拔可插拔模块一样直接换新往往要更换整个交换机板卡。第三是测试问题光引擎已经和ASIC封装在一起了传统的光模块测试仪表根本没法直接插上测必须开发专门的CPO测试设备和流程。所以虽然CPO在性能上最诱人但它的落地节奏注定不会太快。目前行业判断是CPO会先在大规模、集中管理的自建数据中心核心层小范围试用比如头部云厂商的骨干汇聚节点传统商业数据中心、电信机房这种对可维护性和设备复用率敏感的场景短期内很难大面积接受。我个人的看法是CPO方向是对的但它不是用来替代当下所有可插拔方案的而是一个面向特定场景、特定技术周期的高阶形态。3. 展会现场的军备竞赛厂商布局与产品盘点3.1 1.6T可插拔OSFP-XD几乎是事实标准今年CIOE展会上1.6T可插拔产品不再是概念图而是实打实的样品。形态上OSFP-XDeXtreme Density几乎成了1.6T可插拔模块的事实标准各家展台的模块外壳、面板、散热设计看起来越来越趋同。中际旭创、新易盛、华工正源、光迅科技这些第一梯队厂商这次都摆出了1.6T OSFP-XD DR8的样品有的甚至直接标出LPO版本把省电当成最大的卖点。从展示细节能看出各家侧重点不太一样。中际旭创的1.6T系列覆盖了标准DSP版和LPO版显然是想两条腿走路新易盛在LPO上一直比较激进800G时代就有大量LPO产品出货这次1.6T也延续了这个策略华工正源和光迅科技除了可插拔也把光引擎、硅光器件等上游能力摆了出来明显是在给NPO和CPO做技术储备。交换芯片这边博通、英伟达、思科的新一代平台都在围绕1.6T端口做适配也间接验证了1.6T可插拔在明后年就会起量的行业判断。需要注意的是展台上的样品并不等于量产能力。我问了几家厂商的工程师大部分都表示1.6T真正大规模量产的窗口预计在2026年前后2025年更多是客户验证和试点。这和当年800G的节奏很像样品展示得早释放设计冻结和BOM确认的信号真正的放量还要等终端客户需求确认和供应链成熟。所以展会上的1.6T军备竞赛比拼的其实是谁能先把客户绑进自家生态而不是谁展示的模块最先点亮。3.2 测试测量决定量产进度的隐形战场1.6T时代的另一个明显变化是测试测量的江湖肉眼可见地热闹起来。是德科技、安立、EXFO这几家老牌测试厂商都带来了1.6T误码仪和高速光示波器方案一套设备的价格不便宜但这是任何一家模块厂量产前必须砸下去的成本。尤其到了200G/lambda这个速率眼图质量、误码率、抖动指标都比100G/lambda更敏感测试设备如果跟不上产品是不敢标量产两个字的。更难的是CPO和NPO的测试。光引擎一旦和交换芯片封装在一起传统的把模块插到测试板上”这套流程就失效了行业需要解决“封进去以后怎么测”的问题。我注意到今年展会上像珈蓝特这样的国内测试设备厂商也开始展出CPO相关的测试方案要解决的就是共封装场景下的光电协同测试、探针接触、光路校准和误码注入这些环节。测试环节平时不起眼但它已经是1.6T、CPO能否从样品走向量产的关键瓶颈之一。对做产品的朋友来说预算里如果还没把测试设备这一块考虑进去后面大概率会卡脖子。4. 成本、可维护性与演进节奏商用落地要看的不只是性能4.1 成本结构对比谁更划算很多人选型时只看性能和功耗但真正决定规模商用的往往是成本。这里我把三条路线在成本结构上的差异拉开来看看。传统带DSP的1.6T可插拔模块BOM里最贵的是DSP芯片其次才是光引擎、激光器、Driver、TIA和外壳结构件。DSP单价高且供货周期长是供应链里最紧俏的环节。LPO把DSP拿掉光引擎和Driver、TIA的占比自然上升整体BOM大约能降20%到30%。这也是为什么一些对成本敏感的云厂商对LPO这么积极省下的钱非常可观同时功耗还能降下来电费也省了。NPO方案里传统面板连接器和DSP相关成本减少了但ASIC基板集成、光引擎与基板的耦合、特殊测试分摊的成本上来了整体未必比LPO便宜。CPO早期更不用说了ASIC和光引擎共同封装的良率损失、测试成本、返修成本都会摊到每一台交换机上单bit成本在初期一定是三条线里最高的。不过CPO的大账要算长期TCO省下的功耗和机柜空间在超大规模数据中心里几年下来可能就抵消了初期溢价。所以成本这件事一定要把时间维度和场景维度都考虑进去不能只看单模块采购价。4.2 可维护性机房运维的痛点在数据中心运维圈里光模块是最容易损坏的部件之一。插拔次数多了、光纤清洁不到位、环境温湿度波动都可能导致光模块失效。传统可插拔方案最大的好处就是维护简单哪台设备光口出问题了拔下来换一个新的运维工程师几分钟就能搞定。CPO最让运维团队头疼的就是这个。光引擎和ASIC封装在一起后光模块级别的故障变成整机级别的故障。如果交换机上一两个光引擎坏了整个交换机可能要下线返修这对大规模数据中心的可用性冲击非常大。NPO的折中价值也体现在这里它保留了光引擎相对独立的可能性如果设计得当故障时不用整机更换维护成本比CPO低不少。这也是我判断NPO在短期内会有一批保守型客户的重要原因——不是追求极致性能而是想在收益和风险之间找一个平衡点。当然可维护性也可以通过设计来改善比如CPO方案中把光引擎做成可热插拔的光盒子但这又牵扯到光连接器的插损、对准容差和可靠性问题。没有一种技术路线可以同时做到极致性能、极致成本、极致可维护性最终都是取舍。5. 怎么选分场景的路线决策建议5.1 不同场景的适配性先给一个基于目前技术成熟度、产业链配套和运维要求的分析。超大规模AI集群自建数据中心这类场景最看重带宽密度和功耗技术团队能力强运维可以高度定制化。CPO和NPO在这里最有想象力尤其是核心汇聚层长期TCO有优势。但是在下一代产品验证成熟前LPO也可以先用起来毕竟AI集群内部的互联距离短链路可控LPO的短板不会被放大。传统数据中心和云计算中心可维护性、供应商多样性、标准互通是关键词。大概率会继续以传统DSP可插拔和LPO为主NPO可以做小范围试点CPO短期内不太现实。电信网络/长距传输场景LPO、NPO、CPO都不是理想的选项。这类场景需要DSP甚至相干DSP来做长距补偿、色散管理和强FEC省掉DSP等于把长距性能废掉一半。所以电信网络在未来很长一段时间还会是带DSP、带相干模块的天下。机房内的东西向流量如果链路都在几百米以内、光路损耗可控LPO是最务实的选择延迟低、功耗低、成本低。5.2 我的判断和实际建议把展会上的见闻和过去一年的行业信息放在一起看我个人的判断是2025到2026年1.6T LPO会在超大规模AI机房率先起量因为它最会捡软柿子捏——短距离、可控链路、Host侧可以配合调优LPO的所有短板都完美规避掉。而2026到2028年NPO有机会在追求长期成本的超大规模客户那里打开局面成为可插拔和CPO之间的过渡主力。CPO的节奏会更慢它会先在少部分巨头手里变成核心设备再慢慢往产业链外圈渗透完全不取决于模块厂而取决于芯片厂和云厂商的绑定深度。给做产品和规划的朋友一个建议在现阶段不要只押一条路。有能力的话LPO和CPO都要有技术储备因为客户需求分化太明显了有的要成本省电有的要极致密度和长期演进的确定性。另外选型时多关注实测数据而非展台参数。展会上的眼图漂亮不一定代表在客户机房、在高温环境、在老化一年后还稳定。互操作性、长期可靠性、供应链稳定性这三样东西才是1.6T时代真正决定胜负的隐形指标。我在展会上跟一位同行聊到一个细节他说现在做1.6T有点像当年从40G升级到100G比拼的不是谁先发布而是谁先把测试、可靠性、客户场景验证全部走完。光通信这个行业从来不缺聪明的想法缺的是能把聪明想法变成稳定出货方案的执行力。三条路线各有各的道理最后能跑出来的一定是在功耗、成本、可维护性和生态适配之间找到最佳平衡的那一个。