ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

共封装光学CPO深度解析:原理、落地挑战与产业链格局

共封装光学CPO深度解析:原理、落地挑战与产业链格局 1. 共封装光学CPO到底是什么先从“光模块”说起如果你过去两年一直在关注AI算力集群、数据中心网络或者高端交换芯片那“共封装光学CPO”这个词几乎不可能没听过。从NVIDIA、博通、Marvell到台积电、Intel、AMD再到国内的各大设备和芯片厂商从2023年开始把CPO当作下一代互联的核心路线来推。我自己的感觉是这个词的热度上升得非常快但真正能把CPO讲透、讲明白的人其实不多。很多人一看到“共封装光学”这样的术语会觉得它特别高深。说白了CPO的概念其实就一句话把光模块组件尤其是光学引擎从可插拔的模块盒子里拿出来直接和交换芯片或者计算芯片封装在一起让光信号从芯片附近就能进出。它要解决的是传统可插拔光模块在带宽密度、功耗、信号完整性这几个维度上快要撑不住的问题。我在实际接触这个方向的时候要说适应它确实有个过程。因为咱们做传统网络硬件的时间太长思维惯性就是“芯片管电、模块管光、线缆管连接”层与层之间分得很清。CPO把这个边界直接打穿了——封装、硅光、半导体工艺、网络协议、散热设计全搅在一起一个人很难再从头管到尾。这篇文章里头我会把CPO的技术原理、关键设计思路、实际落地中的测试验证问题以及产业链各个环节的情况都拆开聊一遍。不管你是做网络架构的、做芯片封装验证的、做数据中心运维的还是刚入门想转方向的学生只要想搞明白“共封装光学到底解决了什么问题、用了什么手段、落地难在哪”这篇文章应该能帮你建立一个比较完整的认知框架。2. 为什么非要搞CPO可插拔光模块的瓶颈已经到极限了2.1 传统可插拔光模块的“三重困境”理解CPO的价值得先回到现在的可插拔光模块到底遇到什么问题。我在搭建网络设备时最直观的感受就是机箱面板上密密麻麻的笼子端口交换芯片往外走高速SerDes信号PCB走线再进连接器再进光模块内部光模块里的Driver和TIA跨阻放大器处理完电信号后再由激光器和探测器完成光电转换。这套体系出现到现在链路已经非常成熟稳定甚至可以说被验证得很好。但在速率往上爬的过程中物理限制越来越明显功耗问题可插拔光模块的功耗在QSFP-DD或者OSFP这种形态下单模块做到400G的时候大约是12W左右到了800G能到15W到18W1.6T形态如果还走可插拔路线单模块功耗可能直奔25W以上。一台64口交换机的光模块总功耗可能超过1000W这个数字对整机散热系统是巨大的负担。更要命的是信号从交换芯片出来到光模块要经过封装基板、PCB走线、连接器、模块内部柔性板这么长的物理路径每一段都在消耗能量、引入噪声和抖动。带宽密度不够机箱面板的数量是有限的交换机前面板就那么宽能塞下的端口笼子数量有上限。速率往上提端口数就得往下减或者模块的形态就得越做越宽。带宽密度的提升速度直接受制于可插拔模块的物理尺寸。信号完整性的极限交换芯片的高速SerDes速率从最初的10G一路涨到112G甚至在向224G SerDes演进。在PCB上走100G以上速率的信号损耗控制、抗串扰设计、连接器选型变得非常艰难。每往前一步板材、过孔阻抗、链路预算都要重新来一遍代价是成倍增加的。我做过一个很粗略的链路预算对比一颗51.2T交换芯片如果用OSFP可插拔方案芯片到模块的SerDes走线长度大概在6到10英寸这个范围往往需要Retimer或重新定时芯片来放大信号额外功耗非常可观而Cpo方案把光学引擎封装在芯片同一基板上走线长度缩短到毫米级别信号质量完全不一样。2.2 CPO的核心思路缩短电信号路径延长光信号路径CPO的思路恰恰是把物理规律利用到极致电信号在PCB上传输损耗大、速率受限那就让它走最短路径。把光模块的“心脏”——光学引擎Optical Engine也就是包含调制器、探测器、光波导、耦合结构的硅光芯片——放到和主交换芯片或计算芯片同一个封装基板上或者距离芯片非常近的位置上让高速电信号从ASIC出来几乎不出封装就完成了光电转换进入光纤传输。这里有个关键点不是所有模块功能都挪进去了。激光器可以有不同选择有的方案采用外置光源External Light Source通过光纤把光送到CPO封装内部的光引擎上再经过调制器调制后输出有的方案把激光器也集成到封装里。两种路线各有取舍后面章节我会详细讲。光信号一旦进入光纤传输距离就不是问题了。数据中心的机柜间、服务器集群之间几十米到几百米的传输单模光纤完全能够覆盖而且几乎没有信号质量损耗的烦恼。CPO的本质就是把“光电转换的节点”向芯片靠近了一大步用一个“不可插拔”的牺牲换来了功耗、密度和信号质量的大幅提升。2.3 CPO的收益用数字说话光说理论没感觉我来算一笔账。假设一颗51.2Tbps的交换芯片采用传统可插拔方案单片OSFP模块功耗按15W算整机64个端口就是960W的光模块功耗再加上SerDes链路上的额外功耗、Retimer芯片的电能消耗总功率相当可观。换CPO方案呢由于链路缩短SerDes驱动可以大幅降低功耗光学引擎的Driver和TIA因为距离ASIC更近、走线短且阻抗可控功耗也能降下来。行业内普遍的数据是CPO方案在同等交换容量下系统级功耗比可插拔方案降低30%到50%。在AI集群动辄几万台服务器互联的场景下这个功耗缩减的绝对值非常可怕。另一个收益是延迟。电信号走线缩短光电转换节点减少端到端交互延迟进一步降低。虽然光信号在光纤中的传播延迟没法省但节点上节省的几十纳秒到几百纳秒对大规模分布式训练中的集合通信操作还是有实际意义的。3. CPO的整体设计与技术实现不是“把模块塞进去”那么简单3.1 三种路径片间Near-Package、片上In-Package与混合“共封装”这个词涵盖了几种不同的集成深度。严格意义上CPO通常指把光学引擎和计算/交换芯片放在同一个封装基板上封装尺寸较大但Al的光电共封就在芯片内部集成光学器件还有业界经常说的近封装光学NPO形态把光学引擎放在与主芯片非常接近的有机基板上。近封装光学NPO光学引擎和ASIC共享同一个基板但距离比较远还在同一个封装内部。这种方案封装难度相对低一些对硅光引擎的集成度要求没那么苛刻是很多传统光模块厂商比较容易切入的路线。共封装光学CPO光学引擎和ASIC紧密耦合在同一基板甚至通过硅桥、Interposer实现更高密度的互连。对封装工艺、热管理、信号完整性设计要求极高。片上光学PIC集成进ASIC直接把光学器件做进计算芯片的制造流程里这个难度最高目前还没有大规模商用的产品出现更多是在研究和早期验证阶段。还有一个粗划分维度是有没有集成激光器。合封激光器的方案功耗密度高热管理压力大但模块化程度高外置光源方案把激光器放到封装外可插拔的位置封装内部只做调制和接收热源分散可靠性管理更容易是当前CPO商用产品的主流选择。我目前接触的主流交换机CPO方案基本都是外置光源路线。3.2 核心技术点硅光调制器、光电探测器与光纤耦合硅光引擎是CPO里最核心的组成部分。它是在硅基板上用半导体工艺做出光波导、调制器、探测器、耦合器等光学和电学元件。我们平时讲“硅光”本质上就是用CMOS工艺来造光学器件这带来的好处是可以用大规模半导体制造能力来生产光学组件成本有希望大幅下降。硅光调制器负责把高速电信号“写”到光信号上去。目前MZM马赫-曾德尔调制器和微环调制器是两个主要流派。MZM带宽高、线性度好、温度敏感性相对较低但是占芯片面积大、功耗高微环调制器面积小、功耗低但对波长和温度极其敏感需要闭环控制否则稍有热漂移就把工作点跑飞了。我没有亲自做过微环的流片验证但听在硅光代工厂做过的朋友讲温度控制那部分调试起来确实非常痛苦也有体会。在100G/lane甚至更高速率的CPO产品里MZM因为稳定性更好目前是很多公司的首选微环则更多用在追求极致功耗和密度的场景里。光纤耦合是另一个让人头大的环节。硅光芯片上的波导尺寸在亚微米级别和标准单模光纤的模场直径差了差不多十倍。直接端面对接的话耦合效率会低到没法用。业界常用的是通过光栅耦合器或者边耦合器来做。光栅耦合器直接在芯片表面垂直耦合对准精度要求相对低但耦合带宽窄边耦合器耦合带宽大、损耗低但是对准精度要求极高通常需要在亚微米级别。CPO封装里面的光纤阵列Fiber Array对准工艺是整个制造环节中良率损失和成本的主要来源之一。3.3 CPO交换机的物理形态一个整机视角我们平时看到的“800G或1.6T可插拔交换机”前面板是一排光模块笼子。而一台CPO交换机看起来很奇怪的地方在于前面板可能找不到多少光口光纤直接通过面板上的MPO连接器进到机器内部连到封装里的光纤耦合处。可插拔模块形态被替换成了“光缆跳线连接器面板”光模块不再是一个独立的可插拔单元。这种形态变化对整机设计的影响非常大。首先散热结构完全变了光模块不再是独立风道里的独立热源而是变成了封装内部的局部热点其次维护方式变了传统光模块坏了抽出来换一个就行CPO坏了整个线卡都要换再次光纤管理的复杂度上来了面板前可能密密麻麻全是光缆整理起来挑战不小。从可维护性角度说这是从“模块级维护”退化到了“板卡级维护”这是CPO在实际部署中非常重要的一个心理门槛。4. 实操中的关键环节CPO测试设备与验证流程这部分是我最想多聊一点的因为恰恰是很多人会忽略的地方。CPO不是光设计出来就完事的能不能大规模量产良率是多少测试环节的效率和准确性几乎决定了产品能不能真正落地。我注意到最近“珈蓝特的CPO测试设备”这个热词在业内传播度上升它反映的正是这个需求CPO对精密测试设备的依赖到了前所未有的高度。4.1 为什么CPO的测试比传统光模块困难得多传统可插拔光模块是独立成品做成一个独立标准形态测试时插到误码仪、光功率计上就行完全是成熟标准件测试各自独立不互相牵扯。CPO测试的核心难点在于光学引擎和ASIC已经封装在一起了你不能把它拆开来单独测光器件。在封装前硅光晶圆可以在晶圆级测试设备上做检测比如用垂直耦合的方法测试波导和调制器性能但一旦完成CPO封装光纤已经和硅光引擎对准耦合再要单独验证ASIC的功能和光电协同的性能只能用系统级的测试手段。这里牵扯到几类测试设备光学测试仪器可调谐激光器、光功率计、光谱分析仪、高速示波器、误码仪、光衰减器。晶圆级/封装级光学测试系统主要包括耦合对准系统、自动光纤阵列对准设备、晶圆级光电测试探针台。热管理和可靠性测试设备温度循环箱、高低温测试系统、湿热老化试验箱、激光器老化测试系统。系统级网络性能测试设备高速数据流发生器、网络测试仪验证整体交换性能。珈蓝特这种公司做的CPO测试设备正是在后面那几类里尤其是耦合对准与光电联合测试这类自动化设备。没有这类设备CPO的量产就是纸上谈兵。4.2 CPO晶圆测试在封装之前把坏的找出来CPO的测试流程在封装前后有不同的侧重点。封装之前做的是硅光裸片测试也叫芯片测试目的在于筛掉有明显缺陷的硅光引擎避免浪费后续昂贵的封装资源。在这个过程中用到的最核心设备是探针台和光学测试系统它们把光纤阵列或者透镜光纤悬停在硅光芯片的耦合区上方通过精密的六轴对准系统找到耦合效率最高的位置然后执行光功率扫描、调制器带宽测试、探测器响应度测试等。这个过程非常耗时——所以自动化的光纤对准设备显得格外重要。一个工位如果全靠人工手动对准一天的吞吐量可能只有几十颗芯片配上自动对准与快速扫描算法才可能做到每小时几百颗的规模。还有个细节是在片加热系统。硅光器件的性能对温度非常敏感测试时需要把晶圆控制在稳定温度比如25摄氏度和70摄氏度两种条件下分别测一遍用来评估器件的温度稳定性。这就意味着探针台不仅要带光学对准模块还要集成温度控制系统复杂度进一步上升。4.3 CPO封装后测试真实应用场景的性能验证芯片完成封装之后整个光学和ASIC的联合体已经成为一个系统这时候的测试目标是确认“合在一起还能不能正常干活”。常见做法是做光回环测试从CPO封装的发射端口发出特定波长的光信号通过外部光纤环回进入该封装的接收端口然后验证整体误码率。这种测试可以绕开外部交换网络只验证封装内部的光电链路。如果误码率超标需要进一步排查是激光器退化、调制器带宽不足、光耦合损耗过大还是ASIC侧接收端的TCK电路问题。在实际测试中一个反复出现的坑是DSP的均衡能力不足。CPO链路内部的光电信号质量比传统模块好坏的就更少所以有些系统在设计时对DSP的均衡要求放得比较松。但如果温漂导致光模块工作点偏移光信号质量会急剧下降超出DSP均衡能力的上限误码率瞬间飙升。我们后来在测试方案里专门加了一项“温度扫描下的误码率测试”把封装置于不同温度环境下跑通无误码才算通过。4.4 测试设备选型要注意什么结合珈蓝特这类厂商的CPO测试设备我能给的建议主要是以下几点精度和重复性优先CPO耦合对准的精度通常在亚微米级别一台测试设备如果本身的运动控制重复精度不够测得的数据就没法参考。选设备时不要只看厂商标称的指标要看实测重复性数据。支持混测和自动化CPO的光电测试往往包含多个环节设备要支持在同一平台上做多种测试尽量减少工序间搬运带来的误差和时间损耗。温度和湿度控制硅光测试对环境的敏感性非常高测试设备自身要有温湿度补偿机制或测试环境的闭环控制系统否则光谱测试数据根本没法对比。软件和算法能力自动寻光算法、波导对准算法、校准流程的效率决定了整条产线的吞吐量。同样一台对准平台软件算法的优劣可以让产线效率拉开3倍以上的差距。5. 常见问题与故障排查CPO落地中的“头疼时刻”5.1 光信号功率异常偏低应用中最常见的现象就是“光口信号光功率不对劲”。如果CPO模块的发射光功率比预期低好几个dB大概率是光纤耦合区出了状况。先检查外部光缆的连接器再考虑内部耦合。在测试中遇到的耦合恶化往往是封装过程中引入微粒或湿气导致耦合端面有污染或者在热循环中封装基板变形导致光纤阵列和硅光芯片之间的相对位置发生了细微偏移。前者需要背靠背的老化测试来暴露后者则对封装材料的热膨胀系数匹配提出了硬性要求。说实话这两个问题如果在设计阶段没有留足容差后端的返修几乎不可能整个器件只能报废。5.2 激光器光源漂移与闭环控制失效外置光源方案的激光器位于CPO封装外部相对好更换一些但它和封装内部调制器之间的波长匹配却是一个非常关键的稳定性问题。硅光调制器的工作窗口是固定的而激光器的中心波长受温度影响会漂移一旦波长跑出调制器的带宽范围调制效率就会直线下降。解决思路是加闭环控制封装内设计有波长锁定器实时检测激光器波长的偏移量反馈给光源控制模块通过调整激光器温度或者驱动电流把波长拉回目标值。如果在测试中发现“系统在启动稳定后光功率慢慢爬升或下跌”的现象多半就是这个控制环路没调好需要重新调PID参数或者检查波长锁定器的校准状态。5.3 热管理不当导致的性能劣化CPO的整形难点是单点热密度非常高。交换ASIC本身就是大功率热源光学引擎又紧贴着它放置。硅光器件的折射率随温度变化很大微环调制器尤其娇气——只要温度变化超过几摄氏度工作曲线就完全偏了。实际项目中我们验证过不同散热方案的差异风冷方案在机柜环境中封装表面的局部温差可以达到10摄氏度以上对光学性能的影响非常明显液冷方案则可以把温差控制在3摄氏度以内系统的光谱稳定性和误码率表现明显更好。所以坦白讲CPO的大规模落地从物理层面就已经需要液冷来做配合。如果你所在的数据中心连单机柜10千瓦以上的液冷能力都没有CPO方案的可部署性就很堪忧了。5.4 维修与返修的尴尬处境这是CPO对比可插拔方案最尴尬的地方。传统光模块坏了直接把模块拔下来用备件替换间隔不会超过几分钟。CPO封装坏了只能换整个线卡或整个光引擎模组代价非常高操作时间段也长得多。应对思路是设计上增加冗余给CPO封装设计更大余量减少故障率系统层面做链路冗余一个封装故障时自动切换流量到备用路径备件策略上储备线卡而不是光模块。但说白了这些手段降低了运营事故的影响却没有改变运维体验变差的事实。6. 产业链格局与影响谁能吃到CPO的红利6.1 从交换机与芯片厂商看CPO最先落地的领域一定是从交换芯片和AI加速器开始的。博通早在2022年就发布了Tomahawk 5交换芯片的CPO版本51.2T的交换能力配合CPO光引擎算是个里程碑式的产品。NVIDIA的Quantum-X系列也布局了CPO方案。国内方面华为、新华三、锐捷等厂商的CPO原型机已经有过多次展出但距离大规模商用还有距离。对芯片厂商来说最大的变化在于他们不再只是“把芯片卖出去就行了”还得提供整套CPO光引擎的参考设计、封装方案、甚至配套测试方案。生意模式的复杂度完全不一样了。6.2 从封测厂看CPO对封装能力的需求是检验半导体公司与传统光器件公司能否合作的一个重要标准。高密度2.5D/3D封装、硅桥互联、共基板的光电混合集成——这是传统封测大厂擅长的领域而硅光芯片的设计、加工、测试则是光器件厂商的老本行。CPO正好把这两个阵营拧到了一起台积电、日月光、长电科技都在布局这项能力有不少和硅光公司合资建产线的例子。6.3 从测试设备厂商看回到珈蓝特这类测试设备厂商。CPO测试设备的门槛一点都不比芯片测试设备低。一台全自动CPO测试平台要同时具备高精度运动控制、光学对准算法、光电信号测试能力、热管理系统和数据分析软件。过去光模块测试设备市场相对分散哪家都能做一点但CPO测试设备市场技术壁垒明显提升可以说是一门精细活。整个产业链都在为CPO做技术储备测试设备是其中不可或缺但又容易被低估的一环。测试设备不只是扮演验证和出厂检查的角色它在研发阶段帮助快速迭代设计方案、量产阶段帮助提高良率这种反向价值往往才是最大的。6.4 CPO的可能应用场景除了数据中心交换机的经典场景CPO在AI大模型训练集群里的需求也极其迫切。一方面AI服务器集群的Scale-Up纵向扩展和Scale-Out横向扩展网络对带宽密度的要求比传统云数据中心高一个数量级另一方面单GPU功耗已经在700W以上再加光模块功耗整机柜的供电和散热压力就会非常大。还有高性能计算HPC、云服务商自研交换芯片、光互连背板、边缘计算节点这些都是CPO短期内最可能落地的应用场景。更远一点看如果有天光电共封装能延伸到光互连存储、光计算领域那整个计算体系的结构都会发生很大变化。但那属于更远景了现阶段的注意力还是应该放在把CPO的良率、测试、可靠性跑通这件事上。7. 我对CPO发展的一点个人判断接触CPO这一路个人体会最深的不是具体的技术参数而是“物理规律和工程博弈”这两个词的重量。CPO本质上是在跟“信号损耗”“功耗密度”“封装良率”这些物理和工艺极限硬碰硬每一次性能提升都是用更复杂的工艺和更大的试错成本换来的。很多人问我到底该不该现在上CPO。我的看法很直接如果你的业务对功耗极度敏感、对带宽密度有刚性要求而且你能接受“整卡替换”这种运维模式那CPO确实值得认真评估如果你的部署场景还在800G速率以内、机柜内有比较充裕的功耗预算那传统可插拔方案短期内仍然够用可以先等一代。落到个人层面我觉得现在开始补硅光基础、信号完整性设计、先进封装工艺相关知识是一个非常跟得上趋势的投资。测试设备的自动化和算法化能力在未来三五年的需求量会持续上升。最后一个小建议如果你在一个正在搞CPO的团队里一定要把散热设计和光纤耦合细节盯死那才是决定CPO项目真正成败的两个命门。
返回列表