
1. 先从“可插拔”说起为什么它是过去二十年的绝对主流可插拔、XPO、NPO、CPO这四个词放在一起基本就是光互连领域最近三年最热闹的技术话题。作为一路从10G SFP做到800G、后来又接触CPO测试设备的老兵我能明显感觉到一个割裂现象泡在旧有可插拔逻辑里的工程师面对CPO很容易发懵而做CPO的团队又常常解释不清楚为什么非得把原本好端端的、可以随手拔下来的光模块“焊死”在交换机里。这篇文章我尽量用图解的方式把这条演进路线讲透可插拔是怎么走到瓶颈的NPO和XPO各自切掉了哪些问题CPO又到底解决了什么、付出了什么代价。更重要的是我想聊聊这些新架构背后的测试设备——尤其是CPO测试设备这个最近被反复提到的“隐形门槛”。不管你是在做数据中心网络规划、光模块研发还是交换机硬件设计这几个概念都会在未来的选型里反复遇到。1.1 可插拔光模块为什么能统治机房那么久插拔式光模块的统治力本质上来自三个字拧螺丝。如果你把一台40G交换机拆开前脸的每一个笼子对应一个光模块拔出来换一个就能完成升级或维修。这种“拧下来、换上去”的能力让运营商和互联网厂商的设备折旧率大幅降低。我不需要把整台交换机返厂不需要断电拆机手上备几支不同速率的光模块就能灵活应对。从封装形式看这条路的演进非常清晰10G / 25G时代SFP / SFP28体积小、功耗低当年叫“小封装可插拔”100G时代QSFP284路25G并行占了四个SFP的位置但密度显著提升400G时代QSFP-DD / OSFP用8路50G或4路100G实现400G前脸32个端口就能撑起12.8T交换容量800G时代QSFP-DD800 / OSFP-XD单模块功耗逼近20W1U交换机满配时光模块部分的功耗已经超过一台小服务器的整机功耗。支撑这套体系的是供应链。光模块厂商做模块交换机厂商做笼子测试仪表厂商做误码仪和光功率计各方按照MSA多源协议标准各自生产、互相兼容。这个生态太健康了以至于到了2020年还有不少人在讨论“可插拔是不是还能再战十年”。1.2 到了800G可插拔开始“吃力”了可插拔的困境不是突然出现的是三个硬指标同时撞墙的结果。第一个是功耗。800G可插拔模块内部普遍离不开DSP芯片DSP负责信号整形、时钟恢复和均衡补偿它在解决长走线高速信号劣化问题的同时也把功耗和发热推到了极限。典型800G OSFP模块整机功耗在16W到20W一颗交换芯片面对32个模块时光模块侧就要承担500W以上的热负荷。1U机箱那点散热空间真的塞不下了。第二个是密度。可插拔模块必须占用交换机面板面板宽度是物理极限1U设备最多放32个或36个QSFP-DD槽位。到了1.6T时代这个数字不会因为技术升级而变多反而可能因为模块体积和散热需求而变少。第三个是信号质量。ASIC到面板的PCB走线可以长达30到40厘米在56G SerDes时代还能靠DSP救一救到了112G、224G SerDes时代高频损耗大得离谱PCB板材、过孔、连接器每一个环节都在吞信号。你会发现真正在限制系统性能的不是光模块本身而是那段“最有一厘米”的电走线。1.3 可插拔没有退场它只会“换个位置”前面说了一堆可插拔的坏话但千万别理解成它要消失了。恰恰相反在接下来很长一段时间里可插拔依然是绝大多数场景的默认选择。原因很简单维护性、供应链成熟度、测试便利性三大优势没有任何一个新兴方案能完全替代。NPO和CPO要做的事情其实不是消灭可插拔而是把“可插拔”这个概念从交换芯片的尾部移到别处去或者把光模块里最脆弱、最发热的部分拆出来重新规划它该待的位置。2. NPO把“光模块”拆开把光引擎挪到交换机里面2.1 NPO到底拆掉了什么东西想理解NPONear-Packaged Optics近封装光学先得拆解一个光模块内部由什么组成。一个典型的800G QSFP-DD可插拔模块大致由三块组成光学引擎激光器、调制器、光电探测器、耦合透镜这是真正产生和接收光信号的部分电学电路DSP芯片、驱动芯片、TIA跨阻放大器、电源管理外壳与连接器金属外壳、金手指、散热片、解锁拉环。传统可插拔模块把这三样打包成一个整体插在交换机面板上。NPO的思路是把光学引擎从金手指和外壳里拆出来放在交换机内部的PCB板上让光学引擎紧贴交换ASIC距离从原来的30厘米缩短到3到5厘米。这个“距离的缩短”是NPO一切收益的根源。电信号在PCB上一厘米一厘米地传输每经过一个过孔、一个拐角、一个连接器都会劣化把光引擎搬到ASIC旁边等于把最困难的长距离电走线缩短到了几乎可以忽略的程度高速SerDes可以跑得更快或者干脆省掉一部分DSP补偿。2.2 NPO带来的密度和功耗收益NPO最直观的变化是交换机前脸“解放”了。光引擎不再占用面板空间面板上只需要布置光纤连接器和外部激光器入口原来的光模块笼子、金手指结构全部移除。这意味着同样一台1U交换机能够布置的端口数量不再受面板宽度限制而是由ASIC集成的SerDes数量和内部散热能力决定。功耗方面NPO因为走线缩短系统对DSP的依赖会降低。某些NPO方案采用了“无DSP”设计光模块内部只保留线性驱动整体功耗相比同速率可插拔模块能降低30%到50%。这个数字在万卡级的大规模集群里非常可观。密度收益更直接。传统可插拔方案下1U交换机要实现51.2T交换容量需要64个800G光模块和64个笼子面板根本放不下。NPO方案可以把64个光引擎分布在PCB上前后板各布置一部分面板只需要布光纤走线槽整机实现51.2T就有了工程可行性。2.3 NPO不是“焊死”它还是可以维护的做硬件设计的朋友最容易问的问题是NPO光引擎坏了整块主板都要报废吗答案是不一定。NPO在实际工程落地时通常不会把光引擎直接焊在主板铜箔上烤。更常见的做法是把光引擎做成一个模块插在主板上的连接器里或者固定在散热框架上通过光纤跳线与面板相连。更换时打开机箱把光引擎模块拆下来换个新的光纤接口做现场清洁后重新插上。也就是说NPO保留了“模块可替换”的属性只是把替换的物理位置从面板挪到了机箱内部。当然维护便利性确实比传统可插拔差一级。现场工程师需要开盖操作机房里的操作空间也未必宽敞。但相比CPONPO已经是很好的折中方案了。3. CPO光引擎与交换芯片“同住一个屋檐下”3.1 CPO是什么和NPO有什么本质区别CPOCo-Packaged Optics共封装光学是当前热度的顶点。名字里的Co-Packaged已经说明了一切光引擎和交换ASIC不再是两个分开封装的芯片而是在同一个封装基板上协同工作。NPO和CPO的本质区别在于“共封装”的尺度。NPO的光引擎仍然是一个独立的封装体只是离ASIC更近CPO则把光引擎裸die通常基于硅光技术和交换芯片裸die一起放到了同一个interposer基板上用2.5D封装工艺把两者连起来光引擎与交换芯片之间的电走线短到只有几毫米。CPO最有代表性的工艺路线是硅光共封装。硅光die上集成调制器、探测器、光波导等光学单元交换ASIC die负责电域交换两者通过interposer上的微凸点和RDL互连光纤则从封装基板侧面或上方引入与硅光die的模斑转换器耦合。整个过程看起来像“把一家光模块厂的生产线压缩进封装厂”。3.2 CPO真正解决了什么CPO解决的问题可以总结成一个不等式功耗更低、带宽更大、成本更高。功耗层面CPO把光引擎与交换芯片之间的电走线压缩到毫米级之后SerDes的驱动电压可以显著降低DSP可以完全取消。传统可插拔模块里那颗占功耗大头的DSP芯片在CPO方案中变成了“光引擎内部线性驱动”或者干脆并入ASIC的一部分整机光互连功耗能下降一大部分。带宽层面CPO的通道数不再受限于面板模块数目。一颗51.2T交换芯片理论上可以在封装内布置128个甚至256个并行光通道单通道速率跑到112G甚至224G总互连带宽轻松超过100T。这样的能力传统面板可插拔很难实现。成本层面是一个远期论据。硅光的裸die成本在晶圆级大批量生产时会有优势CPO省掉了金属外壳、金手指、独立结构件、标签贴纸等一大堆外围物料如果能攻克良率和测试成本长期单位带宽成本有希望低于可插拔方案。3.3 CPO的代价散热、良率、可维性CPO这三项代价必须在同一句话里讲清楚否则很容易被宣传资料带偏。散热是最伤脑筋的问题。交换ASIC本身就是一颗几百瓦的“大火炉”而硅光芯片对温度极其敏感激光器波长随温度漂移调制器效率随温度变化探测器暗电流随温度升高而增大。把光引擎和交换芯片封装在一起等于让一个怕热的人睡在锅炉旁边。工程上是靠分区域散热设计、微流道液冷、TEC热电制冷等手段来处理但散热设计难度比传统方案高了一个量级。良率是更现实的成本炸弹。可插拔光模块的良率损失只发生在模块厂一台交换机插上24个模块就算坏了2个现场拔下来换掉就行。CPO一旦封装完成光引擎和交换芯片的良率会在封装阶段“缠绕”在一起光引擎本身有良率、交换芯片有良率、封装工艺还有良率三者相乘最终好品率被拉低任何一个环节出问题都可能报废整个封装体。可维性则是用户侧最敏感的问题。CPO光引擎坏了怎么办在短中期内没有现场维修的可能性只能整块交换机板卡返厂。为了缓解这个矛盾不少CPO方案把激光器外置做成可插拔的ELSExternal Laser Source模块光引擎里只留调制器和探测器这样至少激光器坏了还能现场拔插更换。3.4 四张图看懂四种架构的差异我用一个表格把这几种架构的关键参数放在一起对比参数是行业典型值不同厂商会有差异对比维度传统可插拔XPO扩展可插拔NPO近封装CPO共封装光引擎位置交换机面板机箱内部、靠近ASIC同一块PCB、紧邻ASIC与ASIC共封装基板电走线长度20-40cm5-15cm3-5cm毫米级是否需要DSP通常需要可简化可省掉或简化无独立DSP维护性现场热插拔开箱可更换可模块化替换整板返修端口密度受面板限制中等提升大幅提升最高功耗收益基准中等较高最高技术成熟度成熟初露头角中试/小批量早期商用光学测试方式孤立可测模块级可测封装前可测封装后整测这张表也是我做方案选型时最喜欢拿出来对照的一张图。你会发现可拔插和CPO是两个极端而XPO和NPO分别在不同的维度上做一个折中XPO更强调“保留可拔插便利性”NPO更强调“搬迁光引擎位置”在实际产品里两者的边界有时候是模糊的。4. XPO夹在中间的“第三种形态”该怎么理解4.1 XPO不是一个标准定义而是一种压缩思路关于XPO我特别想先说明一点这个词远没有NPO和CPO那么标准化业界不同场合的用法也不完全一致。我在实际项目里见过几种解读最常见的一种把它理解为eXtended Pluggable Optics即“扩展的可插拔光学”核心特征是光引擎不再装进面板的可插拔模块外壳里而是做成模块化单元放在交换芯片附近但依然保留“可插拔”的接口形式和更换能力。你可以把XPO想象成传统可插拔模块的“极限压缩版”把模块外壳里的光引擎抽出来去掉不利于短走线的连接器再把光引擎组装成一个新的、更紧凑的可插拔单元放在ASIC旁边。这样既没有改变供应链的思维方式又把高速信号最怕的长走线问题解决掉了一大半。4.2 为什么业内会讨论XPO这条路讨论XPO的动机非常现实CPO太难了NPO也不容易但数据中心等不了。传统可插拔在800G已经感到吃力1.6T更是望而生畏CPO的测试和良率问题还需要时间不可能三年内大规模替换存量市场。XPO恰好卡在这个空档期它比传统可插拔更接近ASIC功耗和密度指标有所提升它又不像CPO那样必须改动整个封装供应链光引擎模块厂、连接器厂、测试仪表厂都能在现有生产线上做小改动。我见过的一些交换芯片厂商在参考设计里已经把“XPO接口”作为独立选项交换芯片上预留了与XPO模块对接的高速接口板级走线预留了到模块连接器的链路预算说明。这说明XPO至少已经进入了大厂的选型视野。4.3 什么时候该选XPO什么时候不该选如果让我给一个简单的判断原则当你的核心诉求是“快点把功耗降下来、把密度提上去”但又不希望承受CPO的良率和维护风险时XPO是当前时点最务实的中间路线。反过来如果你的产品生命周期规划到了五年以上想在功耗和带宽密度上做极致并且愿意投入资源解决测试和散热的工程问题那直接上CPO也完全可以只是得有足够的耐心。这里说一句捅破窗户纸的话对于绝大多数做光模块和交换机配套设备的小团队来说XPO是最容易上手的“准CPO”方案因为它不需要改变自己的测试习惯也不需要重新建设一套光学耦合产线沿用的还是可插拔那套设备和夹具只是尺寸和接口变了。5. 真正决定CPO生死的是测试设备这门“隐形生意”5.1 CPO为什么难测难在哪里CPO测试这个事是我觉得整个行业讨论最少、但被卡脖子最大的环节。做传统可插拔模块时测试是非常干净的把模块插到误码仪上光口接上光功率计和光谱仪跑完协议就在几秒钟内完成。模块坏了换一台模块继续测产线效率很高。CPO让这一切都变了。首先光引擎和交换芯片封在了一起测试节点从“模块级”提前到“封装级”在封装完成之前你都看不到最终光学性能。其次CPO没有标准化的前脸接口光口以光纤阵列或带状光纤的形式裸露在封装体上测试时需要自动对准光纤这绝不是人手能解决的问题。第三CPO的电接口和光接口的测试必须同时进行光口测试时要保证电信号链路的调制质量电口测试时要保证光口的光学耦合精度两者互相耦合传统测试仪表很难独立拆解。5.2 一台CPO测试设备到底在测什么围绕CPO测试设备核心其实只有四件事耦合、高速、热、良率。光学耦合是CPO测试的第一个拦路虎。CPO的光纤阵列与硅光芯片的模斑转换器之间需要亚微米级对准在很多工位上都用六轴纳米位移台通过实时监看耦合光功率来驱动平台自动寻优找到最佳耦合点后做胶固定。这个过程对设备的机械稳定性要求极高任何轻微热胀冷缩都会导致耦合偏移。高速信号测试是第二个核心。CPO的电口是交换芯片侧的高速SerDes可能是112G甚至224G需要探针台和高速测试线缆才能探到光口是并行光通道需要用高速误码仪和采样示波器测眼图、误码率。这里最大的痛苦是信号完整性探针一压上去原有链路的回损和串扰就变了测试结果很容易失真。热管理测试是第三个关键点。CPO器件在工作时结温变化大需要测试设备能控制TEC制冷器模拟不同温度工况下的链路表现。微环调制器方案的CPO尤其依赖热调谐温度一漂谐振点就偏了测试设备必须具备同步监测光功率漂移和自动补偿调谐的能力。良率数据统计是第四个需求。CPO的封装过程工序繁多每一个测试站点都需要把良率数据实时反馈给前道工序精准定位是哪一步导致的性能衰减。这些都需要测试设备具备数据采集、数据库回传和MES系统对接能力而不是简单的“测完打勾”。5.3 行业信号珈蓝特等设备商的CPO布局现在很多做测试设备的公司都在押注CPO。像珈蓝特这类长期做高精度光学耦合、测试与自动对准设备的厂商最近开始把CPO测试能力作为重点方向我认为这是一个非常重要的产业链信号。测试设备商进场意味着CPO已经从一个“实验室、手搭台架的工程样片”阶段走向了“必须良率可控、产线可复现”的产业化阶段。没有这些设备CPO永远只能在几个技术大厂的验证室里小批量制造有了自动化测试设备通用的CPO代工或封测产能才有机会建立起来。另外值得关注的趋势是“CPO测试线”越来越像半导体封装测试线。传统光模块测试线投产成本大概几百万元而CPO测试线的投入至少翻三倍需要洁净间、主动对准设备、高速误码仪阵列、热流机、可靠性验证设备等。对于想切入CPO供应链的中小团队来说测试设备的规划往往比产品设计更早遇到预算瓶颈。5.4 搭CPO测试线时我给出的四个实用建议第一分层测试策略一定要提前定。在晶圆阶段先做裸die光学测试筛掉已知不良的光引擎封装完成后做封装级测试再筛掉耦合和焊接问题最后放到系统板上做整机联调。每一层漏斗都要有明确的判据不然所有坏品都堆到最后一层成本完全不可控。第二主动对准设备不要省。这是CPO测试与光通信测试的分水岭传统可插拔可以做“被动定位”靠机械精度保证对准但CPO必须做“主动对准”靠光功率反馈进行六轴寻优。我见过一些团队为了省钱用手动调节架先做着结果一个端口耦合调试就要半小时量产根本跑不起来。第三高速测试链路要预留校准通道。224G信号一旦开始测试探头、探针、线缆、夹具的损耗都会影响读数建议在测试板上设计一个电学回环校准通道定期做S参数校准确保测试设备的自我一致性。第四数据系统从第一天就要设计。CPO的测试数据不是为了“判断通过”而存在的而是为了反向定位工艺问题。生产扁平的CSV文件不是好选择建议直接上SQL数据库把每个芯片唯一条码和各站点测试数据关联起来缺这一步后面做良率分析会想哭。6. 常见问题与排查技巧实录6.1 光功率低、耦合不良怎么排查CPO测试中遇到光功率偏低是常态但要分清是哪一类偏低。如果所有通道都低大概率是光源功率不足或模斑转换器整体耦合偏差如果只是个别通道低基本可以锁定是单通道耦合偏移或波导缺陷。排查顺序我习惯这样走先检查光纤端面是否脏污这是最简单也最容易被忽略的原因再看耦合平台的监控光功率是否正常对比实时功率与初始校准值的偏差最后拉出该通道的光谱曲线看中心波长和峰值功率是否漂移。如果峰值功率正常而平坦度差多半是耦合端面的模场失配不用急着拆机用多维调节架重新寻优即可。6.2 温度变化后通道失效怎么办CPO对温度敏感是全方位的。微环调制器方案的CPO尤其明显谐振波长随温度漂移的速度大约在0.06nm/°C上下只要温度变化几摄氏度波长就偏出信道格栅通道直接消失或者误码率飙升。如果复测时发现温度升高后通道劣化先看TEC是否正常工作再检查加热功率与设定值的偏差如果温度控制正常但光功率依然下降就要考虑硅光芯片与基板之间的热膨胀失配导致的耦合应力变化。排查时要记录温度曲线和光功率曲线的时间对齐关系判断是瞬态响应问题还是稳态漂移问题。6.3 高速误码率劣化怎么定位在CPO系统中跑高速误码测试一旦误码率不达标先别急着怀疑光口优先检查电链路。CPO的电走线虽然短但封装内的凸点和走线同样存在阻抗不连续的问题任何一根线的回流路径被破坏都可能造成眼图塌陷。比较有效的排查方式是做分层测试把交换芯片的高速链路配置成电回环模式先测电域误码率确认电链路干净后再切换到光回环模式测光路。如果电域通过、光域失败重点查光引擎的调制器偏置点和光功率预算如果两段都失败基本可以确定是封装层的问题需要返工封装工艺。6.4 四种架构选型时的“避坑”清单最后把这个话题整理成一份快速参考表是我在项目评审里反复用到的考察项传统可插拔XPONPOCPO现有测试设备投入可直接沿用基本沿用需要新增工装需要新建产线机房维护能力要求低中中高高对散热设计的依赖低中中高极高批量部署的良率风险低中中高高光模块供应链门槛低中中高极高这张表最重要的结论是不存在“绝对最好”的架构只存在“当下最适合”的架构。如果你的团队没有搞定CPO测试线的预算和人力准备那么哪怕CPO技术再性感也建议先走XPO或NPO过渡。我在实际做方案评估时最深的体会是CPO这类新架构带来的最根本变化不是画了几张漂亮的封装示意图而是把“光模块是系统外围设备”这个延续了二十多年的认知彻底打破了。光引擎第一次和交换芯片绑定得如此紧密以致于光学性能、热设计、工艺良率和测试方式必须从一开始就放在同一张桌子上讨论。如果你所在的公司正准备上马新一代数据中心网络方案我的建议是别只盯着交换芯片和光引擎先去确认测试设备这条线有没有跟上。测试设备选型晚一步后面整个产品节奏都会跟着等这一点在可插拔时代几乎没人会担心在CPO时代却是第一个需要被解决的问题。