产棱拆解|从CPO到Optical I/O:为什么下一堵墙可能直接进入GPU/CPU封装内部?
理解 CPO、NPO、Optical I/O,最简单的方法不是记住三个英文缩写,而是观察一个东西:
光电转换的位置,到底离计算芯片有多远?
传统架构:
GPU / CPU
↓
PCB上的高速电连接
↓
Switch ASIC
↓
PCB高速电连接
↓
可插拔光模块
↓
光纤
CPO:
GPU / CPU
↓
PCB
↓
Switch ASIC + Optical Engine
↓
光纤
NPO:
GPU / CPU
↓
更短电连接
↓
Switch ASIC
↓
紧邻的 Optical Engine
↓
光纤
Optical I/O:
GPU / CPU
↓
光I/O
↓
光纤
也就是说:
CPO是在解决“Switch到光模块”的电距离问题;Optical I/O进一步开始解决“计算芯片到Switch”的电距离问题。
这就是这条技术路线真正的演进逻辑。
二、为什么还要继续往前走?前面我们已经知道:
随着交换芯片从几十Tbps向更高带宽发展,SerDes单lane速率不断提高。
高速电信号经过:
- 芯片封装
- 封装基板
- PCB
- 连接器
- 插座
- 光模块
每经过一段距离,就会产生:
- 插入损耗
- 反射
- 串扰
- 抖动
- 信号完整性下降
- 功耗增加
所以产业已经做了一件事情:
把光模块从远处搬到了Switch ASIC旁边。
这就是CPO。
但问题是:
GPU也在越来越快。
GPU和Switch之间的数据交换量同样快速增加。
于是新的问题出现:
如果Switch已经用光了,但GPU到Switch之间的高速电连接仍然很长,怎么办?
答案就是:
继续把光往计算芯片方向移动。三、真正需要理解的是“电距离”
很多人研究Optical I/O时,会说:
“未来光通信进入GPU封装。”
这个说法虽然正确,但还不够。
真正的物理原因是:
高速电信号能够无损传播的距离正在缩短。
假设一颗GPU需要向交换网络发送数据。
传统:
GPU
↓
Package
↓
Substrate
↓
PCB
↓
Connector
↓
Switch
整个过程中,高速电信号跑了很长距离。
如果未来单lane速率继续提高,那么:
距离 × 速率
会越来越难控制。
所以产业真正想做的是:
让GPU产生的电信号尽可能早地转换成光。
于是:
GPU
↓
Optical I/O
↓
Fiber
这就完全改变了网络架构。
四、从CPO到NPO:第一步是“不要离ASIC太远”先看CPO。
CPO:
Co-Packaged Optics
共封装光学
核心思想:
Switch ASIC和Optical Engine放在同一个封装体系里。
这样可以最大限度缩短:
ASIC → 光引擎
之间的高速电连接。
但是CPO也存在一个现实问题。
Switch ASIC非常热。
Optical Engine里面又有:
- PIC
- Laser
- Driver
- TIA
- PD
如果全部塞到同一个封装里:
热问题
就变得非常严重。
同时:
光学器件的可维护性也会下降。
于是产业开始探索另外一种方案。
五、NPO:不一定非要“共封装”NPO:
Near-Packaged Optics
近封装光学
核心思想可以理解成:
光引擎非常靠近Switch ASIC,但不一定和ASIC完全封装在一起。
所以:
CPO:
ASIC + Optical Engine
高度共封装。
NPO:
ASIC
↓
非常短的高速连接
↓
Optical Engine
两者非常近,但物理上可以保持一定独立性。
六、为什么NPO有意义?因为它试图解决一个非常现实的矛盾:
电距离越短越好
但是:
光器件离热源越远越好。
CPO把两者强行放在一起。
NPO则寻找一个折中:
足够近,解决高速电问题;但不要近到完全失去热和维护优势。
因此NPO实际上是:
电性能
和
热/维护性能
之间的平衡架构。
七、但NPO仍然有一个根本问题NPO解决了:
Switch ASIC → Optical Engine
的距离。
可是GPU呢?
GPU:
↓ PCB
↓ Connector
↓ Switch
这个距离依然存在。
所以:
NPO只是把光继续靠近Switch,但没有彻底解决计算芯片的高速电I/O问题。
于是下一步就出现:
Optical I/O 八、Optical I/O到底是什么?Optical I/O:
Optical Input / Output
光输入/输出
最简单的理解:
让计算芯片本身直接具备高速光输入输出能力。
过去:
GPU:
电信号输出
现在:
GPU:
电 → 光
直接进入光网络。
接收时:
光 → 电
直接进入GPU附近的高速I/O。
于是:
GPU
↓
Optical I/O
↓
Fiber
而不是:
GPU
↓
很长的高速电连接
↓
Switch / Retimer
↓
Optical Module
↓
Fiber
九、这其实是一次非常大的架构变化传统系统的逻辑是:
计算芯片负责计算,网络芯片负责通信,光模块负责光通信。
Optical I/O时代:
计算芯片的I/O本身开始直接进入光域。
于是:
Compute
和
Optical Communication
开始融合。
这就是为什么Optical I/O的重要性可能远远超过传统光模块升级。
十、为什么GPU越来越需要Optical I/O?答案来自AI。
AI训练并不是:
一颗GPU独立完成所有计算。
真正的大型AI训练系统需要:
- GPU ↔ GPU
- GPU ↔ CPU
- GPU ↔ HBM
- GPU ↔ Network
- GPU ↔ Storage
大量数据交换。
尤其是:
GPU ↔ GPU
和:
GPU ↔ GPU集群
的数据量越来越大。
所以AI计算的瓶颈已经不再只是:
GPU算得快不快。
而开始变成:
GPU之间的数据搬运能不能跟上。十一、这就是所谓“Memory Wall”和“Communication Wall”
AI系统现在实际上同时面对几个墙。
第一堵墙:Compute Wall
计算能力越来越高。
第二堵墙:Memory Wall
计算芯片需要越来越多的数据。
HBM成为关键。
第三堵墙:Communication Wall
GPU之间需要交换越来越多的数据。
网络成为瓶颈。
第四堵墙:I/O Wall
最终:
数据必须进入和离开计算芯片。
如果I/O还是传统高速电连接:
就会成为新的限制。
所以:
Optical I/O本质上是在解决AI计算系统的I/O Wall。十二、一个非常直观的例子
假设未来一颗GPU需要向外部网络提供极高带宽。
传统方式:
这里有大量:
高速电连接。
而Optical I/O希望变成:
高速电路径被极大压缩。
这就是它最核心的价值。
十三、所以Optical I/O并不是“更快的光模块”这是非常重要的区别。
传统光模块:
GPU/ASIC产生电信号 → 光模块把它转换成光。
Optical I/O:
光电转换本身成为计算芯片I/O架构的一部分。
所以:
传统光模块是外围器件。
而:
Optical I/O开始成为芯片系统架构的一部分。
这是完全不同的产业逻辑。
十四、那么Optical I/O里面到底有什么?现在把它拆开。
一套Optical I/O大致可以理解为:
Compute Die
↓
Electrical I/O
↓
Driver
↓
Modulator
↓
PIC
↓
Laser
↓
Fiber
接收:
Fiber
↓
PIC
↓
Photodetector
↓
TIA
↓
Electrical I/O
↓
Compute Die
所以你前面研究CPO时看到的那些东西:
- PIC
- Laser
- Modulator
- Driver
- PD
- TIA
不会消失。
恰恰相反:
它们开始更加靠近计算芯片。十五、于是先进封装的重要性突然暴增
如果把Optical I/O放到GPU附近,那么:
光学
和
先进封装
就彻底结合了。
以前:
先进封装主要解决:
芯片之间如何高速连接。
现在还需要解决:
芯片和光之间如何连接。
于是会出现:
GPU Die
HBM
I/O Die
Optical Engine / PIC
Substrate
共同构成一个高度集成系统。
十六、这就是“光进入封装”现在我们可以理解一句非常重要的话:
Optical I/O的本质不是“把光模块做小”,而是把光互连从系统级问题变成芯片封装级问题。
这是整个产业链价值重构的关键。
过去:
光模块厂商
负责光电转换。
未来:
GPU/CPU设计
开始考虑:
光I/O应该如何成为芯片架构的一部分?
于是:
EDA
Chiplet
Advanced Packaging
Silicon Photonics
Laser
Fiber
全部开始发生联系。
十七、Chiplet为什么会变得重要?Chiplet:
小芯片 / 芯粒
未来一颗大型计算系统可能不再是一颗巨大的单芯片。
而是:
Compute Die
+
HBM
+
I/O Die
+
Network Die
+
Optical I/O
共同组成一个系统。
这时候:
I/O功能可以从Compute Die中分离出来。
于是可以设计:
Compute Chiplet
和:
Optical I/O Chiplet
甚至:
Optical I/O Die
这就是光电共封装进一步发展的可能方向。
十八、这时PIC的位置发生了巨大变化传统光通信:
PIC在:
Optical Module
里面。
CPO:
PIC在:
Switch附近的Optical Engine
里面。
Optical I/O:
PIC进一步进入:
Compute Package
附近。
所以可以画成:
你会发现:
光电转换的位置正在不断向计算核心移动。十九、但这并不意味着CPO会马上消失
这里必须非常谨慎。
CPO、NPO、Optical I/O并不是简单的:
旧技术 → 新技术 → 旧技术淘汰。
现实更可能是:
不同距离、不同带宽、不同成本场景使用不同架构。
例如:
短距离
可能适合:
Optical I/O
机架级 / 系统级
可能适合:
CPO / NPO
更长距离
仍可能使用:
传统可插拔光模块。
因此真正的产业趋势应该理解成:
光电转换的位置越来越多元,而不是一种架构彻底消灭另一种架构。二十、Optical I/O最大的挑战不是“能不能做出来”
技术上做出Optical I/O并不是最终问题。
真正的问题是:
能不能大规模制造,并且达到半导体级的可靠性和成本。
因为一旦光学进入GPU封装:
以前坏一个光模块:
拔下来换。
以后如果光学功能直接进入封装:
坏了怎么办?
这会直接改变系统维护方式。
所以Optical I/O必须解决:
- 良率
- 热
- 光耦合
- 激光寿命
- 封装可靠性
- 可维护性
- 测试
- 成本
这些问题。
二十一、其中最大的工程难题之一:Laser前面CPO我们已经发现:
Laser怕热。
到了Optical I/O:
GPU
本身就是极大的热源。
所以:
Laser
离GPU越近:
热问题越严重。
于是会出现几种思路:
方案一
Laser与PIC一起集成。
优点:
结构紧凑。
缺点:
热问题严重。
方案二
Laser外置。
也就是:
External Laser Source
优点:
降低热耦合。
缺点:
增加光连接复杂度。
方案三
Remote Laser
把光源放在相对更适合的位置,再把光送入封装。
这可能成为长期架构探索方向。
二十二、第二个大问题:光纤怎么进入封装?传统:
光模块
有足够空间做光纤连接。
Optical I/O:
芯片封装空间极其有限。
因此必须解决:
Fiber-to-Package Coupling
即:
光纤如何可靠地进入芯片封装?
这涉及:
- Fiber Array
- Coupler
- Alignment
- Packaging
- Thermal Expansion
尤其是:
热膨胀。
芯片热了以后:
不同材料膨胀程度不同。
光学耦合位置发生微小变化。
就可能造成:
Coupling Loss
增加。
因此Optical I/O实际上是:
半导体封装 + 光学封装的融合问题。二十三、第三个问题:功耗
这是Optical I/O真正有吸引力的原因之一。
假设传统高速电连接需要大量:
- Retimer
- DSP
- SerDes
- Driver
随着距离增加:
功耗不断增加。
如果能够提前把数据转换成光:
电距离缩短
↓
高速电通道减少
↓
信号恢复电路减少
↓
每bit能耗下降
因此Optical I/O真正想追求的指标之一是:
Energy per bit(每比特能耗)
而不是简单的:
“光速更快。”二十四、未来真正值得看的指标:pJ/bit
研究光互连的时候,一个非常重要的指标是:
pJ/bit
即:
每传输1 bit数据需要消耗多少皮焦耳。
为什么重要?
因为AI集群规模越来越大。
如果:
1 bit
节省一点能量,看起来没什么。
但是:
1 Exabit级别的数据交换
乘起来就是巨大的功耗。
所以未来AI Factory的网络竞争,很可能越来越关注:
每Tbps需要多少瓦。
这会成为CPO和Optical I/O的重要价值基础。
二十五、这时候你会发现:CPO真正解决的不是“速度”它真正解决的是:
速度、距离、功耗三者之间的矛盾。
高速电连接:
速度↑
↓
距离能力↓
↓
功耗↑
↓
信号完整性↓
光互连的价值:
高速
长距离
低每bit能耗
所以产业才不断推动:
Pluggable
↓
LPO
↓
CPO
↓
NPO
↓
Optical I/O
但每向前一步,封装难度也同步提高。
二十六、因此产业实际上是在做一场“空间迁移”可以把整个技术路线总结成:
第一阶段:光模块在系统外部
第二阶段:光模块靠近ASIC
第三阶段:光学进入封装附近
第四阶段:光学进入计算封装
因此:
产业发展的核心不是“CPO越来越先进”,而是“高速电信号能够存在的距离越来越短”。二十七、这就是下一堵墙
到这里可以得到一个非常重要的产业判断框架。
第一堵墙:
铜互连距离
↓
CPO
第二堵墙:
ASIC与光引擎之间的热/封装问题
↓
NPO / 新型光封装
第三堵墙:
GPU/CPU到网络之间的高速电I/O
↓
Optical I/O
第四堵墙:
封装内部的光电集成
↓
更深层的:
Photonic Chiplet / Optical Compute Interconnect
这意味着未来真正的竞争可能不再是:
“谁家的光模块卖得多?”
而是:
谁能够把光、电、计算、封装真正融合起来。二十八、从产业链角度,价值开始向上游移动
传统光通信价值链:
光模块
是非常核心的系统部件。
CPO之后:
PIC
Laser
Driver
TIA
先进封装
价值增加。
Optical I/O之后:
进一步增加:
Chiplet
I/O Die
先进封装
EDA
硅光工艺
甚至:
GPU/CPU架构设计
的重要性。
因此:
光通信正在逐渐从“外围器件”进入“计算基础设施核心”。二十九、这对AI Factory意味着什么?
未来AI Factory可能逐渐形成:
GPU
↓
HBM
↓
GPU内部I/O
↓
Optical I/O
↓
CPO / NPO
↓
Optical Network
↓
其他GPU
整个系统中:
Compute
和
Network
的边界越来越模糊。
以前:
计算芯片是计算芯片,网络是网络。
未来:
计算芯片本身就可能拥有光I/O。
这是非常大的架构变化。
三十、但最终不要陷入“光一定取代电”的误区真正可能发生的是:
电和光各自负责最适合自己的距离。
芯片内部:
电
仍然非常重要。
短距离:
电
仍然可能具有成本优势。
中距离:
高速电
逐渐困难。
更长距离:
光
优势越来越明显。
所以未来可能是:
真正的趋势是:
光逐渐向计算核心渗透,但不会简单地消灭电。三十一、产棱视角:这里真正应该建立的是“瓶颈迁移图”
把前面几篇CPO拆解全部连起来:
这张图才是整个产业最重要的东西。
因为它告诉我们:
产业机会永远不是固定在某个产品上,而是在“下一堵墙”出现的位置。三十二、最终结论
CPO真正重要的意义,并不是:
“光模块从可插拔变成共封装。”
而是:
它证明了一个趋势:当高速电互连开始成为AI算力系统的瓶颈时,光电转换会不断向计算核心移动。
所以技术路线可以概括为:
Pluggable Optics
→ 光模块靠近系统
↓
CPO
→ 光模块靠近Switch ASIC
↓
NPO
→ 光引擎进一步优化与ASIC的空间关系
↓
Optical I/O
→ 光I/O进入计算芯片封装体系
↓
Photonic Chiplet
→ 光学逐渐成为Chiplet级基础设施
最终可能形成:
Compute + Memory + Electrical I/O + Optical I/O
共同组成下一代AI计算节点。
而对于产业研究而言,真正值得持续追踪的不是“CPO概念是否火”,而是下面这条链:
GPU算力增长
→ 通信需求
→ SerDes速率
→ 电通道损耗
→ 光转换位置
→ PIC
→ Laser
→ 光耦合
→ 先进封装
→ 散热
→ Optical I/O
→ 每bit能耗
这条链一旦建立起来,你看到任何一家企业,都可以把它放回物理系统中判断:
它究竟是在解决哪一堵墙?