产棱 · IndPrism China 算力全产业链传导分析

产棱拆解|从CPO到Optical I/O:为什么下一堵墙可能直接进入GPU/CPU封装内部?

产棱 技术拆解 高速互联
一、核心结论:CPO不是终点,而是“光电转换不断前移”的中间阶段

理解 CPO、NPO、Optical I/O,最简单的方法不是记住三个英文缩写,而是观察一个东西:

光电转换的位置,到底离计算芯片有多远?

传统架构:

GPU / CPU

↓

PCB上的高速电连接

↓

Switch ASIC

↓

PCB高速电连接

↓

可插拔光模块

↓

光纤

CPO:

GPU / CPU

↓

PCB

↓

Switch ASIC + Optical Engine

↓

光纤

NPO:

GPU / CPU

↓

更短电连接

↓

Switch ASIC

↓

紧邻的 Optical Engine

↓

光纤

Optical I/O:

GPU / CPU

↓

光I/O

↓

光纤

也就是说:

CPO是在解决“Switch到光模块”的电距离问题;Optical I/O进一步开始解决“计算芯片到Switch”的电距离问题。

这就是这条技术路线真正的演进逻辑。

二、为什么还要继续往前走?

前面我们已经知道:

随着交换芯片从几十Tbps向更高带宽发展,SerDes单lane速率不断提高。

高速电信号经过:

  1. 芯片封装
  2. 封装基板
  3. PCB
  4. 连接器
  5. 插座
  6. 光模块

每经过一段距离,就会产生:

  1. 插入损耗
  2. 反射
  3. 串扰
  4. 抖动
  5. 信号完整性下降
  6. 功耗增加

所以产业已经做了一件事情:

把光模块从远处搬到了Switch ASIC旁边。

这就是CPO。

但问题是:

GPU也在越来越快。

GPU和Switch之间的数据交换量同样快速增加。

于是新的问题出现:

如果Switch已经用光了,但GPU到Switch之间的高速电连接仍然很长,怎么办?

答案就是:

继续把光往计算芯片方向移动。
三、真正需要理解的是“电距离”

很多人研究Optical I/O时,会说:

“未来光通信进入GPU封装。”

这个说法虽然正确,但还不够。

真正的物理原因是:

高速电信号能够无损传播的距离正在缩短。

假设一颗GPU需要向交换网络发送数据。

传统:

GPU

↓

Package

↓

Substrate

↓

PCB

↓

Connector

↓

Switch

整个过程中,高速电信号跑了很长距离。

如果未来单lane速率继续提高,那么:

距离 × 速率

会越来越难控制。

所以产业真正想做的是:

让GPU产生的电信号尽可能早地转换成光。

于是:

GPU

↓

Optical I/O

↓

Fiber

这就完全改变了网络架构。

四、从CPO到NPO:第一步是“不要离ASIC太远”

先看CPO。

CPO:

Co-Packaged Optics

共封装光学

核心思想:

Switch ASIC和Optical Engine放在同一个封装体系里。

这样可以最大限度缩短:

ASIC → 光引擎

之间的高速电连接。

但是CPO也存在一个现实问题。

Switch ASIC非常热。

Optical Engine里面又有:

  1. PIC
  2. Laser
  3. Driver
  4. TIA
  5. PD

如果全部塞到同一个封装里:

热问题

就变得非常严重。

同时:

光学器件的可维护性也会下降。

于是产业开始探索另外一种方案。

五、NPO:不一定非要“共封装”

NPO:

Near-Packaged Optics

近封装光学

核心思想可以理解成:

光引擎非常靠近Switch ASIC,但不一定和ASIC完全封装在一起。

所以:

CPO:

ASIC + Optical Engine

高度共封装。

NPO:

ASIC

↓

非常短的高速连接

↓

Optical Engine

两者非常近,但物理上可以保持一定独立性。

六、为什么NPO有意义?

因为它试图解决一个非常现实的矛盾:

电距离越短越好

但是:

光器件离热源越远越好。

CPO把两者强行放在一起。

NPO则寻找一个折中:

足够近,解决高速电问题;但不要近到完全失去热和维护优势。

因此NPO实际上是:

电性能

和

热/维护性能

之间的平衡架构。

七、但NPO仍然有一个根本问题

NPO解决了:

Switch ASIC → Optical Engine

的距离。

可是GPU呢?

GPU:

↓ PCB

↓ Connector

↓ Switch

这个距离依然存在。

所以:

NPO只是把光继续靠近Switch,但没有彻底解决计算芯片的高速电I/O问题。

于是下一步就出现:

Optical I/O 八、Optical I/O到底是什么?

Optical I/O:

Optical Input / Output

光输入/输出

最简单的理解:

让计算芯片本身直接具备高速光输入输出能力。

过去:

GPU:

电信号输出

现在:

GPU:

电 → 光

直接进入光网络。

接收时:

光 → 电

直接进入GPU附近的高速I/O。

于是:

GPU

↓

Optical I/O

↓

Fiber

而不是:

GPU

↓

很长的高速电连接

↓

Switch / Retimer

↓

Optical Module

↓

Fiber

九、这其实是一次非常大的架构变化

传统系统的逻辑是:

计算芯片负责计算,网络芯片负责通信,光模块负责光通信。

Optical I/O时代:

计算芯片的I/O本身开始直接进入光域。

于是:

Compute

和

Optical Communication

开始融合。

这就是为什么Optical I/O的重要性可能远远超过传统光模块升级。

十、为什么GPU越来越需要Optical I/O?

答案来自AI。

AI训练并不是:

一颗GPU独立完成所有计算。

真正的大型AI训练系统需要:

  1. GPU ↔ GPU
  2. GPU ↔ CPU
  3. GPU ↔ HBM
  4. GPU ↔ Network
  5. GPU ↔ Storage

大量数据交换。

尤其是:

GPU ↔ GPU

和:

GPU ↔ GPU集群

的数据量越来越大。

所以AI计算的瓶颈已经不再只是:

GPU算得快不快。

而开始变成:

GPU之间的数据搬运能不能跟上。
十一、这就是所谓“Memory Wall”和“Communication Wall”

AI系统现在实际上同时面对几个墙。

第一堵墙:Compute Wall

计算能力越来越高。

第二堵墙:Memory Wall

计算芯片需要越来越多的数据。

HBM成为关键。

第三堵墙:Communication Wall

GPU之间需要交换越来越多的数据。

网络成为瓶颈。

第四堵墙:I/O Wall

最终:

数据必须进入和离开计算芯片。

如果I/O还是传统高速电连接:

就会成为新的限制。

所以:

Optical I/O本质上是在解决AI计算系统的I/O Wall。
十二、一个非常直观的例子

假设未来一颗GPU需要向外部网络提供极高带宽。

传统方式:

GPU
↓
封装
↓
ABF Substrate
↓
PCB
↓
Connector
↓
Retimer
↓
Switch
↓
Optical Module
↓
Fiber

这里有大量:

高速电连接。

而Optical I/O希望变成:

GPU
↓
Optical I/O
↓
Fiber
↓
Network

高速电路径被极大压缩。

这就是它最核心的价值。

十三、所以Optical I/O并不是“更快的光模块”

这是非常重要的区别。

传统光模块:

GPU/ASIC产生电信号 → 光模块把它转换成光。

Optical I/O:

光电转换本身成为计算芯片I/O架构的一部分。

所以:

传统光模块是外围器件。

而:

Optical I/O开始成为芯片系统架构的一部分。

这是完全不同的产业逻辑。

十四、那么Optical I/O里面到底有什么?

现在把它拆开。

一套Optical I/O大致可以理解为:

Compute Die

↓

Electrical I/O

↓

Driver

↓

Modulator

↓

PIC

↓

Laser

↓

Fiber

接收:

Fiber

↓

PIC

↓

Photodetector

↓

TIA

↓

Electrical I/O

↓

Compute Die

所以你前面研究CPO时看到的那些东西:

  1. PIC
  2. Laser
  3. Modulator
  4. Driver
  5. PD
  6. TIA

不会消失。

恰恰相反:

它们开始更加靠近计算芯片。
十五、于是先进封装的重要性突然暴增

如果把Optical I/O放到GPU附近,那么:

光学

和

先进封装

就彻底结合了。

以前:

先进封装主要解决:

芯片之间如何高速连接。

现在还需要解决:

芯片和光之间如何连接。

于是会出现:

GPU Die


HBM


I/O Die


Optical Engine / PIC


Substrate

共同构成一个高度集成系统。

十六、这就是“光进入封装”

现在我们可以理解一句非常重要的话:

Optical I/O的本质不是“把光模块做小”,而是把光互连从系统级问题变成芯片封装级问题。

这是整个产业链价值重构的关键。

过去:

光模块厂商

负责光电转换。

未来:

GPU/CPU设计

开始考虑:

光I/O应该如何成为芯片架构的一部分?

于是:

EDA

Chiplet

Advanced Packaging

Silicon Photonics

Laser

Fiber

全部开始发生联系。

十七、Chiplet为什么会变得重要?

Chiplet:

小芯片 / 芯粒

未来一颗大型计算系统可能不再是一颗巨大的单芯片。

而是:

Compute Die

+

HBM

+

I/O Die

+

Network Die

+

Optical I/O

共同组成一个系统。

这时候:

I/O功能可以从Compute Die中分离出来。

于是可以设计:

Compute Chiplet

和:

Optical I/O Chiplet

甚至:

Optical I/O Die

这就是光电共封装进一步发展的可能方向。

十八、这时PIC的位置发生了巨大变化

传统光通信:

PIC在:

Optical Module

里面。

CPO:

PIC在:

Switch附近的Optical Engine

里面。

Optical I/O:

PIC进一步进入:

Compute Package

附近。

所以可以画成:

传统光模块
Fiber
↓
Optical Module
↓
PCB
↓
Switch ASIC

↓

CPO
Fiber
↓
Optical Engine
↓
Switch ASIC

↓

NPO
Fiber
↓
Optical Engine
↓
Switch ASIC
↓
更短距离

↓

Optical I/O
Fiber
↓
Optical I/O
↓
Compute Package
↓
GPU / CPU

你会发现:

光电转换的位置正在不断向计算核心移动。
十九、但这并不意味着CPO会马上消失

这里必须非常谨慎。

CPO、NPO、Optical I/O并不是简单的:

旧技术 → 新技术 → 旧技术淘汰。

现实更可能是:

不同距离、不同带宽、不同成本场景使用不同架构。

例如:

短距离

可能适合:

Optical I/O

机架级 / 系统级

可能适合:

CPO / NPO

更长距离

仍可能使用:

传统可插拔光模块。

因此真正的产业趋势应该理解成:

光电转换的位置越来越多元,而不是一种架构彻底消灭另一种架构。
二十、Optical I/O最大的挑战不是“能不能做出来”

技术上做出Optical I/O并不是最终问题。

真正的问题是:

能不能大规模制造,并且达到半导体级的可靠性和成本。

因为一旦光学进入GPU封装:

以前坏一个光模块:

拔下来换。

以后如果光学功能直接进入封装:

坏了怎么办?

这会直接改变系统维护方式。

所以Optical I/O必须解决:

  1. 良率
  2. 热
  3. 光耦合
  4. 激光寿命
  5. 封装可靠性
  6. 可维护性
  7. 测试
  8. 成本

这些问题。

二十一、其中最大的工程难题之一:Laser

前面CPO我们已经发现:

Laser怕热。

到了Optical I/O:

GPU

本身就是极大的热源。

所以:

Laser

离GPU越近:

热问题越严重。

于是会出现几种思路:

方案一

Laser与PIC一起集成。

优点:

结构紧凑。

缺点:

热问题严重。

方案二

Laser外置。

也就是:

External Laser Source

优点:

降低热耦合。

缺点:

增加光连接复杂度。

方案三

Remote Laser

把光源放在相对更适合的位置,再把光送入封装。

这可能成为长期架构探索方向。

二十二、第二个大问题:光纤怎么进入封装?

传统:

光模块

有足够空间做光纤连接。

Optical I/O:

芯片封装空间极其有限。

因此必须解决:

Fiber-to-Package Coupling

即:

光纤如何可靠地进入芯片封装?

这涉及:

  1. Fiber Array
  2. Coupler
  3. Alignment
  4. Packaging
  5. Thermal Expansion

尤其是:

热膨胀。

芯片热了以后:

不同材料膨胀程度不同。

光学耦合位置发生微小变化。

就可能造成:

Coupling Loss

增加。

因此Optical I/O实际上是:

半导体封装 + 光学封装的融合问题。
二十三、第三个问题:功耗

这是Optical I/O真正有吸引力的原因之一。

假设传统高速电连接需要大量:

  1. Retimer
  2. DSP
  3. SerDes
  4. Driver

随着距离增加:

功耗不断增加。

如果能够提前把数据转换成光:

电距离缩短

↓

高速电通道减少

↓

信号恢复电路减少

↓

每bit能耗下降

因此Optical I/O真正想追求的指标之一是:

Energy per bit(每比特能耗)

而不是简单的:

“光速更快。”
二十四、未来真正值得看的指标:pJ/bit

研究光互连的时候,一个非常重要的指标是:

pJ/bit

即:

每传输1 bit数据需要消耗多少皮焦耳。

为什么重要?

因为AI集群规模越来越大。

如果:

1 bit

节省一点能量,看起来没什么。

但是:

1 Exabit级别的数据交换

乘起来就是巨大的功耗。

所以未来AI Factory的网络竞争,很可能越来越关注:

每Tbps需要多少瓦。

这会成为CPO和Optical I/O的重要价值基础。

二十五、这时候你会发现:CPO真正解决的不是“速度”

它真正解决的是:

速度、距离、功耗三者之间的矛盾。

高速电连接:

速度↑

↓

距离能力↓

↓

功耗↑

↓

信号完整性↓

光互连的价值:

高速


长距离


低每bit能耗

所以产业才不断推动:

Pluggable

↓

LPO

↓

CPO

↓

NPO

↓

Optical I/O

但每向前一步,封装难度也同步提高。

二十六、因此产业实际上是在做一场“空间迁移”

可以把整个技术路线总结成:

第一阶段:光模块在系统外部

ASIC ───── PCB ───── Optical Module ───── Fiber

第二阶段:光模块靠近ASIC

ASIC ─ Optical Engine ─ Fiber

第三阶段:光学进入封装附近

ASIC
│
Optical Engine
│
Fiber

第四阶段:光学进入计算封装

GPU / CPU
│
Optical I/O
│
Fiber

因此:

产业发展的核心不是“CPO越来越先进”,而是“高速电信号能够存在的距离越来越短”。
二十七、这就是下一堵墙

到这里可以得到一个非常重要的产业判断框架。

第一堵墙:

铜互连距离

↓

CPO

第二堵墙:

ASIC与光引擎之间的热/封装问题

↓

NPO / 新型光封装

第三堵墙:

GPU/CPU到网络之间的高速电I/O

↓

Optical I/O

第四堵墙:

封装内部的光电集成

↓

更深层的:

Photonic Chiplet / Optical Compute Interconnect

这意味着未来真正的竞争可能不再是:

“谁家的光模块卖得多?”

而是:

谁能够把光、电、计算、封装真正融合起来。
二十八、从产业链角度,价值开始向上游移动

传统光通信价值链:

光模块

是非常核心的系统部件。

CPO之后:

PIC

Laser

Driver

TIA

先进封装

价值增加。

Optical I/O之后:

进一步增加:

Chiplet

I/O Die

先进封装

EDA

硅光工艺

甚至:

GPU/CPU架构设计

的重要性。

因此:

光通信正在逐渐从“外围器件”进入“计算基础设施核心”。
二十九、这对AI Factory意味着什么?

未来AI Factory可能逐渐形成:

GPU

↓

HBM

↓

GPU内部I/O

↓

Optical I/O

↓

CPO / NPO

↓

Optical Network

↓

其他GPU

整个系统中:

Compute

和

Network

的边界越来越模糊。

以前:

计算芯片是计算芯片,网络是网络。

未来:

计算芯片本身就可能拥有光I/O。

这是非常大的架构变化。

三十、但最终不要陷入“光一定取代电”的误区

真正可能发生的是:

电和光各自负责最适合自己的距离。

芯片内部:

电

仍然非常重要。

短距离:

电

仍然可能具有成本优势。

中距离:

高速电

逐渐困难。

更长距离:

光

优势越来越明显。

所以未来可能是:

芯片内部
↓
Electrical

封装边缘
↓
Electrical / Optical

封装之间
↓
Optical

机架之间
↓
Optical

数据中心之间
↓
Optical

真正的趋势是:

光逐渐向计算核心渗透,但不会简单地消灭电。
三十一、产棱视角:这里真正应该建立的是“瓶颈迁移图”

把前面几篇CPO拆解全部连起来:

AI算力增长
↓
GPU数量增长
↓
GPU之间通信量增长
↓
Switch带宽增长
↓
SerDes速率增长
↓
高速电距离成为瓶颈
↓
CPO
↓
光靠近Switch ASIC
↓
热 / 耦合 / 封装成为新瓶颈
↓
NPO / 新型封装
↓
GPU到Switch之间高速电I/O继续成为瓶颈
↓
Optical I/O
↓
光进入Compute Package
↓
光电共封装
↓
Photonic Chiplet

这张图才是整个产业最重要的东西。

因为它告诉我们:

产业机会永远不是固定在某个产品上,而是在“下一堵墙”出现的位置。
三十二、最终结论

CPO真正重要的意义,并不是:

“光模块从可插拔变成共封装。”

而是:

它证明了一个趋势:当高速电互连开始成为AI算力系统的瓶颈时,光电转换会不断向计算核心移动。

所以技术路线可以概括为:

Pluggable Optics

→ 光模块靠近系统

↓

CPO

→ 光模块靠近Switch ASIC

↓

NPO

→ 光引擎进一步优化与ASIC的空间关系

↓

Optical I/O

→ 光I/O进入计算芯片封装体系

↓

Photonic Chiplet

→ 光学逐渐成为Chiplet级基础设施

最终可能形成:

Compute + Memory + Electrical I/O + Optical I/O

共同组成下一代AI计算节点。

而对于产业研究而言,真正值得持续追踪的不是“CPO概念是否火”,而是下面这条链:

GPU算力增长

→ 通信需求

→ SerDes速率

→ 电通道损耗

→ 光转换位置

→ PIC

→ Laser

→ 光耦合

→ 先进封装

→ 散热

→ Optical I/O

→ 每bit能耗

这条链一旦建立起来,你看到任何一家企业,都可以把它放回物理系统中判断:

它究竟是在解决哪一堵墙?