产棱 · IndPrism China 算力全产业链传导分析

产棱拆解 | 如何理解CPO到底在干什么?

产棱 技术拆解 高速互联
本文 3 节
  1. 电世界
  2. 光世界
  3. 最后,把CPO压缩成一句你以后看产业时可以直接用的话

CPO最容易犯的错误就是把一堆名词串起来:

ASIC、SerDes、Driver、PIC、Laser、Optical Engine、ABF、PCB……

看起来完整,但脑子里没有“东西到底怎么走”。

其实你只需要先抓住一个东西:

CPO到底在干什么?

假设:

GPU A 要把一大堆数据发送给 GPU B。

数据本来是“电信号”。

但是:

电在很短距离内很好用,跑很远、跑得很快就越来越困难;光则非常适合长距离高速传输。

所以整个CPO其实就在不断完成:

电 → 光 → 电 一、先完全不要管那些英文

我们只看一条数据怎么走。

假设:

GPU A

要给:

GPU B

发送数据。

路径是:

GPU A

↓

交换芯片

↓

电信号

↓

转换成光

↓

光纤

↓

转换回电

↓

交换芯片

↓

GPU B

这就是最核心的东西。

二、为什么要“电→光”?

你可以把它想象成高速公路。

铜线/PCB

像一条非常好的:

城市道路

短距离很好。

但是如果你要求:

一秒钟通过几百万辆车,而且道路还不能堵。

问题就来了。

而光纤就像:

超大型高速铁路/高速公路。

特别适合长距离、高带宽运输。

所以:

芯片产生数据

↓

先用电跑

↓

尽快变成光

↓

光纤长距离跑

↓

到了目的地再变回电

这就是光通信。

三、传统光模块到底是什么?

这时候就很好理解了。

传统交换机:

交换芯片
↓
PCB上的电线路
↓
光模块
↓
电 → 光
↓
光纤

也就是说:

交换芯片产生电信号以后,要在PCB上跑一段距离,跑到机箱边上的光模块,才变成光。

这就是传统架构。

四、CPO到底改了什么?

CPO就干了一件特别简单的事情:

别让电跑那么远。

变成:

交换芯片
↓
光转换
↓
光纤

所以:

传统:

交换芯片 ─────很长的电路────→ 光模块 → 光纤

CPO:

交换芯片 → 光转换 → 光纤

这就是CPO。

你把这一点彻底理解了,后面所有东西就都能理解。

五、那么“电芯片”是什么?

现在回到你刚才问我的问题。

交换芯片就是:

数据的总调度中心。

比如:

1000个GPU

同时产生大量数据。

交换芯片负责决定:

这个数据应该送给哪个GPU?

所以:

Switch ASIC = 网络总调度中心 六、那SerDes是什么?

你不用一开始记英文。

把它理解成:

高速电信号接口。

交换芯片里面的数据很多。

它需要把数据高速“挤”出去。

所以:

交换芯片

↓

高速电接口

↓

电信号

这个高速电接口就是SerDes。

你现在只需要知道:

交换芯片越快,SerDes就必须越快。

七、为什么交换芯片越来越快会逼出CPO?

这是整个故事最关键的地方。

假设以前:

100辆车/秒

通过道路。

普通道路够用。

后来:

1000辆车/秒

还可以扩建道路。

后来:

10000辆车/秒

道路开始受不了了。

怎么办?

不是继续把道路无限加宽。

而是:

换运输方式。

所以:

电

↓

换成

光

这就是CPO的根本原因。

八、那“光芯片”到底干什么?

现在我们已经知道:

交换芯片产生电信号。

但光纤不能直接接收普通电信号。

所以必须有一个东西:

把电信号“写”到光里面。

这就是光芯片。

九、光芯片可以简单理解成“光的调制器”

例如:

电信号:

101100101101...

我们希望把这个信息放到光上。

于是:

电信号
↓
光调制器
↓
带有数据的光

光就可以沿着光纤跑了。

所以:

电芯片负责产生/处理数据,光芯片负责把数据装进光里。

十、那激光器又是什么?

这个更简单。

你不能凭空让光芯片产生大量稳定的光。

所以需要:

激光器 = 光源

就像:

电路需要电源。

光通信需要:

激光光源。

所以:

激光器
↓
产生稳定的光
↓
光调制器
↓
把数据写进光

十一、所以现在整个发送过程已经非常清楚了

假设GPU A给GPU B发送数据:

GPU A
↓
交换芯片
↓
高速电接口
↓
Driver驱动
↓
光调制器
↓
激光器提供光
↓
把数据加载到光上
↓
光纤

你现在就可以理解CPO里面最核心的几个东西了。

十二、那Optical Engine光引擎是什么?

这个名字特别容易把人搞晕。

其实没有那么复杂。

它就是:

把刚才这些光电转换零件组合成一个模块。

例如:

┌─────────────────────┐
│ Optical Engine │
│ │
│ 激光器 │
│ 光芯片 │
│ Driver │
│ TIA │
│ 光耦合 │
│ 光纤接口 │
└─────────────────────┘

所以:

Optical Engine不是一种神秘的新芯片。

就是:

完成电→光、光→电转换的一组核心器件。

十三、那CPO到底“共封装”了什么?

这时候CPO这个名字就非常容易理解了。

CPO:

Co-Packaged Optics
共封装光学

过去:

交换芯片
↓
PCB
↓
光模块

交换芯片和光模块:

分开。

CPO:

┌──────────────────────────┐
│ 一个封装区域 │
│ │
│ Switch ASIC 光引擎 │
│ ████ ████ │
│ │
└──────────────────────────┘
↓
光纤

也就是:

把交换芯片和光引擎放得非常近,甚至共同封装。

十四、这时候你就会发现一个非常重要的东西

CPO真正减少的不是:

光纤距离。

而是:

电信号走的距离。

这个区别非常重要。

传统:

交换芯片
↓
←────电────→
↓
光模块
↓
←────光────→
↓
光纤

CPO:

交换芯片
↓
光引擎
↓
←────光────→
光纤

所以CPO真正解决的是:

高速电信号长距离传输的问题。

十五、那为什么又突然扯到PCB、CCL、铜箔?

现在就不抽象了。

因为虽然CPO减少了高速电信号的长距离传输:

但交换芯片周围仍然需要PCB和封装基板。

而且:

交换芯片

本身越来越快。

所以剩下的电线路仍然需要:

低损耗

低串扰

高频性能

于是就需要:

高性能CCL

↓

低粗糙度铜箔

↓

低损耗树脂

↓

高性能电子布

所以你前面那篇:

电子布 → 树脂 → 铜箔 → CCL → PCB

其实就是:

CPO的“电”这一半。 十六、而硅光、激光器、光纤是“光”这一半

于是现在可以把CPO拆成两个世界:

电世界

Switch ASIC
↓
SerDes
↓
Driver / TIA
↓
PCB / CCL
↓
封装基板

光世界

Laser
↓
Silicon Photonics
↓
光调制
↓
光耦合
↓
Fiber

CPO就是把:

电世界

和

光世界

在非常近的位置接起来。

十七、再理解“接收端”就完整了

前面讲的是:

GPU A → GPU B

发送端:

电
↓
光
↓
光纤

到了GPU B:

光纤
↓
光探测器
↓
TIA
↓
电信号
↓
交换芯片
↓
GPU B

所以完整过程:

电 → 光 → 光纤 → 光 → 电

这就是整个CPO。

十八、现在再看整个CPO产业链

这时候就可以把所有产业链节点放回正确的位置。

GPU / XPU
↓
Switch ASIC
交换芯片
↓
SerDes
高速电接口
↓
Driver驱动芯片
↓
光调制器
↓
┌───────────┴──────────┐
│ │
Laser激光器 Silicon Photonics
│ 硅光芯片
└───────────┬──────────┘
↓
Optical Engine
光引擎
↓
光耦合器
↓
Fiber Array
光纤阵列
↓
Fiber
光纤
↓
另一端设备

接收方向反过来:

光纤
↓
光探测器
↓
TIA
↓
SerDes
↓
Switch ASIC
↓
GPU / XPU

十九、这样你就能理解“CPO为什么这么复杂”

因为它实际上是:

一条电路

Switch ASIC → SerDes → Driver → TIA

加上:

一条光路

Laser → 光调制器 → 光纤 → 光探测器

再加上:

一套封装

ASIC + 光引擎 + 基板

再加上:

一套材料

ABF + CCL + 铜箔 + 树脂 + 电子布

再加上:

一套散热

散热器 + 液冷

最后组合成:

CPO交换机 二十、为什么AI会让这个东西越来越重要?

现在再回到最上游。

AI:

模型越来越大

↓

需要越来越多GPU

↓

GPU之间通信越来越多

↓

交换机带宽越来越高

↓

Switch ASIC越来越快

↓

SerDes越来越快

↓

电线路越来越难跑

↓

电→光转换必须提前

↓

CPO

所以:

AI增长 → 网络增长 → 光互连增长

这才是CPO真正的产业逻辑。

二十一、你现在可以把CPO理解成“物流系统”

如果还是觉得抽象,我建议用一个非常简单的类比。

GPU

= 工厂

Switch ASIC

= 物流调度中心

SerDes

= 高速装货系统

PCB

= 城市道路

光调制器

= 把货物装进高速列车

激光器

= 高速列车动力系统

光纤

= 高速铁路

光探测器

= 卸货系统

TIA

= 把货物重新转换成可以处理的形式

CPO

= 把高速铁路的车站直接建在物流调度中心旁边。

过去:

调度中心 → 城市道路 → 很远的车站 → 高铁

现在:

调度中心 → 旁边就是车站 → 高铁

所以:

CPO不是让“高铁”变快。

而是:

让货物更早离开拥堵的城市道路。

这个类比基本就是CPO的本质。

二十二、再回头看你前面研究的PCB

这样就非常容易理解了。

你之前研究:

电子布 → 树脂 → 铜箔 → CCL → PCB → HDI

解决的是:

“电怎么跑得更快?”

而CPO解决的是:

“什么时候不要再让电跑,而改成让光跑?”

所以两者不是互相矛盾。

而是:

电互连不断逼近极限 → 光互连不断前移。

二十三、这也是为什么CPO研究最重要的是“新墙”

你真正应该问的不是:

CPO是不是未来?

而是:

现在到底是哪堵墙挡住了AI网络?

如果现在是:

PCB电损耗

那么:

→ CPO受益。

如果下一步是:

激光器发热

那么:

→ 外置激光器受益。

如果是:

光耦合损耗

那么:

→ 光耦合器、光纤阵列受益。

如果是:

封装散热

那么:

→ 液冷、先进封装受益。

如果是:

光引擎可靠性

那么:

→ 可维护光引擎、封装技术受益。

所以CPO真正应该研究的是:

哪一个物理瓶颈正在把产业利润向下一个节点传导。

最后,把CPO压缩成一句你以后看产业时可以直接用的话

CPO就是把AI交换芯片产生的高速电信号,在尽可能靠近芯片的地方转换成光,让数据通过光纤高速传输,从而绕开越来越难以承受的高速电互连损耗。

因此完整产业链就是:

AI GPU/XPU

→ Switch ASIC交换芯片

→ SerDes高速电接口

→ Driver驱动芯片

→ 光调制器

→ Laser激光器

→ Silicon Photonics硅光芯片

→ Optical Engine光引擎

→ 先进封装

→ ABF/封装基板

→ 高速PCB/CCL

→ Fiber光纤

→ 下一台交换机

→ GPU/XPU

这时候再去看任何一家CPO公司,你就不会只看到“它是做光模块的”,而是能马上判断:

它究竟站在“电→光→光纤→电”这条链的哪一个位置,解决的是哪一个物理瓶颈。


接收端同样需要硅光芯片(Silicon Photonics / PIC,硅光子集成电路),但要注意:接收端的“硅光芯片”承担的功能和发送端不完全一样。

可以把整个 CPO 看成一个完整的:

电 → 光 → 光纤 → 光 → 电

发送端 TX

Switch ASIC(交换芯片)

↓

SerDes(高速串行接口)

↓

Driver(驱动芯片)

↓

硅光芯片 PIC

  1. 光调制器
  2. 光波导
  3. 光耦合器
  4. ↓
  5. Laser(激光器)提供光源
  6. ↓
  7. 光纤

这里硅光芯片的核心任务是:

把电信号“刻”到光上。

接收端 RX

光纤

↓

硅光芯片 PIC

  1. 光波导
  2. 光耦合
  3. 光分波
  4. ↓
  5. Photodetector(光探测器 / PD)
  6. ↓
  7. TIA(跨阻放大器)
  8. ↓
  9. SerDes
  10. ↓
  11. Switch ASIC

接收端硅光芯片的核心任务则是:

把光信号接进来,并把光正确地送到探测器。

所以严格来说:

发送端和接收端都可能使用硅光 PIC,但内部功能不同。

你可以这样理解

假设 GPU A 要给 GPU B 发数据:

GPU A → Switch A → CPO TX → 光纤 → CPO RX → Switch B → GPU B

其中:

位置主要功能
TX 硅光 PIC电信号 → 光信号
Laser提供光
Fiber传输光
RX 硅光 PIC接收、耦合、分配光
Photodetector光 → 电流
TIA微弱电流 → 可处理电信号
Switch ASIC数据交换

所以你前面问的那个问题其实非常关键:

CPO不是只有“发送端一个硅光芯片”。完整的光链路两端都存在光电转换,因此接收侧同样存在光芯片/PIC,只是具体架构可以不同。