产棱 · IndPrism China 算力全产业链传导分析

产棱拆解 | AI加速器从Chiplet到Photonic Chiplet,当GPU、HBM与光互连开始成为一个系统

产棱 技术拆解 代际演进

AI加速器的下一次架构革命:从Chiplet到Photonic Chiplet——当GPU、HBM与光互连开始成为一个系统

一、真正的变化:GPU正在从“一颗芯片”变成“一个封装系统”

过去理解GPU非常简单:

GPU芯片 → HBM → 封装 → PCB → 服务器

GPU负责计算,HBM负责提供数据,PCB负责把GPU连接到外部世界。

但AI计算规模继续扩大以后,这种结构开始出现越来越明显的边界。

原因不是GPU算力不够,而是:

GPU越来越快,但数据移动越来越难。

AI计算实际上可以拆成三个最基本的问题:

第一,计算在哪里发生?

第二,数据在哪里存放?

第三,数据如何高速移动?

过去最主要的问题是第一项——计算能力。

后来越来越大的问题变成第二项——HBM带宽和容量。

而现在,第三项正在成为越来越重要的问题:

GPU内部、GPU之间、GPU与交换机之间的数据,如何以足够高的带宽、足够低的功耗进行移动?

这就是为什么未来AI加速器的架构会逐渐从:

Compute Die + HBM

向:

Compute Die + HBM + I/O Die + Optical I/O + Advanced Packaging

演化。

再进一步,则可能出现:

Compute Chiplet + Memory Chiplet + I/O Chiplet + Photonic Chiplet + HBM

最终,GPU本身不再是一个孤立的“芯片”,而成为一个高度异构集成的计算系统。

二、先把整个架构放在一张图里

可以先用最简单的方式理解未来AI加速器:

┌───────────────────────────────┐
│ AI Accelerator Package │
│ │
│ ┌───────────────┐ │
│ │ Compute Die │ │
│ │ GPU / XPU │ │
│ └───────┬───────┘ │
│ │ │
│ ┌───────┴────────┐ │
│ │ I/O Die │ │
│ └───────┬────────┘ │
│ │ │
│ ┌───────┴────────┐ │
│ │ Photonic Chiplet│ │
│ │ PIC + PD + ... │ │
│ └───────┬────────┘ │
│ │ │
│ Fiber │
│ │ │
│ ──────┼──────────► Network │
│ │
│ HBM HBM HBM HBM │
│ │ │ │ │ │
│ └─────┴─────┴─────┘ │
│ │
│ Advanced Packaging │
└───────────────────────────────┘

这里最重要的是:

这些东西不是简单堆在一起。

它们分别解决AI计算系统中的不同物理瓶颈。

模块解决的问题
Compute Die计算
HBM高带宽内存
I/O Die内外部数据交换
Chiplet把大型系统拆成多个功能芯粒
Photonic Chiplet把光互连能力引入封装
Optical I/O用光替代越来越困难的高速电连接
Advanced Packaging把上述系统真正集成起来

因此,下一代AI芯片真正发生变化的不是某一个器件。

而是:

芯片架构、内存架构、I/O架构和封装架构开始融合。

三、第一层革命:为什么需要Chiplet?

1. 为什么不能永远做“大单片GPU”?

传统GPU主要采用:

Monolithic Die(单片芯片)

所有功能尽量放在一颗大型Die里面。

这种方式最大的优势是:

  1. 延迟低
  2. 内部连接简单
  3. 软件模型相对直接

但问题也非常明显。

芯片越做越大以后:

良率下降。

因为一颗Die面积越大,制造过程中遇到缺陷的概率越高。

假设一个非常大的Die出现一个缺陷,那么整颗Die可能就不能使用。

因此:

芯片面积越大,制造经济性越困难。

于是Chiplet出现。

四、Chiplet到底是什么?

Chiplet可以直接理解成:

把原来必须做在一颗大芯片里的不同功能,拆成多个小芯粒,然后重新组合成一个系统。

例如:

传统:

┌─────────────────────────────┐
│ │
│ Large GPU Die │
│ │
│ Compute + I/O + Cache ... │
│ │
└─────────────────────────────┘

变成:

未来:

┌────────────┐ ┌────────────┐
│ Compute │ │ Compute │
│ Chiplet │ │ Chiplet │
└─────┬──────┘ └──────┬─────┘
│ │
└───────┬───────┘
│
┌──────┴──────┐
│ I/O Die │
└──────┬──────┘
│
┌──────┴──────┐
│ Photonic │
│ Chiplet │
└─────────────┘

这时候一个非常重要的事情发生了:

芯片设计开始从“设计一颗芯片”,变成“设计一个芯片系统”。

五、为什么Chiplet特别适合AI?

AI芯片有一个非常特殊的特点:

不同功能对制造工艺的需求完全不同。

例如:

Compute Die:

需要先进制程。

I/O Die:

不一定需要最先进制程。

SerDes:

有自己的工艺优化需求。

模拟电路:

可能不适合和最先进数字逻辑完全放在一起。

SRAM:

需要特殊面积和密度优化。

Photonic Die:

则涉及硅光和光电器件。

Laser:

甚至可能使用III-V族材料。

如果全部塞进一颗Die:

工艺非常复杂。

而Chiplet可以做到:

先进制程
↓
Compute Chiplet

成熟/优化制程
↓
I/O Chiplet

硅光工艺
↓
Photonic Chiplet

III-V材料
↓
Laser

于是出现一个极其重要的趋势:

未来AI芯片可能不再要求所有功能使用同一种制造工艺。

这就是异构集成。

六、第二层革命:2.5D封装到底解决什么?

Chiplet拆开以后,马上出现一个问题:

这些芯粒怎么连接?

如果还用传统PCB连接:

距离太远。

速度太低。

功耗太高。

所以需要先进封装。

其中最重要的一类就是:

2.5D Packaging(2.5D封装)

七、2.5D的本质:把“PCB”缩小到芯片旁边

可以把2.5D理解成:

在封装内部放置一块极其高密度的连接层,把多个Die放得非常近。

典型结构:

Compute Die
┌─────────────┐
│ │
└─────────────┘

HBM HBM
┌────────┐ ┌────────┐
│ │ │ │
└────────┘ └────────┘

────────────────────────────
Interposer
────────────────────────────

Package

这里的核心部件之一是:

Interposer(中介层)

它不是传统意义上的芯片。

它更像一块:

极高密度的内部连接底板。

它把:

GPU

HBM

其他Chiplet

连接到一起。

八、为什么HBM必须靠近GPU?

这时候就能真正理解HBM为什么越来越重要。

HBM不是简单的“大容量DRAM”。

它最大的价值之一是:

把大量存储带宽直接放到计算芯片旁边。

传统结构:

GPU ───────────── PCB ───────────── DRAM

距离长。

HBM:

GPU
│
┌─────┼─────┐
│ │ │
HBM HBM HBM

距离极短。

所以:

HBM解决的是Memory Wall(内存墙)。

而且不仅是容量问题,更重要的是:

带宽 + 距离 + 能耗。

九、但是HBM解决不了另一个问题

HBM可以解决:

GPU ↔ Memory

但是不能解决:

GPU ↔ GPU

也不能完全解决:

GPU ↔ Switch

更不能解决:

GPU Package ↔ GPU Package

于是:

HBM把计算芯片内部的数据供应问题解决了一大部分,却把系统级通信问题更加突出地暴露出来。

这就是Optical I/O出现的根本背景。

十、第三层革命:I/O Die为什么越来越重要?

理解Optical I/O之前,一定要理解:

I/O Die(输入输出芯粒)

它可以理解成AI加速器的:

数据交通枢纽。

GPU计算产生的数据必须出去。

外部的数据也必须进来。

于是:

GPU
│
▼
I/O Die
↙ ↓ ↘
HBM Network GPU

I/O Die承担的是:

  1. 高速SerDes
  2. PCIe
  3. CXL
  4. 高速互连
  5. 外部网络接口
  6. 芯片之间的数据交换

随着计算Die越来越快:

I/O Die的重要性越来越高。

十一、真正的问题:电信号还能跑多远?

这是整个Optical I/O革命最重要的物理基础。

电信号不是不能高速传输。

问题是:

速度越高,距离越远,损耗和功耗越严重。

可以简单理解成:

短距离:

GPU ──────── GPU
电连接

还可以。

距离变长:

GPU ───────────────── GPU
电连接

越来越困难。

原因包括:

  1. 电阻损耗
  2. 介质损耗
  3. 高频损耗
  4. 信号完整性
  5. 串扰
  6. 均衡器功耗
  7. Retimer功耗

所以未来真正的问题不是:

“电能不能传数据?”

而是:

单位比特的数据移动成本是否已经高到不值得继续使用电连接?

十二、于是出现第四层革命:Optical I/O

Optical I/O的本质非常简单:

把越来越长、越来越高速的数据连接,从电域搬到光域。

传统:

GPU
│
│ Electrical
│
SerDes
│
│
PCB
│
│
Switch

未来:

GPU
│
I/O Die
│
Electrical
│
Photonic Chiplet
│
│ Optical
▼
Fiber
│
▼
Switch

于是:

电负责短距离。

光负责长距离高速通信。

这并不是“光取代电”。

而是:

重新划分电和光各自最经济的工作距离。

十三、Photonic Chiplet是什么?

Photonic Chiplet:

光子芯粒 / 光学芯粒

可以理解为:

专门负责光信号处理的Chiplet。

它里面可以集成:

  1. Waveguide(光波导)
  2. Modulator(调制器)
  3. Coupler(光耦合器)
  4. Splitter(分光器)
  5. Mux/Demux(波分复用/解复用)
  6. Photodetector(光探测器)

但注意:

Photonic Chiplet不等于Laser。

这是非常关键的一点。

十四、Laser为什么还是特殊的?

硅非常适合做:

  1. 光波导
  2. 调制器
  3. 光路
  4. 光耦合
  5. 大规模集成

但是:

硅本身并不是理想的激光器材料。

因此:

Silicon Photonics
+
III-V Laser

是一条非常重要的技术路线。

例如:

  1. InP
  2. GaAs
  3. 其他III-V材料体系

因此未来一个真正复杂的Optical I/O系统可能是:

Laser
│
▼
┌──────────────┐
│ Photonic │
│ Chiplet │
│ │
│ Waveguide │
│ Modulator │
│ Coupler │
│ PD │
└──────┬───────┘
│
Fiber

十五、真正困难的地方:不是“把光塞进去”

很多人理解Optical I/O的时候容易产生一个误区:

“未来把一个光芯片放进GPU旁边就行了。”

实际上完全不是。

因为光进入封装以后,会产生一个非常特殊的问题:

光学对准。

电连接主要关注:

  1. 接触
  2. 阻抗
  3. 信号完整性

而光连接还必须考虑:

  1. 光纤位置
  2. 波导位置
  3. 光耦合角度
  4. 模场匹配
  5. 耦合损耗
  6. 温度变化造成的机械位移

所以光学封装的难度明显不同。

十六、这意味着先进封装开始出现“四维问题”

传统先进封装主要考虑:

第一维:Electrical

电连接。

第二维:Thermal

散热。

第三维:Mechanical

机械结构。

而加入Photonic以后:

第四维:Optical

光学对准。

所以未来先进封装实际上变成:

Electrical + Optical + Thermal + Mechanical

四个维度同时优化。

这会让先进封装的重要性进一步提高。

十七、3D封装又解决什么?

2.5D主要解决:

横向高密度连接。

而3D主要解决:

纵向连接。

可以简单理解:

2.5D

Die Die Die
│ │ │
└─────┴─────┘
Interposer

而3D:

Die
│
Die
│
Die

通过:

TSV(硅通孔)

或者更先进的混合键合等技术,把芯片进行垂直堆叠。

十八、为什么AI越来越需要3D?

因为二维平面开始不够用了。

如果所有东西都放在平面上:

面积越来越大。

连接距离越来越长。

于是:

把功能在垂直方向堆起来,可以进一步缩短连接距离。

这对:

  1. Cache
  2. SRAM
  3. Memory
  4. Logic
  5. I/O

都可能产生影响。

但这里存在一个巨大的问题:

热。

十九、AI芯片最终可能撞上的真正墙:热

这是整个架构演进中非常重要的一条主线。

计算芯片:

越来越热。

HBM:

越来越近。

Optical:

也越来越近。

Laser:

又怕热。

于是:

高功率Compute
↓
┌──────────┐
│ GPU/XPU │
└──────────┘
↓
热量向周围扩散

HBM ←──── 热 ────→ Optical
↑
Laser

问题出现:

最需要靠近GPU的东西,恰恰可能也是最怕GPU热量的东西。

这就是为什么未来Optical I/O架构并不是简单地:

“越靠近GPU越好。”

而是要寻找:

电距离、光距离、热距离之间的最优点。

二十、这也是为什么会出现External Laser

如果Laser太靠近GPU:

温度问题越来越严重。

那么一种自然的解决方式就是:

把Laser拿出去。

形成:

GPU
│
Photonic Chiplet
│
│ optical
│
External Laser Source

也就是说:

光路靠近计算芯片。

但是:

热敏感的Laser可以远离高热源。

这实际上体现了未来AI芯片架构非常重要的设计原则:

不是所有功能都必须物理上放在一起,而是要把“数据距离”和“热距离”同时优化。

二十一、HBM和Optical I/O其实是同一场革命

这一点非常重要。

很多人会把HBM和光通信看成两个完全不同的产业。

从系统架构看,它们其实解决的是同一个问题:

数据移动。

HBM解决:

Compute ↔ Memory

Optical I/O解决:

Compute ↔ Compute / Network

因此:

AI Compute
│
┌──────────┴──────────┐
│ │
▼ ▼
HBM Optical I/O
│ │
▼ ▼
Memory Network

HBM:

内部数据高速公路。

Optical I/O:

外部数据高速公路。

而Compute Die:

计算中心。

二十二、因此未来AI封装可以理解成三条高速公路

第一条:Compute ↔ HBM

主要依靠:

  1. Advanced Packaging
  2. Interposer
  3. TSV
  4. HBM

目标:

最大化内存带宽。

第二条:Compute ↔ Compute

主要依靠:

  1. SerDes
  2. Die-to-Die
  3. Chiplet
  4. Optical I/O

目标:

最大化计算节点之间的通信效率。

第三条:Compute ↔ Network

主要依靠:

  1. I/O Die
  2. Optical Engine
  3. Photonic Chiplet
  4. Fiber

目标:

把AI加速器连接到整个AI Fabric。

二十三、这时候GPU已经不再是一颗GPU

未来AI加速器更接近:

AI Accelerator
│
┌─────────────────┼──────────────────┐
│ │ │
▼ ▼ ▼
Compute Memory I/O
Chiplets HBM Die
│ │ │
└─────────────────┼──────────────────┘
│
Advanced Packaging
│
┌──────────┴──────────┐
│ │
▼ ▼
Electrical I/O Photonic I/O
│
▼
Fiber

因此:

下一代AI加速器的竞争,不再只是GPU计算核心的竞争。

而是整个封装系统的竞争。

二十四、Chiplet进一步改变了产业链

传统GPU产业链可以简单理解:

EDA
↓
晶圆制造
↓
GPU
↓
HBM
↓
封装
↓
PCB

而Chiplet时代变成:

EDA
│
├── Compute Die
│
├── I/O Die
│
├── Memory
│
├── Photonic Chiplet
│
├── Laser
│
└── Packaging
│
▼
System Integration

产业链开始高度分化。

因此未来一个AI加速器的价值并不只存在于:

Compute Die。

还可能大量存在于:

  1. HBM
  2. Chiplet
  3. I/O Die
  4. Silicon Photonics
  5. Laser
  6. Optical Coupling
  7. Advanced Packaging
  8. Interposer
  9. Substrate
  10. ABF
  11. Fiber
  12. Thermal Management
  13. Testing

二十五、ABF为什么仍然重要?

即使未来大量数据开始使用光:

ABF不会因此消失。

原因很简单:

Optical I/O解决的是:

高速数据传输。

但是封装内部仍然存在大量:

  1. 电源
  2. 控制信号
  3. 管理信号
  4. 低速/中速信号
  5. 芯片之间的电连接

因此:

Compute
│
├──── Optical
│
└──── Electrical
│
Substrate
│
ABF
│
PCB

未来不是:

Optical replaces Electrical

而是:

Optical + Electrical共同存在,并按照距离和带宽重新分工。

二十六、真正的终局可能不是Optical I/O,而是Photonic Chiplet

这是非常值得注意的一个架构方向。

Optical I/O只是功能。

Photonic Chiplet则是实现这种功能的一种架构方式。

未来可能出现:

Compute Chiplet
│
│
Photonic Chiplet
│
│
Fiber

甚至进一步:

Compute
│
Photonic
│
Memory
│
I/O

全部通过Chiplet方式组合。

这时候:

光子技术正式进入芯片架构。

它不再只是“网络设备上的光模块技术”。

二十七、从CPO到Photonic Chiplet,其实是一条连续演进路线

可以把整个技术演进串起来:

Pluggable Optical Module
↓
↓
CPO
↓
↓
NPO
↓
↓
Optical I/O
↓
↓
Photonic Chiplet
↓
↓
Photonic-Compute Integration

这条路线背后的核心逻辑始终只有一个:

不断缩短高速数据路径中的电距离。

但随着光越来越靠近计算芯片:

新的问题又出现:

热、封装、耦合、可靠性、测试。

因此下一阶段竞争的核心,很可能从“光模块性能”逐渐转向:

光、电、热、封装的系统级协同。

二十八、真正需要跟踪的,不是“谁宣布了Optical I/O”

产业研究如果只看新闻,很容易陷入:

“某公司发布Optical I/O。”

“某公司发布Photonic Chiplet。”

“某公司宣布CPO。”

这些信息本身价值有限。

真正应该跟踪的是:

第一变量:电连接距离

GPU到I/O Die的距离是否继续缩短?

第二变量:SerDes速率

随着单通道速率继续提升,电连接损耗是否开始成为硬约束?

第三变量:Energy per Bit

每传输一个比特需要多少能量?

这是判断电互连是否正在接近经济极限的重要指标。

第四变量:光耦合损耗

Optical I/O真正进入封装以后,耦合损耗能否控制?

第五变量:Laser热问题

Laser是否需要External Laser?

第六变量:封装良率

光学器件进入先进封装以后,整体良率是否下降?

第七变量:Fiber Density

封装边缘究竟可以塞进多少根光纤?

这可能成为新的I/O墙。

二十九、产业瓶颈正在发生迁移

这是整个这篇文章最值得记住的地方。

AI计算产业的瓶颈并不是固定的。

它正在不断迁移:

计算能力
↓
Memory Bandwidth
↓
HBM
↓
Electrical I/O
↓
SerDes
↓
Package Routing
↓
Optical Coupling
↓
Thermal
↓
Fiber Density
↓
Packaging Yield

因此:

产业研究最重要的不是知道产业链上有哪些公司,而是知道当前“最紧的那根链条”在哪里。

当一个瓶颈被解决以后:

价值不会消失。

而是会转移到下一个瓶颈。

三十、这也是为什么AI产业链研究必须从“产品研究”升级到“物理约束研究”

例如:

如果发现:

GPU算力继续增长。

这不是结论。

应该继续问:

GPU算力增长以后:

→ HBM够不够?

→ HBM带宽够不够?

→ GPU与HBM之间的连接够不够?

→ GPU与GPU之间的连接够不够?

→ SerDes够不够?

→ PCB还能不能承受?

→ 电连接功耗是否过高?

→ Optical I/O是否开始变得经济?

→ 光耦合是否成为新瓶颈?

→ Laser是否受热?

→ 封装是否成为限制?

这才是真正的产业传导。

三十一、最终形成一张完整的AI加速器架构地图

可以把未来AI加速器理解成:

AI Accelerator
│
┌────────────────┼────────────────┐
│ │ │
▼ ▼ ▼
Compute Die HBM I/O Die
│ │ │
│ │ │
└────────────────┼────────────────┘
│
Advanced Packaging
│
┌──────────────┴──────────────┐
│ │
▼ ▼
Electrical I/O Photonic I/O
│ │
SerDes Photonic Chiplet
│ │
Substrate Laser
│ │
PCB Fiber
│
▼
Optical Network
│
▼
Other AI Accelerators

这已经不是传统意义上的“GPU”。

它更接近:

一个高度异构集成的AI计算节点。

三十二、下一代AI芯片真正发生的变化

过去:

芯片决定性能。

后来:

芯片 + HBM决定性能。

现在逐渐变成:

芯片 + HBM + I/O + 封装决定性能。

再往后:

芯片 + HBM + Chiplet + Optical I/O + Advanced Packaging + Network共同决定性能。

也就是说:

AI芯片正在从“计算器件”演化成“数据移动系统”。

计算只是其中一个部分。

三十三、最终判断:真正的下一次架构革命是什么?

不是:

GPU变得更大。

也不是:

HBM变得更快。

甚至也不只是:

CPO变成Optical I/O。

真正的变化是:

计算、内存、I/O、光互连和先进封装开始被当成一个统一的架构系统进行设计。

Chiplet解决的是:

如何把复杂系统拆开。

2.5D解决的是:

如何把多个芯粒高密度地连接起来。

3D解决的是:

如何进一步缩短垂直距离。

HBM解决的是:

计算与内存之间的数据墙。

I/O Die解决的是:

计算与外部世界之间的数据交换。

Photonic Chiplet解决的是:

如何把光通信能力直接引入芯片封装。

Optical I/O解决的是:

如何突破高速电互连的距离与能耗约束。

而Advanced Packaging最终负责:

把这一切真正装成一个可以制造、测试、散热、可靠运行的系统。

所以,下一代AI芯片真正的核心竞争力,很可能不再是一颗GPU本身。

而是:

谁能够把 Compute、Memory、Electrical I/O、Optical I/O、Thermal 和 Packaging 组合成一个整体效率最高的计算系统。

这也是为什么从现在开始研究AI产业链,不能再把“GPU、HBM、光通信、PCB、先进封装”当成六条互相独立的产业链。

它们实际上正在逐渐收敛成:

一套AI数据移动与计算基础设施。

而这套基础设施下一阶段最大的研究价值,就在于持续寻找:

哪一个物理约束正在从“可优化问题”变成“硬瓶颈”。

一旦新的硬瓶颈出现,产业价值和资本开支就会沿着新的瓶颈重新分配。

这才是从Chiplet → Photonic Chiplet → Optical I/O之后,真正值得持续跟踪的产业主线。