产棱拆解 | AI加速器从Chiplet到Photonic Chiplet,当GPU、HBM与光互连开始成为一个系统
AI加速器的下一次架构革命:从Chiplet到Photonic Chiplet——当GPU、HBM与光互连开始成为一个系统
一、真正的变化:GPU正在从“一颗芯片”变成“一个封装系统”
过去理解GPU非常简单:
GPU芯片 → HBM → 封装 → PCB → 服务器
GPU负责计算,HBM负责提供数据,PCB负责把GPU连接到外部世界。
但AI计算规模继续扩大以后,这种结构开始出现越来越明显的边界。
原因不是GPU算力不够,而是:
GPU越来越快,但数据移动越来越难。
AI计算实际上可以拆成三个最基本的问题:
第一,计算在哪里发生?
第二,数据在哪里存放?
第三,数据如何高速移动?
过去最主要的问题是第一项——计算能力。
后来越来越大的问题变成第二项——HBM带宽和容量。
而现在,第三项正在成为越来越重要的问题:
GPU内部、GPU之间、GPU与交换机之间的数据,如何以足够高的带宽、足够低的功耗进行移动?
这就是为什么未来AI加速器的架构会逐渐从:
Compute Die + HBM
向:
Compute Die + HBM + I/O Die + Optical I/O + Advanced Packaging
演化。
再进一步,则可能出现:
Compute Chiplet + Memory Chiplet + I/O Chiplet + Photonic Chiplet + HBM
最终,GPU本身不再是一个孤立的“芯片”,而成为一个高度异构集成的计算系统。
二、先把整个架构放在一张图里
可以先用最简单的方式理解未来AI加速器:
这里最重要的是:
这些东西不是简单堆在一起。
它们分别解决AI计算系统中的不同物理瓶颈。
| 模块解决的问题 | |
| Compute Die | 计算 |
| HBM | 高带宽内存 |
| I/O Die | 内外部数据交换 |
| Chiplet | 把大型系统拆成多个功能芯粒 |
| Photonic Chiplet | 把光互连能力引入封装 |
| Optical I/O | 用光替代越来越困难的高速电连接 |
| Advanced Packaging | 把上述系统真正集成起来 |
因此,下一代AI芯片真正发生变化的不是某一个器件。
而是:
芯片架构、内存架构、I/O架构和封装架构开始融合。
三、第一层革命:为什么需要Chiplet?
1. 为什么不能永远做“大单片GPU”?
传统GPU主要采用:
Monolithic Die(单片芯片)
所有功能尽量放在一颗大型Die里面。
这种方式最大的优势是:
- 延迟低
- 内部连接简单
- 软件模型相对直接
但问题也非常明显。
芯片越做越大以后:
良率下降。
因为一颗Die面积越大,制造过程中遇到缺陷的概率越高。
假设一个非常大的Die出现一个缺陷,那么整颗Die可能就不能使用。
因此:
芯片面积越大,制造经济性越困难。
于是Chiplet出现。
四、Chiplet到底是什么?
Chiplet可以直接理解成:
把原来必须做在一颗大芯片里的不同功能,拆成多个小芯粒,然后重新组合成一个系统。
例如:
变成:
这时候一个非常重要的事情发生了:
芯片设计开始从“设计一颗芯片”,变成“设计一个芯片系统”。
五、为什么Chiplet特别适合AI?
AI芯片有一个非常特殊的特点:
不同功能对制造工艺的需求完全不同。
例如:
Compute Die:
需要先进制程。
I/O Die:
不一定需要最先进制程。
SerDes:
有自己的工艺优化需求。
模拟电路:
可能不适合和最先进数字逻辑完全放在一起。
SRAM:
需要特殊面积和密度优化。
Photonic Die:
则涉及硅光和光电器件。
Laser:
甚至可能使用III-V族材料。
如果全部塞进一颗Die:
工艺非常复杂。
而Chiplet可以做到:
于是出现一个极其重要的趋势:
未来AI芯片可能不再要求所有功能使用同一种制造工艺。
这就是异构集成。
六、第二层革命:2.5D封装到底解决什么?
Chiplet拆开以后,马上出现一个问题:
这些芯粒怎么连接?
如果还用传统PCB连接:
距离太远。
速度太低。
功耗太高。
所以需要先进封装。
其中最重要的一类就是:
2.5D Packaging(2.5D封装)
七、2.5D的本质:把“PCB”缩小到芯片旁边
可以把2.5D理解成:
在封装内部放置一块极其高密度的连接层,把多个Die放得非常近。
典型结构:
这里的核心部件之一是:
Interposer(中介层)
它不是传统意义上的芯片。
它更像一块:
极高密度的内部连接底板。
它把:
GPU
HBM
其他Chiplet
连接到一起。
八、为什么HBM必须靠近GPU?
这时候就能真正理解HBM为什么越来越重要。
HBM不是简单的“大容量DRAM”。
它最大的价值之一是:
把大量存储带宽直接放到计算芯片旁边。
传统结构:
距离长。
HBM:
距离极短。
所以:
HBM解决的是Memory Wall(内存墙)。
而且不仅是容量问题,更重要的是:
带宽 + 距离 + 能耗。
九、但是HBM解决不了另一个问题
HBM可以解决:
GPU ↔ Memory
但是不能解决:
GPU ↔ GPU
也不能完全解决:
GPU ↔ Switch
更不能解决:
GPU Package ↔ GPU Package
于是:
HBM把计算芯片内部的数据供应问题解决了一大部分,却把系统级通信问题更加突出地暴露出来。
这就是Optical I/O出现的根本背景。
十、第三层革命:I/O Die为什么越来越重要?
理解Optical I/O之前,一定要理解:
I/O Die(输入输出芯粒)
它可以理解成AI加速器的:
数据交通枢纽。
GPU计算产生的数据必须出去。
外部的数据也必须进来。
于是:
I/O Die承担的是:
- 高速SerDes
- PCIe
- CXL
- 高速互连
- 外部网络接口
- 芯片之间的数据交换
随着计算Die越来越快:
I/O Die的重要性越来越高。
十一、真正的问题:电信号还能跑多远?
这是整个Optical I/O革命最重要的物理基础。
电信号不是不能高速传输。
问题是:
速度越高,距离越远,损耗和功耗越严重。
可以简单理解成:
原因包括:
- 电阻损耗
- 介质损耗
- 高频损耗
- 信号完整性
- 串扰
- 均衡器功耗
- Retimer功耗
所以未来真正的问题不是:
“电能不能传数据?”
而是:
单位比特的数据移动成本是否已经高到不值得继续使用电连接?
十二、于是出现第四层革命:Optical I/O
Optical I/O的本质非常简单:
把越来越长、越来越高速的数据连接,从电域搬到光域。
传统:
未来:
于是:
电负责短距离。
光负责长距离高速通信。
这并不是“光取代电”。
而是:
重新划分电和光各自最经济的工作距离。
十三、Photonic Chiplet是什么?
Photonic Chiplet:
光子芯粒 / 光学芯粒
可以理解为:
专门负责光信号处理的Chiplet。
它里面可以集成:
- Waveguide(光波导)
- Modulator(调制器)
- Coupler(光耦合器)
- Splitter(分光器)
- Mux/Demux(波分复用/解复用)
- Photodetector(光探测器)
但注意:
Photonic Chiplet不等于Laser。
这是非常关键的一点。
十四、Laser为什么还是特殊的?
硅非常适合做:
- 光波导
- 调制器
- 光路
- 光耦合
- 大规模集成
但是:
硅本身并不是理想的激光器材料。
因此:
是一条非常重要的技术路线。
例如:
- InP
- GaAs
- 其他III-V材料体系
因此未来一个真正复杂的Optical I/O系统可能是:
十五、真正困难的地方:不是“把光塞进去”
很多人理解Optical I/O的时候容易产生一个误区:
“未来把一个光芯片放进GPU旁边就行了。”
实际上完全不是。
因为光进入封装以后,会产生一个非常特殊的问题:
光学对准。
电连接主要关注:
- 接触
- 阻抗
- 信号完整性
而光连接还必须考虑:
- 光纤位置
- 波导位置
- 光耦合角度
- 模场匹配
- 耦合损耗
- 温度变化造成的机械位移
所以光学封装的难度明显不同。
十六、这意味着先进封装开始出现“四维问题”
传统先进封装主要考虑:
第一维:Electrical
电连接。
第二维:Thermal
散热。
第三维:Mechanical
机械结构。
而加入Photonic以后:
第四维:Optical
光学对准。
所以未来先进封装实际上变成:
Electrical + Optical + Thermal + Mechanical
四个维度同时优化。
这会让先进封装的重要性进一步提高。
十七、3D封装又解决什么?
2.5D主要解决:
横向高密度连接。
而3D主要解决:
纵向连接。
可以简单理解:
而3D:
通过:
TSV(硅通孔)
或者更先进的混合键合等技术,把芯片进行垂直堆叠。
十八、为什么AI越来越需要3D?
因为二维平面开始不够用了。
如果所有东西都放在平面上:
面积越来越大。
连接距离越来越长。
于是:
把功能在垂直方向堆起来,可以进一步缩短连接距离。
这对:
- Cache
- SRAM
- Memory
- Logic
- I/O
都可能产生影响。
但这里存在一个巨大的问题:
热。
十九、AI芯片最终可能撞上的真正墙:热
这是整个架构演进中非常重要的一条主线。
计算芯片:
越来越热。
HBM:
越来越近。
Optical:
也越来越近。
Laser:
又怕热。
于是:
问题出现:
最需要靠近GPU的东西,恰恰可能也是最怕GPU热量的东西。
这就是为什么未来Optical I/O架构并不是简单地:
“越靠近GPU越好。”
而是要寻找:
电距离、光距离、热距离之间的最优点。
二十、这也是为什么会出现External Laser
如果Laser太靠近GPU:
温度问题越来越严重。
那么一种自然的解决方式就是:
把Laser拿出去。
形成:
也就是说:
光路靠近计算芯片。
但是:
热敏感的Laser可以远离高热源。
这实际上体现了未来AI芯片架构非常重要的设计原则:
不是所有功能都必须物理上放在一起,而是要把“数据距离”和“热距离”同时优化。
二十一、HBM和Optical I/O其实是同一场革命
这一点非常重要。
很多人会把HBM和光通信看成两个完全不同的产业。
从系统架构看,它们其实解决的是同一个问题:
数据移动。
HBM解决:
Compute ↔ Memory
Optical I/O解决:
Compute ↔ Compute / Network
因此:
HBM:
内部数据高速公路。
Optical I/O:
外部数据高速公路。
而Compute Die:
计算中心。
二十二、因此未来AI封装可以理解成三条高速公路
第一条:Compute ↔ HBM
主要依靠:
- Advanced Packaging
- Interposer
- TSV
- HBM
目标:
最大化内存带宽。
第二条:Compute ↔ Compute
主要依靠:
- SerDes
- Die-to-Die
- Chiplet
- Optical I/O
目标:
最大化计算节点之间的通信效率。
第三条:Compute ↔ Network
主要依靠:
- I/O Die
- Optical Engine
- Photonic Chiplet
- Fiber
目标:
把AI加速器连接到整个AI Fabric。
二十三、这时候GPU已经不再是一颗GPU
未来AI加速器更接近:
因此:
下一代AI加速器的竞争,不再只是GPU计算核心的竞争。
而是整个封装系统的竞争。
二十四、Chiplet进一步改变了产业链
传统GPU产业链可以简单理解:
而Chiplet时代变成:
产业链开始高度分化。
因此未来一个AI加速器的价值并不只存在于:
Compute Die。
还可能大量存在于:
- HBM
- Chiplet
- I/O Die
- Silicon Photonics
- Laser
- Optical Coupling
- Advanced Packaging
- Interposer
- Substrate
- ABF
- Fiber
- Thermal Management
- Testing
二十五、ABF为什么仍然重要?
即使未来大量数据开始使用光:
ABF不会因此消失。
原因很简单:
Optical I/O解决的是:
高速数据传输。
但是封装内部仍然存在大量:
- 电源
- 控制信号
- 管理信号
- 低速/中速信号
- 芯片之间的电连接
因此:
未来不是:
Optical replaces Electrical
而是:
Optical + Electrical共同存在,并按照距离和带宽重新分工。
二十六、真正的终局可能不是Optical I/O,而是Photonic Chiplet
这是非常值得注意的一个架构方向。
Optical I/O只是功能。
Photonic Chiplet则是实现这种功能的一种架构方式。
未来可能出现:
甚至进一步:
全部通过Chiplet方式组合。
这时候:
光子技术正式进入芯片架构。
它不再只是“网络设备上的光模块技术”。
二十七、从CPO到Photonic Chiplet,其实是一条连续演进路线
可以把整个技术演进串起来:
这条路线背后的核心逻辑始终只有一个:
不断缩短高速数据路径中的电距离。
但随着光越来越靠近计算芯片:
新的问题又出现:
热、封装、耦合、可靠性、测试。
因此下一阶段竞争的核心,很可能从“光模块性能”逐渐转向:
光、电、热、封装的系统级协同。
二十八、真正需要跟踪的,不是“谁宣布了Optical I/O”
产业研究如果只看新闻,很容易陷入:
“某公司发布Optical I/O。”
“某公司发布Photonic Chiplet。”
“某公司宣布CPO。”
这些信息本身价值有限。
真正应该跟踪的是:
第一变量:电连接距离
GPU到I/O Die的距离是否继续缩短?
第二变量:SerDes速率
随着单通道速率继续提升,电连接损耗是否开始成为硬约束?
第三变量:Energy per Bit
每传输一个比特需要多少能量?
这是判断电互连是否正在接近经济极限的重要指标。
第四变量:光耦合损耗
Optical I/O真正进入封装以后,耦合损耗能否控制?
第五变量:Laser热问题
Laser是否需要External Laser?
第六变量:封装良率
光学器件进入先进封装以后,整体良率是否下降?
第七变量:Fiber Density
封装边缘究竟可以塞进多少根光纤?
这可能成为新的I/O墙。
二十九、产业瓶颈正在发生迁移
这是整个这篇文章最值得记住的地方。
AI计算产业的瓶颈并不是固定的。
它正在不断迁移:
因此:
产业研究最重要的不是知道产业链上有哪些公司,而是知道当前“最紧的那根链条”在哪里。
当一个瓶颈被解决以后:
价值不会消失。
而是会转移到下一个瓶颈。
三十、这也是为什么AI产业链研究必须从“产品研究”升级到“物理约束研究”
例如:
如果发现:
GPU算力继续增长。
这不是结论。
应该继续问:
GPU算力增长以后:
→ HBM够不够?
→ HBM带宽够不够?
→ GPU与HBM之间的连接够不够?
→ GPU与GPU之间的连接够不够?
→ SerDes够不够?
→ PCB还能不能承受?
→ 电连接功耗是否过高?
→ Optical I/O是否开始变得经济?
→ 光耦合是否成为新瓶颈?
→ Laser是否受热?
→ 封装是否成为限制?
这才是真正的产业传导。
三十一、最终形成一张完整的AI加速器架构地图
可以把未来AI加速器理解成:
这已经不是传统意义上的“GPU”。
它更接近:
一个高度异构集成的AI计算节点。
三十二、下一代AI芯片真正发生的变化
过去:
芯片决定性能。
后来:
芯片 + HBM决定性能。
现在逐渐变成:
芯片 + HBM + I/O + 封装决定性能。
再往后:
芯片 + HBM + Chiplet + Optical I/O + Advanced Packaging + Network共同决定性能。
也就是说:
AI芯片正在从“计算器件”演化成“数据移动系统”。
计算只是其中一个部分。
三十三、最终判断:真正的下一次架构革命是什么?
不是:
GPU变得更大。
也不是:
HBM变得更快。
甚至也不只是:
CPO变成Optical I/O。
真正的变化是:
计算、内存、I/O、光互连和先进封装开始被当成一个统一的架构系统进行设计。
Chiplet解决的是:
如何把复杂系统拆开。
2.5D解决的是:
如何把多个芯粒高密度地连接起来。
3D解决的是:
如何进一步缩短垂直距离。
HBM解决的是:
计算与内存之间的数据墙。
I/O Die解决的是:
计算与外部世界之间的数据交换。
Photonic Chiplet解决的是:
如何把光通信能力直接引入芯片封装。
Optical I/O解决的是:
如何突破高速电互连的距离与能耗约束。
而Advanced Packaging最终负责:
把这一切真正装成一个可以制造、测试、散热、可靠运行的系统。
所以,下一代AI芯片真正的核心竞争力,很可能不再是一颗GPU本身。
而是:
谁能够把 Compute、Memory、Electrical I/O、Optical I/O、Thermal 和 Packaging 组合成一个整体效率最高的计算系统。
这也是为什么从现在开始研究AI产业链,不能再把“GPU、HBM、光通信、PCB、先进封装”当成六条互相独立的产业链。
它们实际上正在逐渐收敛成:
一套AI数据移动与计算基础设施。
而这套基础设施下一阶段最大的研究价值,就在于持续寻找:
哪一个物理约束正在从“可优化问题”变成“硬瓶颈”。
一旦新的硬瓶颈出现,产业价值和资本开支就会沿着新的瓶颈重新分配。
这才是从Chiplet → Photonic Chiplet → Optical I/O之后,真正值得持续跟踪的产业主线。