产棱 · IndPrism China 算力全产业链传导分析

产棱拆解 | AI数据中心的光电融合,从GPU封装内部,一直追到机柜、交换机、光纤与网络架构

产棱 技术拆解 基础设施
本文 6 节
  1. 一、AI Factory已经不是“很多GPU放在一起”
  2. GPU ↔ HBM
  3. GPU ↔ GPU
  4. Scale-Up:纵向扩展
  5. 第一条:数据循环
  6. 第二条:能量—热循环

一、AI Factory已经不是“很多GPU放在一起”

如果把传统数据中心理解成:

服务器 + 网络 + 存储 + 电力 + 空调

那么AI Factory正在变成完全不同的东西。

它更接近:

一个由数万甚至百万级计算芯片组成,并通过高速互连形成巨大分布式计算系统的“计算工厂”。

这里最重要的变化是:

GPU不再独立工作。

一块GPU计算出来的数据,很可能马上需要:

→ 传给另一块GPU

→ 传给另一台服务器

→ 传给另一台机柜

→ 经过交换机

→ 通过光纤

→ 到达另一个计算节点

所以AI Factory真正的核心问题逐渐变成:

如何让海量计算芯片之间持续、高速、低延迟、低能耗地交换数据。

这就是为什么:

GPU、HBM、CPO、Optical I/O、交换机、光纤、PCB、液冷、电力最终会汇聚到同一个问题:

数据移动。 二、先建立完整的AI Factory物理架构

可以先把整个系统从内到外画出来:

┌──────────────────────────────────────────────────────────────┐
│ AI FACTORY │
│ │
│ ┌────────────── AI Compute Cluster ────────────────┐ │
│ │ │ │
│ │ GPU/XPU GPU/XPU GPU/XPU GPU/XPU │ │
│ │ │ │ │ │ │ │
│ │ └────────────┬────────────┬────────────┘ │ │
│ │ │ │ │ │
│ │ NVLink / Die-to-Die / │ │
│ │ High-speed Interconnect │ │
│ └──────────────────────┬───────────────────────────┘ │
│ │ │
│ Network Fabric │
│ │ │
│ ┌─────────┴─────────┐ │
│ │ │ │
│ Switch ASIC Switch ASIC │
│ │ │ │
│ Optical I/O Optical I/O │
│ │ │ │
│ Fiber Fiber │
│ │ │ │
│ ───────────── Optical Network ───────────── │
│ │
│ Power Infrastructure Cooling Infrastructure │
│ ────────────────── ───────────────────── │
│ Grid → UPS → PDU CDU → Liquid Cooling │
│ → PSU → GPU → GPU │
│ │
└──────────────────────────────────────────────────────────────┘

这张图最重要的地方是:

上半部分解决数据。

下半部分解决能量和热。

而AI Factory的极限,本质上由这两条链共同决定。

三、从一个GPU内部开始追踪一条数据

假设现在GPU A产生了一批计算结果。

它需要发送给GPU B。

这批数据会经历什么?

最简单地看:

Compute Core
↓
Cache / Memory
↓
I/O
↓
SerDes
↓
Electrical / Optical
↓
Package
↓
PCB
↓
Optical Module
↓
Fiber
↓
Switch
↓
Fiber
↓
Optical Module
↓
PCB
↓
I/O
↓
GPU B

这意味着:

AI计算性能不仅由GPU计算速度决定,还由整条数据路径决定。

因此一块GPU如果计算能力提升了50%,但数据交换能力没有同步提升:

整个集群未必能得到50%的性能提升。

四、AI Factory的第一层:GPU封装

我们先回到GPU内部。

今天高端AI加速器已经不是:

GPU

而更接近:

Compute Die
+
HBM
+
I/O
+
Advanced Packaging

未来则进一步加入:

Compute
+
HBM
+
I/O Die
+
Optical I/O
+
Photonic Chiplet

于是GPU封装本身就成为第一个高速数据交换节点。

五、GPU内部其实存在两种完全不同的数据运动

第一种:

GPU ↔ HBM

这是:

Memory Traffic(内存数据流)

主要解决:

计算单元如何快速获得模型参数和中间数据。

因此核心指标是:

  1. HBM带宽
  2. 容量
  3. 延迟
  4. 每比特能耗
  5. GPU-HBM连接密度

第二种:

GPU ↔ GPU

这是:

Communication Traffic(计算节点间通信)

主要解决:

一个GPU产生的数据如何快速交给另一个GPU。

这两个问题不能混为一谈。

HBM再强:

也不能直接解决GPU之间的通信问题。

因此AI集群扩大以后:

GPU互连的重要性快速提高。

六、为什么大模型训练特别依赖GPU互连?

因为大型模型训练不是:

GPU 1独立训练
GPU 2独立训练
GPU 3独立训练

而是:

大量GPU共同完成一个计算任务。

例如一个训练任务可能被拆到:

GPU 1
GPU 2
GPU 3
...
GPU N

这些GPU之间不断交换:

  1. 梯度
  2. 参数
  3. 激活值
  4. 中间结果

于是形成巨大的:

Communication Traffic(通信流量)

因此:

GPU数量越多,网络的重要性越高。

七、这就进入第二层:Scale-Up与Scale-Out

这是理解AI Factory网络架构的关键。

Scale-Up:纵向扩展

指:

在一个高性能计算域内部,把多个GPU连接得非常紧密。

例如:

GPU ─ GPU
│ \ / │
GPU ─ GPU
│ / \ │
GPU ─ GPU

目标:

让GPU之间像一个大型计算机一样协同工作。

典型特点:

  1. 极低延迟
  2. 极高带宽
  3. 高度定制化
  4. GPU之间连接非常密集

八、Scale-Out:横向扩展

当一个Scale-Up域已经不够:

继续增加计算节点。

例如:

Cluster A
GPU GPU GPU GPU
│ │ │ │
└───┴───┴───┘
↓
Switch
↓
┌─────┴─────┐
↓ ↓
Cluster B Cluster C

这就是:

Scale-Out(横向扩展)

核心问题变成:

如何让大量服务器、机柜之间进行高效通信。

这时候:

交换机和光通信开始变得极其重要。

九、Scale-Up和Scale-Out为什么需要不同的交换机?

因为两者解决的问题不同。

Scale-Up:

GPU之间尽可能短、尽可能快地通信。

Scale-Out:

大量计算节点之间建立可扩展的网络。

所以它们的网络结构并不完全一样。

可以简单理解:

Scale-Up

GPU
│
GPU
│
GPU
│
GPU

重点:
极高带宽
极低延迟
短距离


Scale-Out

GPU Cluster
│
↓
Switch
│
↓
Switch
│
↓
GPU Cluster

重点:
规模
扩展性
网络拓扑
光互连

十、交换机到底在干什么?

交换机可以理解成:

AI Factory的数据交通调度中心。

GPU不是简单地把数据“发出去”。

它需要知道:

数据应该送到哪里。

交换机内部最核心的是:

Switch ASIC(交换芯片)

它负责:

  1. 数据包转发
  2. 路径选择
  3. 带宽调度
  4. 网络交换

而随着AI集群规模扩大:

Switch ASIC吞吐量越来越高。

这直接推动:

SerDes速度提升 → 光模块升级 → CPO / NPO → Optical I/O

十一、交换机里面为什么越来越需要光?

因为交换机ASIC的吞吐量越来越大。

假设交换芯片不断提高:

25.6T
↓
51.2T
↓
102.4T
↓
更高

每个端口的SerDes速率也不断提高。

问题就来了:

电信号从Switch ASIC跑到光模块的距离不能无限增加。

于是:

传统:

Switch ASIC
│
│ Electrical
│
PCB
│
Optical Module
│
Fiber

逐渐变成:

未来:

Switch ASIC
│
Optical Engine
│
Fiber

这就是CPO的核心逻辑。

十二、CPO真正改变的是交换机内部空间关系

CPO:

Co-Packaged Optics(共封装光学)

不是让光通信速度突然提高。

它主要解决:

缩短Switch ASIC到光引擎之间的高速电连接距离。

于是:

过去:

ASIC ─────────────── Optical Module
长电连接


CPO:

ASIC ─ Optical Engine
极短电连接

所以CPO实际上是:

交换机内部的空间架构革命。

十三、而Optical I/O又往前走了一步

CPO:

光靠近Switch ASIC。

Optical I/O:

光继续靠近Compute Die。

于是:

Pluggable
↓
CPO
↓
NPO
↓
Optical I/O
↓
Photonic Chiplet

这条路线背后的核心逻辑没有变化:

高速数据路径中,电距离越来越短,光距离越来越长。

十四、第三层:机柜

现在把视角从芯片拉出来。

一个AI机柜里可能存在:

┌──────────────────────────┐
│ GPU Server │
│ GPU GPU GPU GPU │
├──────────────────────────┤
│ GPU Server │
│ GPU GPU GPU GPU │
├──────────────────────────┤
│ Switch / Network │
├──────────────────────────┤
│ Power │
├──────────────────────────┤
│ Cooling │
└──────────────────────────┘

机柜里面实际上同时存在三套系统:

数据系统

GPU → Switch → Fiber

电力系统

Grid → UPS → PDU → PSU → GPU

热管理系统

GPU → Cold Plate → Coolant → CDU → Facility

所以:

AI机柜本质上是“数据、能量、热量”三种流体的交汇点。

十五、为什么AI机柜越来越重?

因为功率密度越来越高。

过去服务器:

几十瓦、几百瓦。

现在高性能AI服务器:

数千瓦级。

进一步到高密度AI机柜:

可能达到更高的几十千瓦甚至更高等级。

于是传统风冷逐渐遇到问题。

原因不是风扇不够大。

而是:

空气携带热量的能力有限。

十六、所以AI Factory进入第四层:液冷

液冷最核心的思想:

用液体直接把热量带走。

典型结构:

GPU
│
▼
Cold Plate
│
▼
Coolant
│
▼
CDU
│
▼
Facility Cooling

其中:

Cold Plate = 冷板

直接接触GPU等高热器件。

CDU = Coolant Distribution Unit(冷却液分配单元)

负责:

  1. 循环冷却液
  2. 热交换
  3. 流量控制
  4. 温度控制

十七、为什么液冷和Optical I/O其实存在架构关系?

因为未来:

GPU越来越热。

同时:

光学器件越来越靠近GPU。

于是出现冲突:

GPU
高热区域
│
┌─────┴─────┐
│ │
HBM Optical
│
Laser

Laser通常比数字逻辑更怕热。

所以:

未来光电融合不仅是信号问题,也是热设计问题。

这会直接影响Optical I/O的实际封装位置。

十八、第五层:PCB正在发生什么?

很多人会误以为:

光通信发展以后PCB就没用了。

实际上恰恰相反。

PCB依然负责:

  1. 电源
  2. 控制
  3. 管理
  4. 高速电连接
  5. 芯片之间连接
  6. 服务器内部连接

变化只是:

最高速、最难跑的那部分电连接逐渐向光转移。

因此未来可能形成:

Optical
│
GPU ───────────── Fiber
│
│ Electrical
↓
PCB
│
↓
Power / Control / Management

所以PCB不会消失。

而是:

高速电连接结构发生重新分配。

十九、这对PCB/CCL意味着什么?

随着高速SerDes继续升级:

PCB和CCL需要解决:

  1. 高频损耗
  2. 介电损耗
  3. 插入损耗
  4. 阻抗控制
  5. 信号完整性
  6. 热可靠性

因此:

M8 / M9等更高等级CCL

本质上是在解决:

越来越高速的电信号还能不能可靠跑过PCB。

这和Optical I/O其实是同一条技术演进链上的不同阶段。

二十、为什么“光”不会马上完全替代PCB?

因为距离不同。

可以粗略理解:

芯片内部
│
│ 电
▼
Chiplet
│
│ 电
▼
Package
│
│ 电
▼
PCB
│
│
│ 到达某个距离后
│
▼
光
│
▼
Fiber

所以真正的趋势不是:

Electrical → Optical

而是:

Electrical Distance不断缩短,Optical Distance不断扩大。

二十一、第六层:光纤开始成为AI Factory的“神经系统”

当AI Factory达到巨大规模以后:

机柜之间的数据最终需要通过:

Fiber(光纤)

传播。

于是整个AI Factory可能形成:

GPU
↓
Switch
↓
Optical Engine
↓
Fiber
↓
Switch
↓
GPU Cluster

如果把GPU比作:

神经元

那么光纤网络就非常接近:

神经系统。

而交换机就是:

神经系统中的路由节点。

二十二、真正值得关注的不是“光纤数量”,而是带宽密度

随着AI集群规模扩大:

需要的不是简单的更多光纤。

而是:

单位空间里越来越大的数据吞吐量。

于是产生一个非常重要的概念:

Bandwidth Density(带宽密度)

例如:

每个机柜
每个交换机
每毫米封装边缘
每根光纤
每个端口

能够承载多少数据。

未来甚至可能出现:

Fiber Density Wall(光纤密度墙)

也就是:

不是网络带宽不够,而是物理上已经没有足够空间塞下更多光纤和连接器。

二十三、这会推动光学进一步进入封装

现在可以理解为什么:

CPO → NPO → Optical I/O → Photonic Chiplet

并不是几个孤立技术。

而是一条连续的物理演进。

因为:

网络带宽增加

↓

光端口增加

↓

电连接越来越困难

↓

光引擎越来越靠近ASIC

↓

再靠近Compute

↓

光学进入Package

↓

Photonic Chiplet出现

二十四、第七层:电力

现在把另外一条链拉出来。

AI Factory不仅是数据工厂。

它也是:

巨大的电力转换系统。

完整路径可以写成:

Power Grid
↓
Substation
↓
UPS
↓
PDU
↓
Rack Power
↓
PSU
↓
GPU

每一层都会产生损耗。

因此真正重要的指标之一:

Power Usage Effectiveness,以及整个计算系统的有效计算能耗。

但对于AI来说,还要进一步关注:

每单位有效计算和每单位数据移动需要多少能量。

二十五、为什么电力和光通信最终会汇聚?

因为:

数据移动需要电。

即使最终使用光:

光也需要:

  1. Laser
  2. Driver
  3. TIA
  4. DSP
  5. Switch ASIC
  6. SerDes
  7. 电源

因此:

光通信并不是“不要电了”。

恰恰相反:

光电转换本身也需要大量电力。

所以真正应该关注:

Energy per Bit(每比特能耗)

而不是简单地问:

“电还是光?”

二十六、AI Factory实际上存在两条主循环

到这里可以把整个系统简化成两个循环。

第一条:数据循环

Compute
↓
Memory
↓
I/O
↓
Switch
↓
Optical
↓
Fiber
↓
Switch
↓
I/O
↓
Compute

这是:

Data Loop(数据循环)

第二条:能量—热循环

Grid
↓
Power Conversion
↓
GPU
↓
Heat
↓
Cooling
↓
Facility

这是:

Energy/Thermal Loop(能量—热循环)

最终:

AI Factory的规模上限,就是这两条循环共同决定的。

二十七、真正的AI Factory物理架构图

把前面的所有层级合在一起:

AI FACTORY
│
┌─────────────────────┴─────────────────────┐
│ │
DATA PLANE POWER / THERMAL
│ │
│ │
┌────▼────┐ Power Grid
│ GPU/XPU │ │
└────┬────┘ ▼
│ UPS
┌─────┼─────┐ │
│ │ │ ▼
HBM I/O Compute PDU / PSU
│ │ │ │
│ │ │ ▼
│ │ SerDes GPU
│ │ │ │
│ │ ▼ ▼
│ │ Electrical Heat
│ │ │ │
│ ▼ │ Liquid
│ Optical │ Cooling
│ I/O │ │
│ │ │ ▼
│ ▼ │ CDU
│ Fiber │
│ │ │
└─────┼─────┘
│
Switch ASIC
│
Optical Engine
│
Fiber
│
Network Fabric
│
Other GPU Clusters

这张图实际上已经把:

GPU / HBM / Chiplet / CPO / Optical I/O / Switch / PCB / CCL / Fiber / Liquid Cooling / Power

放进了同一个系统。

二十八、最重要的不是产业链,而是“瓶颈迁移”

现在再回头看整个AI Factory。

最初:

GPU算力不够。

于是:

先进制程。

然后:

GPU吃不到足够数据。

于是:

HBM。

然后:

GPU之间数据交换越来越慢。

于是:

高速互连。

然后:

电连接损耗越来越高。

于是:

CPO。

然后:

Switch ASIC越来越快,光模块距离仍然太远。

于是:

NPO / Optical I/O。

然后:

光学进入封装以后遇到热、耦合和制造问题。

于是:

Photonic Chiplet + Advanced Packaging。

然后:

AI Factory功率密度越来越高。

于是:

Liquid Cooling。

然后:

数据中心需要更多电。

于是:

HVDC / 电力基础设施 / 配电系统。

这就是完整的:

AI Factory Bottleneck Migration 二十九、因此未来AI产业研究应该建立一条“物理传导链”

例如:

如果发现:

GPU集群规模继续扩大

那么不能直接跳到:

“某光通信公司受益。”

应该沿着物理链条往下推:

GPU数量增加
↓
GPU间通信增加
↓
Network Traffic增加
↓
Switch吞吐量增加
↓
SerDes升级
↓
Electrical Loss增加
↓
Optical Adoption提高
↓
Optical Engine需求增加
↓
Fiber需求增加
↓
Power增加
↓
Cooling需求增加
↓
Rack Density提高
↓
Liquid Cooling需求增加

这才是真正的:

产业传导。

三十、反过来也可以从瓶颈向上推

例如:

发现:

某一代AI服务器已经出现严重的电力密度问题。

那么往上推:

电力不足

↓

机柜功率受限

↓

GPU数量无法继续增加

↓

计算密度受限

↓

AI集群扩张速度受限

那么这个时候:

真正的瓶颈可能已经不再是GPU。

而是:

Power Delivery / Cooling。

这就是产业研究中最重要的一个思想:

不能永远盯着最耀眼的产品。必须寻找整个系统最紧的约束。

三十一、未来AI Factory可能出现的“六堵墙”

综合前面的研究,可以暂时把未来AI Factory的主要物理约束分成六类。

第一堵墙:Compute Wall

计算能力不足。

解决:

先进制程、Chiplet、架构创新。

第二堵墙:Memory Wall

计算单元无法获得足够数据。

解决:

HBM、3D Memory、Cache。

第三堵墙:I/O Wall

GPU之间数据交换速度跟不上。

解决:

高速SerDes、先进互连、Optical I/O。

第四堵墙:Optical Wall

光已经进入系统,但:

  1. 耦合
  2. Laser
  3. Fiber
  4. Packaging

成为限制。

第五堵墙:Thermal Wall

计算密度继续增加,但热无法有效带走。

解决:

液冷、冷板、CDU、浸没式冷却等。

第六堵墙:Power Wall

最终整个系统需要的电力超过基础设施供给能力。

解决:

更高效的电源架构、HVDC、配电系统、电网扩容以及更高能效的计算。

三十二、这六堵墙并不是同时出现

这才是产业研究最重要的地方。

它们存在一个动态关系:

Compute
↓
Memory
↓
I/O
↓
Optical
↓
Thermal
↓
Power

但是并不是固定顺序。

当某一个瓶颈被技术突破以后:

系统约束就会移动到下一层。

因此:

AI产业永远不是“一个赛道长期受益”。

而是:

随着系统约束不断迁移,资本开支和产业价值不断向新的瓶颈迁移。

三十三、这就是AI Factory真正的“产业世界模型”

如果把我们前面所有文章放在一起:

第一层

GPU / XPU

解决:

Compute

第二层

HBM

解决:

Memory Bandwidth

第三层

Chiplet / Advanced Packaging

解决:

内部连接与系统集成

第四层

SerDes / Switch ASIC

解决:

高速数据交换

第五层

CPO / Optical Engine

解决:

高速电连接距离

第六层

Optical I/O / Photonic Chiplet

解决:

Compute与Network之间的光电融合

第七层

Fiber / Network Fabric

解决:

大规模GPU集群通信

第八层

Liquid Cooling

解决:

高密度热管理

第九层

Power Delivery / HVDC

解决:

AI Factory能源供给

最终:

COMPUTE
│
▼
MEMORY
│
▼
I/O
│
▼
OPTICAL
│
▼
NETWORK
│
▼
AI FACTORY
│
┌───────┴───────┐
▼ ▼
POWER THERMAL

这已经不是单独研究某一个产业。

而是在研究:

AI计算基础设施的完整物理世界。

三十四、最终结论

未来AI Factory最值得研究的,不是:

GPU是不是更快。

而是:

当计算规模不断扩大以后,整个系统的哪一个物理环节首先成为约束?

GPU提高算力以后:

HBM必须跟上。

HBM跟上以后:

GPU之间通信必须跟上。

通信跟上以后:

电连接开始承压。

电连接承压以后:

光开始进入封装。

光进入封装以后:

热、耦合、封装、Laser成为新的问题。

计算密度继续增加以后:

液冷成为基础设施。

功率继续增加以后:

电力基础设施成为最终约束。

因此:

AI Factory不是一条产业链。

而是一条不断发生“瓶颈迁移”的物理系统。

真正的产业机会,也不是简单来自:

“AI增长 → 所有AI产业链都受益。”

而是来自:

AI规模继续扩张时,下一堵真正不可绕开的墙在哪里?

谁解决这堵墙,谁就进入系统的关键位置。

而当这堵墙被解决以后:

下一堵墙又会出现。

这就是从GPU → HBM → CPO → Optical I/O → Photonic Chiplet → Network → Liquid Cooling → Power Infrastructure整个产业链背后的统一逻辑。

从这个角度看,AI Factory实际上可以被理解成一个不断演化的:

Compute → Memory → Communication → Optical → Thermal → Power 的耦合系统。

而未来真正值得持续跟踪的,不是“AI还有多少故事”。

而是:

AI算力每扩大一个数量级,哪一个物理约束最先变成硬约束?

这才是AI产业链研究进入下一阶段以后,最核心的问题。

这一篇真正串起来了:GPU/HBM解决“算”,CPO/Optical I/O解决“传”,交换机/光纤解决“组网”,液冷解决“热”,电力系统解决“能量”。