产棱拆解 | AI数据中心的光电融合,从GPU封装内部,一直追到机柜、交换机、光纤与网络架构
一、AI Factory已经不是“很多GPU放在一起”
如果把传统数据中心理解成:
服务器 + 网络 + 存储 + 电力 + 空调
那么AI Factory正在变成完全不同的东西。
它更接近:
一个由数万甚至百万级计算芯片组成,并通过高速互连形成巨大分布式计算系统的“计算工厂”。
这里最重要的变化是:
GPU不再独立工作。
一块GPU计算出来的数据,很可能马上需要:
→ 传给另一块GPU
→ 传给另一台服务器
→ 传给另一台机柜
→ 经过交换机
→ 通过光纤
→ 到达另一个计算节点
所以AI Factory真正的核心问题逐渐变成:
如何让海量计算芯片之间持续、高速、低延迟、低能耗地交换数据。
这就是为什么:
GPU、HBM、CPO、Optical I/O、交换机、光纤、PCB、液冷、电力最终会汇聚到同一个问题:
数据移动。 二、先建立完整的AI Factory物理架构
可以先把整个系统从内到外画出来:
这张图最重要的地方是:
上半部分解决数据。
下半部分解决能量和热。
而AI Factory的极限,本质上由这两条链共同决定。
三、从一个GPU内部开始追踪一条数据
假设现在GPU A产生了一批计算结果。
它需要发送给GPU B。
这批数据会经历什么?
最简单地看:
这意味着:
AI计算性能不仅由GPU计算速度决定,还由整条数据路径决定。
因此一块GPU如果计算能力提升了50%,但数据交换能力没有同步提升:
整个集群未必能得到50%的性能提升。
四、AI Factory的第一层:GPU封装
我们先回到GPU内部。
今天高端AI加速器已经不是:
而更接近:
未来则进一步加入:
于是GPU封装本身就成为第一个高速数据交换节点。
五、GPU内部其实存在两种完全不同的数据运动
第一种:
GPU ↔ HBM
这是:
Memory Traffic(内存数据流)
主要解决:
计算单元如何快速获得模型参数和中间数据。
因此核心指标是:
- HBM带宽
- 容量
- 延迟
- 每比特能耗
- GPU-HBM连接密度
第二种:
GPU ↔ GPU
这是:
Communication Traffic(计算节点间通信)
主要解决:
一个GPU产生的数据如何快速交给另一个GPU。
这两个问题不能混为一谈。
HBM再强:
也不能直接解决GPU之间的通信问题。
因此AI集群扩大以后:
GPU互连的重要性快速提高。
六、为什么大模型训练特别依赖GPU互连?
因为大型模型训练不是:
GPU 1独立训练
GPU 2独立训练
GPU 3独立训练
而是:
大量GPU共同完成一个计算任务。
例如一个训练任务可能被拆到:
这些GPU之间不断交换:
- 梯度
- 参数
- 激活值
- 中间结果
于是形成巨大的:
Communication Traffic(通信流量)
因此:
GPU数量越多,网络的重要性越高。
七、这就进入第二层:Scale-Up与Scale-Out
这是理解AI Factory网络架构的关键。
Scale-Up:纵向扩展
指:
在一个高性能计算域内部,把多个GPU连接得非常紧密。
例如:
目标:
让GPU之间像一个大型计算机一样协同工作。
典型特点:
- 极低延迟
- 极高带宽
- 高度定制化
- GPU之间连接非常密集
八、Scale-Out:横向扩展
当一个Scale-Up域已经不够:
继续增加计算节点。
例如:
这就是:
Scale-Out(横向扩展)
核心问题变成:
如何让大量服务器、机柜之间进行高效通信。
这时候:
交换机和光通信开始变得极其重要。
九、Scale-Up和Scale-Out为什么需要不同的交换机?
因为两者解决的问题不同。
Scale-Up:
GPU之间尽可能短、尽可能快地通信。
Scale-Out:
大量计算节点之间建立可扩展的网络。
所以它们的网络结构并不完全一样。
可以简单理解:
十、交换机到底在干什么?
交换机可以理解成:
AI Factory的数据交通调度中心。
GPU不是简单地把数据“发出去”。
它需要知道:
数据应该送到哪里。
交换机内部最核心的是:
Switch ASIC(交换芯片)
它负责:
- 数据包转发
- 路径选择
- 带宽调度
- 网络交换
而随着AI集群规模扩大:
Switch ASIC吞吐量越来越高。
这直接推动:
SerDes速度提升 → 光模块升级 → CPO / NPO → Optical I/O
十一、交换机里面为什么越来越需要光?
因为交换机ASIC的吞吐量越来越大。
假设交换芯片不断提高:
每个端口的SerDes速率也不断提高。
问题就来了:
电信号从Switch ASIC跑到光模块的距离不能无限增加。
于是:
逐渐变成:
这就是CPO的核心逻辑。
十二、CPO真正改变的是交换机内部空间关系
CPO:
Co-Packaged Optics(共封装光学)
不是让光通信速度突然提高。
它主要解决:
缩短Switch ASIC到光引擎之间的高速电连接距离。
于是:
所以CPO实际上是:
交换机内部的空间架构革命。
十三、而Optical I/O又往前走了一步
CPO:
光靠近Switch ASIC。
Optical I/O:
光继续靠近Compute Die。
于是:
这条路线背后的核心逻辑没有变化:
高速数据路径中,电距离越来越短,光距离越来越长。
十四、第三层:机柜
现在把视角从芯片拉出来。
一个AI机柜里可能存在:
机柜里面实际上同时存在三套系统:
数据系统
GPU → Switch → Fiber
电力系统
Grid → UPS → PDU → PSU → GPU
热管理系统
GPU → Cold Plate → Coolant → CDU → Facility
所以:
AI机柜本质上是“数据、能量、热量”三种流体的交汇点。
十五、为什么AI机柜越来越重?
因为功率密度越来越高。
过去服务器:
几十瓦、几百瓦。
现在高性能AI服务器:
数千瓦级。
进一步到高密度AI机柜:
可能达到更高的几十千瓦甚至更高等级。
于是传统风冷逐渐遇到问题。
原因不是风扇不够大。
而是:
空气携带热量的能力有限。
十六、所以AI Factory进入第四层:液冷
液冷最核心的思想:
用液体直接把热量带走。
典型结构:
其中:
Cold Plate = 冷板
直接接触GPU等高热器件。
CDU = Coolant Distribution Unit(冷却液分配单元)
负责:
- 循环冷却液
- 热交换
- 流量控制
- 温度控制
十七、为什么液冷和Optical I/O其实存在架构关系?
因为未来:
GPU越来越热。
同时:
光学器件越来越靠近GPU。
于是出现冲突:
Laser通常比数字逻辑更怕热。
所以:
未来光电融合不仅是信号问题,也是热设计问题。
这会直接影响Optical I/O的实际封装位置。
十八、第五层:PCB正在发生什么?
很多人会误以为:
光通信发展以后PCB就没用了。
实际上恰恰相反。
PCB依然负责:
- 电源
- 控制
- 管理
- 高速电连接
- 芯片之间连接
- 服务器内部连接
变化只是:
最高速、最难跑的那部分电连接逐渐向光转移。
因此未来可能形成:
所以PCB不会消失。
而是:
高速电连接结构发生重新分配。
十九、这对PCB/CCL意味着什么?
随着高速SerDes继续升级:
PCB和CCL需要解决:
- 高频损耗
- 介电损耗
- 插入损耗
- 阻抗控制
- 信号完整性
- 热可靠性
因此:
M8 / M9等更高等级CCL
本质上是在解决:
越来越高速的电信号还能不能可靠跑过PCB。
这和Optical I/O其实是同一条技术演进链上的不同阶段。
二十、为什么“光”不会马上完全替代PCB?
因为距离不同。
可以粗略理解:
所以真正的趋势不是:
Electrical → Optical
而是:
Electrical Distance不断缩短,Optical Distance不断扩大。
二十一、第六层:光纤开始成为AI Factory的“神经系统”
当AI Factory达到巨大规模以后:
机柜之间的数据最终需要通过:
Fiber(光纤)
传播。
于是整个AI Factory可能形成:
如果把GPU比作:
神经元
那么光纤网络就非常接近:
神经系统。
而交换机就是:
神经系统中的路由节点。
二十二、真正值得关注的不是“光纤数量”,而是带宽密度
随着AI集群规模扩大:
需要的不是简单的更多光纤。
而是:
单位空间里越来越大的数据吞吐量。
于是产生一个非常重要的概念:
Bandwidth Density(带宽密度)
例如:
能够承载多少数据。
未来甚至可能出现:
Fiber Density Wall(光纤密度墙)
也就是:
不是网络带宽不够,而是物理上已经没有足够空间塞下更多光纤和连接器。
二十三、这会推动光学进一步进入封装
现在可以理解为什么:
CPO → NPO → Optical I/O → Photonic Chiplet
并不是几个孤立技术。
而是一条连续的物理演进。
因为:
网络带宽增加
↓
光端口增加
↓
电连接越来越困难
↓
光引擎越来越靠近ASIC
↓
再靠近Compute
↓
光学进入Package
↓
Photonic Chiplet出现
二十四、第七层:电力
现在把另外一条链拉出来。
AI Factory不仅是数据工厂。
它也是:
巨大的电力转换系统。
完整路径可以写成:
每一层都会产生损耗。
因此真正重要的指标之一:
Power Usage Effectiveness,以及整个计算系统的有效计算能耗。
但对于AI来说,还要进一步关注:
每单位有效计算和每单位数据移动需要多少能量。
二十五、为什么电力和光通信最终会汇聚?
因为:
数据移动需要电。
即使最终使用光:
光也需要:
- Laser
- Driver
- TIA
- DSP
- Switch ASIC
- SerDes
- 电源
因此:
光通信并不是“不要电了”。
恰恰相反:
光电转换本身也需要大量电力。
所以真正应该关注:
Energy per Bit(每比特能耗)
而不是简单地问:
“电还是光?”
二十六、AI Factory实际上存在两条主循环
到这里可以把整个系统简化成两个循环。
第一条:数据循环
这是:
Data Loop(数据循环)
第二条:能量—热循环
这是:
Energy/Thermal Loop(能量—热循环)
最终:
AI Factory的规模上限,就是这两条循环共同决定的。
二十七、真正的AI Factory物理架构图
把前面的所有层级合在一起:
这张图实际上已经把:
GPU / HBM / Chiplet / CPO / Optical I/O / Switch / PCB / CCL / Fiber / Liquid Cooling / Power
放进了同一个系统。
二十八、最重要的不是产业链,而是“瓶颈迁移”
现在再回头看整个AI Factory。
最初:
GPU算力不够。
于是:
先进制程。
然后:
GPU吃不到足够数据。
于是:
HBM。
然后:
GPU之间数据交换越来越慢。
于是:
高速互连。
然后:
电连接损耗越来越高。
于是:
CPO。
然后:
Switch ASIC越来越快,光模块距离仍然太远。
于是:
NPO / Optical I/O。
然后:
光学进入封装以后遇到热、耦合和制造问题。
于是:
Photonic Chiplet + Advanced Packaging。
然后:
AI Factory功率密度越来越高。
于是:
Liquid Cooling。
然后:
数据中心需要更多电。
于是:
HVDC / 电力基础设施 / 配电系统。
这就是完整的:
AI Factory Bottleneck Migration 二十九、因此未来AI产业研究应该建立一条“物理传导链”
例如:
如果发现:
GPU集群规模继续扩大
那么不能直接跳到:
“某光通信公司受益。”
应该沿着物理链条往下推:
这才是真正的:
产业传导。
三十、反过来也可以从瓶颈向上推
例如:
发现:
某一代AI服务器已经出现严重的电力密度问题。
那么往上推:
电力不足
↓
机柜功率受限
↓
GPU数量无法继续增加
↓
计算密度受限
↓
AI集群扩张速度受限
那么这个时候:
真正的瓶颈可能已经不再是GPU。
而是:
Power Delivery / Cooling。
这就是产业研究中最重要的一个思想:
不能永远盯着最耀眼的产品。必须寻找整个系统最紧的约束。
三十一、未来AI Factory可能出现的“六堵墙”
综合前面的研究,可以暂时把未来AI Factory的主要物理约束分成六类。
第一堵墙:Compute Wall
计算能力不足。
解决:
先进制程、Chiplet、架构创新。
第二堵墙:Memory Wall
计算单元无法获得足够数据。
解决:
HBM、3D Memory、Cache。
第三堵墙:I/O Wall
GPU之间数据交换速度跟不上。
解决:
高速SerDes、先进互连、Optical I/O。
第四堵墙:Optical Wall
光已经进入系统,但:
- 耦合
- Laser
- Fiber
- Packaging
成为限制。
第五堵墙:Thermal Wall
计算密度继续增加,但热无法有效带走。
解决:
液冷、冷板、CDU、浸没式冷却等。
第六堵墙:Power Wall
最终整个系统需要的电力超过基础设施供给能力。
解决:
更高效的电源架构、HVDC、配电系统、电网扩容以及更高能效的计算。
三十二、这六堵墙并不是同时出现
这才是产业研究最重要的地方。
它们存在一个动态关系:
但是并不是固定顺序。
当某一个瓶颈被技术突破以后:
系统约束就会移动到下一层。
因此:
AI产业永远不是“一个赛道长期受益”。
而是:
随着系统约束不断迁移,资本开支和产业价值不断向新的瓶颈迁移。
三十三、这就是AI Factory真正的“产业世界模型”
如果把我们前面所有文章放在一起:
第一层
GPU / XPU
解决:
Compute
第二层
HBM
解决:
Memory Bandwidth
第三层
Chiplet / Advanced Packaging
解决:
内部连接与系统集成
第四层
SerDes / Switch ASIC
解决:
高速数据交换
第五层
CPO / Optical Engine
解决:
高速电连接距离
第六层
Optical I/O / Photonic Chiplet
解决:
Compute与Network之间的光电融合
第七层
Fiber / Network Fabric
解决:
大规模GPU集群通信
第八层
Liquid Cooling
解决:
高密度热管理
第九层
Power Delivery / HVDC
解决:
AI Factory能源供给
最终:
这已经不是单独研究某一个产业。
而是在研究:
AI计算基础设施的完整物理世界。
三十四、最终结论
未来AI Factory最值得研究的,不是:
GPU是不是更快。
而是:
当计算规模不断扩大以后,整个系统的哪一个物理环节首先成为约束?
GPU提高算力以后:
HBM必须跟上。
HBM跟上以后:
GPU之间通信必须跟上。
通信跟上以后:
电连接开始承压。
电连接承压以后:
光开始进入封装。
光进入封装以后:
热、耦合、封装、Laser成为新的问题。
计算密度继续增加以后:
液冷成为基础设施。
功率继续增加以后:
电力基础设施成为最终约束。
因此:
AI Factory不是一条产业链。
而是一条不断发生“瓶颈迁移”的物理系统。
真正的产业机会,也不是简单来自:
“AI增长 → 所有AI产业链都受益。”
而是来自:
AI规模继续扩张时,下一堵真正不可绕开的墙在哪里?
谁解决这堵墙,谁就进入系统的关键位置。
而当这堵墙被解决以后:
下一堵墙又会出现。
这就是从GPU → HBM → CPO → Optical I/O → Photonic Chiplet → Network → Liquid Cooling → Power Infrastructure整个产业链背后的统一逻辑。
从这个角度看,AI Factory实际上可以被理解成一个不断演化的:
Compute → Memory → Communication → Optical → Thermal → Power 的耦合系统。
而未来真正值得持续跟踪的,不是“AI还有多少故事”。
而是:
AI算力每扩大一个数量级,哪一个物理约束最先变成硬约束?
这才是AI产业链研究进入下一阶段以后,最核心的问题。
这一篇真正串起来了:GPU/HBM解决“算”,CPO/Optical I/O解决“传”,交换机/光纤解决“组网”,液冷解决“热”,电力系统解决“能量”。