产棱 · IndPrism China 算力全产业链传导分析

产棱拆解 | Scale-up 与 Scale-out 交换机深度拆解

产棱 技术拆解 高速互联

产棱·IndPrism 深度拆解

从 GPU 互联、交换芯片到光通信与 AI Factory 网络瓶颈

本文 16 节
  1. 一、为什么 AI 算力越大,网络越重要
  2. 二、先建立完整的 AI 网络分层
  3. 三、Scale-up:把 GPU 做成一个更大的计算域
  4. 四、Scale-out:把计算岛连接成 AI Factory
  5. 五、Scale-up 与 Scale-out 的真正区别
  6. 六、为什么 Scale-out 对光通信产业拉动更强
  7. 七、800G 与 1.6T 为什么成为关键观察变量
  8. 八、交换芯片:整个网络的核心瓶颈之一
  9. 九、SerDes:交换机升级背后的关键工程变量
  10. 十、交换机为什么会成为 AI Factory 的电力与散热问题
  11. 十一、Scale-up 与 Scale-out 的产业链映射
  12. 十二、真正需要警惕的不是“交换机卖得多”,而是网络瓶颈转移
  13. 十三、AI Factory 中的完整传导链
  14. 十四、研究交换机时最重要的跟踪变量
  15. 十五、最终判断:Scale-up 与 Scale-out 是两条不同的产业逻辑
  16. 附录:一张图理解两套体系

核心结论:Scale-up 与 Scale-out 并不是同一种“交换机”在不同规模下的简单变化,而是 AI 集群中两套不同的通信体系。Scale-up 解决的是一个高性能计算域内部的加速器互联问题,目标是让更多 GPU/加速器形成高带宽、低延迟的统一计算域;Scale-out 解决的是计算域之间以及大规模服务器之间的网络扩展问题,目标是把数百、数千乃至更大规模的计算节点组织成可运行的大型 AI 集群。两者最终都会影响 GPU 利用率,但瓶颈、拓扑、交换芯片、光互联比例、协议栈以及产业链拉动方式存在明显差异。

一、为什么 AI 算力越大,网络越重要

AI 训练并不是简单地把更多 GPU 堆在一起。随着模型规模、参数量、上下文长度和训练数据规模持续扩大,单颗 GPU 的计算能力已经不能独立完成任务。大量 GPU 必须持续交换梯度、激活值、参数以及中间状态。因此,AI Factory 的有效算力不仅由 GPU TOPS/FLOPS 决定,还取决于 GPU 是否能够持续获得数据,以及不同 GPU 之间能否以足够低的通信成本完成同步。

当通信成为限制因素时,会出现一个非常重要的现象:理论 GPU 算力继续增加,但有效训练吞吐量并不同比例增加。因此,AI 网络的核心价值并不是“传输数据”这么简单,而是尽可能降低计算单元等待通信的时间。

二、先建立完整的 AI 网络分层

可以把大型 AI Factory 的通信体系粗略理解为三个层次:

  1. 第一层:加速器内部互联——GPU 与 HBM、GPU 与 GPU 之间的数据移动。
  2. 第二层:Scale-up——在一个高性能计算域内,将多颗 GPU/加速器组成高带宽计算岛。
  3. 第三层:Scale-out——把多个计算节点、机架、Pod/计算岛进一步连接成大型 AI 集群。

需要特别注意:不同厂商的系统边界并不完全一致。例如某些架构会把交换芯片放在 GPU 基板、服务器、机箱或机架级网络中,因此不能仅根据设备外形判断其属于 Scale-up 还是 Scale-out。真正应该看的是:它连接什么对象、采用什么协议、承担什么通信任务。

三、Scale-up:把 GPU 做成一个更大的计算域

Scale-up 的核心思想是:不是先考虑如何把整个数据中心连接起来,而是先让一个计算域内部的 GPU 尽可能高效地协同。

例如一个训练任务被切分到多颗 GPU 上,每颗 GPU 都需要频繁读取其他 GPU 的数据。如果这些通信需要经过普通数据中心网络,延迟和协议开销会显著增加。Scale-up 因此采用更专用、更紧密的互联方式。

典型逻辑可以表示为:

GPU → 高速互联 → Scale-up Switch → 高速互联 → GPU

3.1 Scale-up 的核心指标

指标为什么重要产业含义
带宽决定 GPU 之间单位时间可以交换多少数据推动高速 SerDes、交换芯片和先进封装
延迟影响同步和集合通信效率推动专用互联架构
端口密度决定一个交换域可以容纳多少加速器推动高速 I/O 和封装
拓扑决定通信路径和拥塞情况决定交换机数量与互联方式
集合通信效率决定训练中 GPU 是否需要等待直接影响有效算力

3.2 为什么 Scale-up 交换机不是普通以太网交换机

普通数据中心交换机首先追求网络的开放性、可扩展性和标准化;而 Scale-up 更强调加速器之间的确定性、高带宽和低延迟。因此其交换芯片、协议、链路设计以及软件栈通常围绕特定加速器生态进行优化。

这意味着研究 Scale-up 不能只看“交换机市场有多大”,而应该追踪每一代加速器平台中:单节点 GPU 数量、GPU 间带宽、交换芯片带宽、交换芯片数量、每 GPU 对外 I/O、链路距离以及拓扑变化。

四、Scale-out:把计算岛连接成 AI Factory

Scale-out 的目标与 Scale-up 不同:当单个计算域已经不能容纳整个训练任务时,需要把多个计算节点乃至多个计算域连接起来。此时网络从“计算域内部互联”变成“整个集群的网络基础设施”。

典型结构可以抽象为:

GPU/服务器 → ToR/Leaf → Spine → Leaf/ToR → GPU/服务器

在超大规模 AI 集群中,还可能形成多层 Clos/Fabric。随着节点数量增加,交换机、光模块、光纤和端口数量会快速增加。

4.1 Scale-out 的核心指标

指标核心问题产业链
交换容量整个 Fabric 能否承载大规模通信交换芯片
端口速率400G/800G/1.6T 等代际升级SerDes、光模块
端口数量决定网络规模上限交换机、光器件
拥塞控制避免热点流量拖慢训练交换芯片+网络软件
RDMA降低数据搬运开销NIC、交换机、软件栈
故障恢复大规模集群必须控制故障域网络架构与管理软件

五、Scale-up 与 Scale-out 的真正区别

维度Scale-upScale-out核心瓶颈
连接对象GPU/加速器之间服务器/计算域之间通信层级
目标形成高带宽计算域扩大集群规模规模与效率平衡
网络特征专用、紧密、低延迟开放、可扩展、大规模拓扑
光通信通常相对有限需求显著距离与端口数量
交换芯片加速器互联导向数据中心网络导向协议与生态
典型瓶颈GPU 间通信Fabric 带宽与拥塞网络效率
扩容方式增加计算域内部互联能力增加节点/机架/Pod网络规模

六、为什么 Scale-out 对光通信产业拉动更强

这是理解 AI 光通信产业最重要的一点之一。Scale-up 可以在非常短的距离内使用铜互联、板级互联或专用高速互联;而 Scale-out 随着网络规模扩大,链路距离从板内、机内逐渐扩展到服务器、机架、机柜甚至数据中心不同区域。

距离一旦增加,高速电信号在 PCB、连接器和线缆中的损耗迅速上升。为了继续维持 400G、800G 乃至更高的数据速率,系统会越来越依赖光电转换。因此,大规模 Scale-out 网络天然会产生大量光模块需求。

产业传导可以概括为:

AI 集群规模扩大 → GPU/服务器数量增加 → 网络端口增加 → 交换机数量增加 → 单端口速率提升 → 光模块数量与速率升级 → 光芯片/DSP/EML/VCSEL/硅光/连接器/光纤需求增加。

七、800G 与 1.6T 为什么成为关键观察变量

当 GPU 集群规模扩大以后,网络带宽不能长期停留在低速率。否则交换机端口数量会快速膨胀,机架空间、功耗和布线复杂度都会成为瓶颈。因此,网络升级通常同时沿两个方向发生:增加端口数量,以及提高单端口速率。

提高单端口速率的结果是:同样数量的 GPU,可以用更少的物理端口完成通信;但代价是 SerDes、光模块、交换芯片、PCB、连接器以及散热系统都需要升级。

因此,研究 800G/1.6T 不能只看光模块价格,而要观察整个网络架构是否正在发生代际迁移。

八、交换芯片:整个网络的核心瓶颈之一

无论 Scale-up 还是 Scale-out,交换芯片都是核心器件,但两者的设计目标不同。

Scale-up 交换芯片需要围绕加速器互联协议、低延迟和集合通信优化;Scale-out 交换芯片则需要面对大量端口、高 SerDes 速率、缓存、拥塞控制、ECMP/RDMA 等问题。

当交换芯片从 12.8T、25.6T、51.2T 继续向更高交换容量演进时,单芯片功耗、SerDes 信号完整性、封装、散热以及 PCB 材料都会成为工程约束。

因此,交换芯片升级并不是单独发生的:交换容量提升 → SerDes 速率提升 → 封装与 PCB 要求提升 → 光模块速率提升 → 功耗提升 → 散热升级。

九、SerDes:交换机升级背后的关键工程变量

高速交换机的一个核心工程问题,是如何在有限功耗和信号完整性约束下,把每个 SerDes lane 的速率不断提高。

当单 lane 速率提升时,PCB 走线、连接器、封装基板、线缆以及光电接口都会面临更严格的损耗和串扰要求。因此,高速交换机实际上是一个由交换芯片、封装、PCB、连接器、光模块、散热共同构成的系统工程。

十、交换机为什么会成为 AI Factory 的电力与散热问题

AI 网络并不是免费的。交换芯片、NIC、光模块和光电转换都会消耗功率。随着端口速率提高,网络设备的功耗逐渐成为数据中心设计的重要变量。

于是会形成另一条产业传导:

GPU 功率提升 + 交换芯片功率提升 + 光模块数量增加 → 机架功率密度提升 → 液冷需求增加 → CDU/冷板/管路升级 → 数据中心供电与配电系统升级。

这说明交换机并不是孤立的“网络设备”,它最终会反馈到 AI Factory 的电力和液冷系统。

十一、Scale-up 与 Scale-out 的产业链映射

产业环节Scale-up 影响Scale-out 影响需要跟踪的变量
GPU/加速器非常高非常高GPU 数量、互联带宽
交换芯片专用互联导向数据中心交换导向交换容量、SerDes
光模块视架构而定非常高400G/800G/1.6T 渗透
PCB/CCL高速低损耗高速高层数/高密度材料、层数、损耗
连接器/线缆高速短距大量高速链路速率、距离、数量
NIC/DPU专用互联/平台相关非常关键RDMA、卸载能力
液冷高功率节点推动高密度网络推动功率密度
电力计算域功率整个 Fabric 功率机架功率、PUE

十二、真正需要警惕的不是“交换机卖得多”,而是网络瓶颈转移

AI 网络研究不能停留在“GPU 数量增加,所以交换机需求增加”。更重要的是判断瓶颈究竟位于哪里。

  1. 如果 GPU 算力增长快于网络带宽,瓶颈可能从计算转向通信。
  2. 如果交换芯片带宽增长快于光模块,瓶颈可能转向光互联。
  3. 如果光模块升级但 PCB/连接器无法满足高速信号完整性,瓶颈可能转向高速材料和封装。
  4. 如果网络设备功耗增长过快,瓶颈可能转向供电和散热。
  5. 如果单集群规模扩大但网络拥塞严重,瓶颈可能从硬件转向网络拓扑和软件。

十三、AI Factory 中的完整传导链

可以把未来 AI Factory 的网络演进抽象成一条完整链条:

模型规模增长

↓

GPU 数量增加

↓

Scale-up 计算域扩大

↓

Scale-out 集群规模扩大

↓

交换机端口数量增加

↓

单端口速率从 400G → 800G → 1.6T 甚至更高

↓

SerDes / 交换芯片升级

↓

光模块 / 光芯片升级

↓

PCB / CCL / 连接器升级

↓

功耗上升

↓

液冷与电力基础设施升级

十四、研究交换机时最重要的跟踪变量

层级变量为什么重要
需求AI GPU 集群规模决定网络总量
架构Scale-up/Scale-out 比例决定产品结构
速率400G/800G/1.6T 渗透率决定价值量
芯片交换芯片带宽/SerDes决定交换机代际
光光模块数量和速率决定光通信需求
材料PCB/CCL 高频高速材料决定信号完整性
功耗交换机/光模块功耗决定散热需求
网络拥塞与有效带宽决定 GPU 利用率
软件RDMA/通信库/网络调度决定硬件有效效率

十五、最终判断:Scale-up 与 Scale-out 是两条不同的产业逻辑

Scale-up 的本质,是把有限数量的 GPU 组织成一个更强、更紧密的计算域;Scale-out 的本质,是把大量计算域连接成一个更大的 AI Factory。

因此,两者不能简单用“交换机数量”统一衡量。Scale-up 更值得关注 GPU 间带宽、互联协议、交换芯片和计算域拓扑;Scale-out 更值得关注集群规模、交换容量、端口速率、网络拓扑、光模块数量、拥塞控制以及跨机架互联。

从产业研究角度看,真正有价值的跟踪方式不是单独研究“交换机”,而是把交换机放回 AI Factory 的因果链中:模型 → GPU → 通信 → 交换芯片 → SerDes → 光模块 → PCB/CCL → 液冷 → 电力。

当某一环节出现新的物理约束或工程瓶颈时,产业价值往往不会平均分配,而会向真正限制系统扩张的环节集中。这也是研究 Scale-up/Scale-out 最值得关注的地方:不是设备本身,而是网络瓶颈如何随着 AI 算力规模扩大不断迁移。

附录:一张图理解两套体系

Scale-up:

GPU ─ GPU ─ GPU ─ GPU

│ │ │ │

└────高速互联/交换────┘

目的:形成高带宽计算域


Scale-out:

计算节点 → Leaf/ToR → Spine → Leaf/ToR → 计算节点

目的:把多个计算域扩展成大型 AI 集群


两者最终共同服务于一个目标:让更多 GPU 保持高利用率,而不是因为通信等待而浪费计算能力。