产棱拆解 | Scale-up 与 Scale-out 交换机深度拆解
产棱·IndPrism 深度拆解
从 GPU 互联、交换芯片到光通信与 AI Factory 网络瓶颈
本文 16 节
- 一、为什么 AI 算力越大,网络越重要
- 二、先建立完整的 AI 网络分层
- 三、Scale-up:把 GPU 做成一个更大的计算域
- 四、Scale-out:把计算岛连接成 AI Factory
- 五、Scale-up 与 Scale-out 的真正区别
- 六、为什么 Scale-out 对光通信产业拉动更强
- 七、800G 与 1.6T 为什么成为关键观察变量
- 八、交换芯片:整个网络的核心瓶颈之一
- 九、SerDes:交换机升级背后的关键工程变量
- 十、交换机为什么会成为 AI Factory 的电力与散热问题
- 十一、Scale-up 与 Scale-out 的产业链映射
- 十二、真正需要警惕的不是“交换机卖得多”,而是网络瓶颈转移
- 十三、AI Factory 中的完整传导链
- 十四、研究交换机时最重要的跟踪变量
- 十五、最终判断:Scale-up 与 Scale-out 是两条不同的产业逻辑
- 附录:一张图理解两套体系
核心结论:Scale-up 与 Scale-out 并不是同一种“交换机”在不同规模下的简单变化,而是 AI 集群中两套不同的通信体系。Scale-up 解决的是一个高性能计算域内部的加速器互联问题,目标是让更多 GPU/加速器形成高带宽、低延迟的统一计算域;Scale-out 解决的是计算域之间以及大规模服务器之间的网络扩展问题,目标是把数百、数千乃至更大规模的计算节点组织成可运行的大型 AI 集群。两者最终都会影响 GPU 利用率,但瓶颈、拓扑、交换芯片、光互联比例、协议栈以及产业链拉动方式存在明显差异。
一、为什么 AI 算力越大,网络越重要
AI 训练并不是简单地把更多 GPU 堆在一起。随着模型规模、参数量、上下文长度和训练数据规模持续扩大,单颗 GPU 的计算能力已经不能独立完成任务。大量 GPU 必须持续交换梯度、激活值、参数以及中间状态。因此,AI Factory 的有效算力不仅由 GPU TOPS/FLOPS 决定,还取决于 GPU 是否能够持续获得数据,以及不同 GPU 之间能否以足够低的通信成本完成同步。
当通信成为限制因素时,会出现一个非常重要的现象:理论 GPU 算力继续增加,但有效训练吞吐量并不同比例增加。因此,AI 网络的核心价值并不是“传输数据”这么简单,而是尽可能降低计算单元等待通信的时间。
二、先建立完整的 AI 网络分层
可以把大型 AI Factory 的通信体系粗略理解为三个层次:
- 第一层:加速器内部互联——GPU 与 HBM、GPU 与 GPU 之间的数据移动。
- 第二层:Scale-up——在一个高性能计算域内,将多颗 GPU/加速器组成高带宽计算岛。
- 第三层:Scale-out——把多个计算节点、机架、Pod/计算岛进一步连接成大型 AI 集群。
需要特别注意:不同厂商的系统边界并不完全一致。例如某些架构会把交换芯片放在 GPU 基板、服务器、机箱或机架级网络中,因此不能仅根据设备外形判断其属于 Scale-up 还是 Scale-out。真正应该看的是:它连接什么对象、采用什么协议、承担什么通信任务。
三、Scale-up:把 GPU 做成一个更大的计算域
Scale-up 的核心思想是:不是先考虑如何把整个数据中心连接起来,而是先让一个计算域内部的 GPU 尽可能高效地协同。
例如一个训练任务被切分到多颗 GPU 上,每颗 GPU 都需要频繁读取其他 GPU 的数据。如果这些通信需要经过普通数据中心网络,延迟和协议开销会显著增加。Scale-up 因此采用更专用、更紧密的互联方式。
典型逻辑可以表示为:
GPU → 高速互联 → Scale-up Switch → 高速互联 → GPU
3.1 Scale-up 的核心指标
| 指标 | 为什么重要 | 产业含义 |
| 带宽 | 决定 GPU 之间单位时间可以交换多少数据 | 推动高速 SerDes、交换芯片和先进封装 |
| 延迟 | 影响同步和集合通信效率 | 推动专用互联架构 |
| 端口密度 | 决定一个交换域可以容纳多少加速器 | 推动高速 I/O 和封装 |
| 拓扑 | 决定通信路径和拥塞情况 | 决定交换机数量与互联方式 |
| 集合通信效率 | 决定训练中 GPU 是否需要等待 | 直接影响有效算力 |
3.2 为什么 Scale-up 交换机不是普通以太网交换机
普通数据中心交换机首先追求网络的开放性、可扩展性和标准化;而 Scale-up 更强调加速器之间的确定性、高带宽和低延迟。因此其交换芯片、协议、链路设计以及软件栈通常围绕特定加速器生态进行优化。
这意味着研究 Scale-up 不能只看“交换机市场有多大”,而应该追踪每一代加速器平台中:单节点 GPU 数量、GPU 间带宽、交换芯片带宽、交换芯片数量、每 GPU 对外 I/O、链路距离以及拓扑变化。
四、Scale-out:把计算岛连接成 AI Factory
Scale-out 的目标与 Scale-up 不同:当单个计算域已经不能容纳整个训练任务时,需要把多个计算节点乃至多个计算域连接起来。此时网络从“计算域内部互联”变成“整个集群的网络基础设施”。
典型结构可以抽象为:
GPU/服务器 → ToR/Leaf → Spine → Leaf/ToR → GPU/服务器
在超大规模 AI 集群中,还可能形成多层 Clos/Fabric。随着节点数量增加,交换机、光模块、光纤和端口数量会快速增加。
4.1 Scale-out 的核心指标
| 指标 | 核心问题 | 产业链 |
| 交换容量 | 整个 Fabric 能否承载大规模通信 | 交换芯片 |
| 端口速率 | 400G/800G/1.6T 等代际升级 | SerDes、光模块 |
| 端口数量 | 决定网络规模上限 | 交换机、光器件 |
| 拥塞控制 | 避免热点流量拖慢训练 | 交换芯片+网络软件 |
| RDMA | 降低数据搬运开销 | NIC、交换机、软件栈 |
| 故障恢复 | 大规模集群必须控制故障域 | 网络架构与管理软件 |
五、Scale-up 与 Scale-out 的真正区别
| 维度 | Scale-up | Scale-out | 核心瓶颈 |
| 连接对象 | GPU/加速器之间 | 服务器/计算域之间 | 通信层级 |
| 目标 | 形成高带宽计算域 | 扩大集群规模 | 规模与效率平衡 |
| 网络特征 | 专用、紧密、低延迟 | 开放、可扩展、大规模 | 拓扑 |
| 光通信 | 通常相对有限 | 需求显著 | 距离与端口数量 |
| 交换芯片 | 加速器互联导向 | 数据中心网络导向 | 协议与生态 |
| 典型瓶颈 | GPU 间通信 | Fabric 带宽与拥塞 | 网络效率 |
| 扩容方式 | 增加计算域内部互联能力 | 增加节点/机架/Pod | 网络规模 |
六、为什么 Scale-out 对光通信产业拉动更强
这是理解 AI 光通信产业最重要的一点之一。Scale-up 可以在非常短的距离内使用铜互联、板级互联或专用高速互联;而 Scale-out 随着网络规模扩大,链路距离从板内、机内逐渐扩展到服务器、机架、机柜甚至数据中心不同区域。
距离一旦增加,高速电信号在 PCB、连接器和线缆中的损耗迅速上升。为了继续维持 400G、800G 乃至更高的数据速率,系统会越来越依赖光电转换。因此,大规模 Scale-out 网络天然会产生大量光模块需求。
产业传导可以概括为:
AI 集群规模扩大 → GPU/服务器数量增加 → 网络端口增加 → 交换机数量增加 → 单端口速率提升 → 光模块数量与速率升级 → 光芯片/DSP/EML/VCSEL/硅光/连接器/光纤需求增加。
七、800G 与 1.6T 为什么成为关键观察变量
当 GPU 集群规模扩大以后,网络带宽不能长期停留在低速率。否则交换机端口数量会快速膨胀,机架空间、功耗和布线复杂度都会成为瓶颈。因此,网络升级通常同时沿两个方向发生:增加端口数量,以及提高单端口速率。
提高单端口速率的结果是:同样数量的 GPU,可以用更少的物理端口完成通信;但代价是 SerDes、光模块、交换芯片、PCB、连接器以及散热系统都需要升级。
因此,研究 800G/1.6T 不能只看光模块价格,而要观察整个网络架构是否正在发生代际迁移。
八、交换芯片:整个网络的核心瓶颈之一
无论 Scale-up 还是 Scale-out,交换芯片都是核心器件,但两者的设计目标不同。
Scale-up 交换芯片需要围绕加速器互联协议、低延迟和集合通信优化;Scale-out 交换芯片则需要面对大量端口、高 SerDes 速率、缓存、拥塞控制、ECMP/RDMA 等问题。
当交换芯片从 12.8T、25.6T、51.2T 继续向更高交换容量演进时,单芯片功耗、SerDes 信号完整性、封装、散热以及 PCB 材料都会成为工程约束。
因此,交换芯片升级并不是单独发生的:交换容量提升 → SerDes 速率提升 → 封装与 PCB 要求提升 → 光模块速率提升 → 功耗提升 → 散热升级。
九、SerDes:交换机升级背后的关键工程变量
高速交换机的一个核心工程问题,是如何在有限功耗和信号完整性约束下,把每个 SerDes lane 的速率不断提高。
当单 lane 速率提升时,PCB 走线、连接器、封装基板、线缆以及光电接口都会面临更严格的损耗和串扰要求。因此,高速交换机实际上是一个由交换芯片、封装、PCB、连接器、光模块、散热共同构成的系统工程。
十、交换机为什么会成为 AI Factory 的电力与散热问题
AI 网络并不是免费的。交换芯片、NIC、光模块和光电转换都会消耗功率。随着端口速率提高,网络设备的功耗逐渐成为数据中心设计的重要变量。
于是会形成另一条产业传导:
GPU 功率提升 + 交换芯片功率提升 + 光模块数量增加 → 机架功率密度提升 → 液冷需求增加 → CDU/冷板/管路升级 → 数据中心供电与配电系统升级。
这说明交换机并不是孤立的“网络设备”,它最终会反馈到 AI Factory 的电力和液冷系统。
十一、Scale-up 与 Scale-out 的产业链映射
| 产业环节 | Scale-up 影响 | Scale-out 影响 | 需要跟踪的变量 |
| GPU/加速器 | 非常高 | 非常高 | GPU 数量、互联带宽 |
| 交换芯片 | 专用互联导向 | 数据中心交换导向 | 交换容量、SerDes |
| 光模块 | 视架构而定 | 非常高 | 400G/800G/1.6T 渗透 |
| PCB/CCL | 高速低损耗 | 高速高层数/高密度 | 材料、层数、损耗 |
| 连接器/线缆 | 高速短距 | 大量高速链路 | 速率、距离、数量 |
| NIC/DPU | 专用互联/平台相关 | 非常关键 | RDMA、卸载能力 |
| 液冷 | 高功率节点推动 | 高密度网络推动 | 功率密度 |
| 电力 | 计算域功率 | 整个 Fabric 功率 | 机架功率、PUE |
十二、真正需要警惕的不是“交换机卖得多”,而是网络瓶颈转移
AI 网络研究不能停留在“GPU 数量增加,所以交换机需求增加”。更重要的是判断瓶颈究竟位于哪里。
- 如果 GPU 算力增长快于网络带宽,瓶颈可能从计算转向通信。
- 如果交换芯片带宽增长快于光模块,瓶颈可能转向光互联。
- 如果光模块升级但 PCB/连接器无法满足高速信号完整性,瓶颈可能转向高速材料和封装。
- 如果网络设备功耗增长过快,瓶颈可能转向供电和散热。
- 如果单集群规模扩大但网络拥塞严重,瓶颈可能从硬件转向网络拓扑和软件。
十三、AI Factory 中的完整传导链
可以把未来 AI Factory 的网络演进抽象成一条完整链条:
模型规模增长
↓
GPU 数量增加
↓
Scale-up 计算域扩大
↓
Scale-out 集群规模扩大
↓
交换机端口数量增加
↓
单端口速率从 400G → 800G → 1.6T 甚至更高
↓
SerDes / 交换芯片升级
↓
光模块 / 光芯片升级
↓
PCB / CCL / 连接器升级
↓
功耗上升
↓
液冷与电力基础设施升级
十四、研究交换机时最重要的跟踪变量
| 层级 | 变量 | 为什么重要 |
| 需求 | AI GPU 集群规模 | 决定网络总量 |
| 架构 | Scale-up/Scale-out 比例 | 决定产品结构 |
| 速率 | 400G/800G/1.6T 渗透率 | 决定价值量 |
| 芯片 | 交换芯片带宽/SerDes | 决定交换机代际 |
| 光 | 光模块数量和速率 | 决定光通信需求 |
| 材料 | PCB/CCL 高频高速材料 | 决定信号完整性 |
| 功耗 | 交换机/光模块功耗 | 决定散热需求 |
| 网络 | 拥塞与有效带宽 | 决定 GPU 利用率 |
| 软件 | RDMA/通信库/网络调度 | 决定硬件有效效率 |
十五、最终判断:Scale-up 与 Scale-out 是两条不同的产业逻辑
Scale-up 的本质,是把有限数量的 GPU 组织成一个更强、更紧密的计算域;Scale-out 的本质,是把大量计算域连接成一个更大的 AI Factory。
因此,两者不能简单用“交换机数量”统一衡量。Scale-up 更值得关注 GPU 间带宽、互联协议、交换芯片和计算域拓扑;Scale-out 更值得关注集群规模、交换容量、端口速率、网络拓扑、光模块数量、拥塞控制以及跨机架互联。
从产业研究角度看,真正有价值的跟踪方式不是单独研究“交换机”,而是把交换机放回 AI Factory 的因果链中:模型 → GPU → 通信 → 交换芯片 → SerDes → 光模块 → PCB/CCL → 液冷 → 电力。
当某一环节出现新的物理约束或工程瓶颈时,产业价值往往不会平均分配,而会向真正限制系统扩张的环节集中。这也是研究 Scale-up/Scale-out 最值得关注的地方:不是设备本身,而是网络瓶颈如何随着 AI 算力规模扩大不断迁移。
附录:一张图理解两套体系
Scale-up:
GPU ─ GPU ─ GPU ─ GPU
│ │ │ │
└────高速互联/交换────┘
目的:形成高带宽计算域
Scale-out:
计算节点 → Leaf/ToR → Spine → Leaf/ToR → 计算节点
目的:把多个计算域扩展成大型 AI 集群
两者最终共同服务于一个目标:让更多 GPU 保持高利用率,而不是因为通信等待而浪费计算能力。