产棱 · IndPrism China 算力全产业链传导分析

产棱拆解 | AI Factory 高速交换机产业链 Bottleneck 深度拆解

产棱 技术拆解 高速互联

产棱·IndPrism 深度拆解

从交换芯片、SerDes、光模块到 PCB/CCL、铜缆、液冷与中国供应链

本文 19 节
  1. 一、从“交换机”回到 AI Factory 的物理世界
  2. 二、交换机的内部结构:一台高速交换机究竟由什么组成
  3. 三、第一核心瓶颈:交换芯片
  4. 四、Broadcom/NVIDIA/Marvell 三类能力不能简单等同
  5. 五、第二核心瓶颈:SerDes
  6. 六、第三核心瓶颈:800G → 1.6T 光模块
  7. 七、DSP 与光芯片:为什么不能只研究光模块厂
  8. 八、第四核心瓶颈:PCB 与 CCL
  9. 九、铜缆不会消失:短距互联中的另一条路线
  10. 十、第五核心瓶颈:功耗
  11. 十一、液冷:交换机为什么也开始进入高密度散热体系
  12. 十二、从单个零部件到完整瓶颈传导
  13. 十三、真正需要建立的是“Bottleneck Map”
  14. 十四、中国供应链应该如何拆,而不是简单列公司
  15. 十五、最重要的不是国产替代,而是“能否形成完整系统闭环”
  16. 十六、交换机产业链的“新墙”在哪里
  17. 十七、如何用产棱的方法跟踪交换机
  18. 十八、最终判断:交换机不是一个行业,而是一条高速数据通路
  19. 附录:一张完整的产业传导图

核心结论:AI 交换机的价值不能只用“交换机台数”衡量。随着 AI 集群从单机、多机柜走向大规模 AI Factory,真正发生变化的是整个高速数据通路:交换芯片的交换容量和 SerDes 速率提升,带动光模块、DSP/光芯片、PCB/CCL、连接器、线缆、散热和供电同步升级。产业利润与供给约束最终会集中到真正限制网络扩张的瓶颈环节。

一、从“交换机”回到 AI Factory 的物理世界

AI Factory 的网络可以看成一条连续的数据通路,而不是一个独立盒子。数据从 GPU/NPU 发出,经 NIC/DPU、铜缆或光模块进入交换芯片,再通过另一端口进入下一层网络。任何一个环节的带宽、延迟、功耗、信号完整性或供给能力不足,都可能限制整个系统。

因此研究交换机产业链的第一原则是:不要问“哪个零部件最先进”,而要问“哪个零部件正在限制系统扩张”。

二、交换机的内部结构:一台高速交换机究竟由什么组成

模块主要功能关键变量
交换芯片完成数据包/高速流量交换交换容量、SerDes、端口数、缓存、功耗
CPU/控制平面设备管理、协议和控制软件生态、CPU能力
SerDes高速串并转换与电信号传输单lane速率、功耗、信号完整性
光模块电信号与光信号转换800G/1.6T、功耗、良率、光芯片
DSP高速信号处理功耗、带宽、调制方式
PCB/CCL承载高速信号插损、介损、层数、材料
连接器/线缆高速物理连接损耗、密度、可靠性
电源提供稳定高功率功率密度、效率
散热移除芯片与光模块热量风冷/液冷、热阻

三、第一核心瓶颈:交换芯片

交换芯片是高速交换机的“大脑和高速公路枢纽”。其交换容量决定单位时间能够处理多少流量;端口数量决定能够连接多少链路;SerDes速率决定每个端口如何实现更高带宽。

交换容量升级通常不是孤立的。更高交换容量意味着更多高速 SerDes,带来更高的芯片功耗、封装复杂度、PCB 信号完整性要求和散热压力。

因此交换芯片升级会产生明显的产业级联效应:交换容量↑ → SerDes↑ → PCB/封装要求↑ → 光模块速率↑ → 功耗↑ → 散热↑。

四、Broadcom/NVIDIA/Marvell 三类能力不能简单等同

在产业研究中,不能把所有“交换芯片”视为同一种产品。不同厂商可能处于不同的网络层和生态位置。Broadcom 代表开放数据中心交换芯片生态的重要路线;NVIDIA 同时拥有加速器、专用互联和网络产品体系,网络与 GPU 平台协同明显;Marvell 则在数据基础设施、互联与光电相关技术上形成自己的产品组合。

真正需要跟踪的是产品架构和代际变化,而不是简单比较公司名称。尤其要区分:通用以太网交换、专用加速器互联、NIC/DPU、光电互联等不同层次。

五、第二核心瓶颈:SerDes

SerDes 是交换机高速化最关键的底层工程变量之一。随着单lane速率提升,电信号在封装、PCB、连接器和铜缆中的损耗、串扰与抖动问题快速恶化。

因此,从 56G/112G 向更高 SerDes 演进,并不是简单把频率提高,而是整个信号链的系统工程。交换芯片、封装基板、PCB、连接器、铜缆和光模块必须共同升级。

  1. 单lane速率越高,对 PCB 插损和介损要求越严格。
  2. 链路越长,电信号衰减越明显,光互联的价值越高。
  3. 端口密度越高,连接器和 PCB 布线难度越高。
  4. 功耗越高,散热越可能成为新的系统瓶颈。

六、第三核心瓶颈:800G → 1.6T 光模块

当 Scale-out 网络规模不断扩大后,光模块成为交换机产业链中最直接的受益环节之一。原因并不是“AI需要更多光模块”这么简单,而是单端口速率和网络端口数量同时增长。

800G 的典型演进路径与 1.6T 的下一代升级,本质上都是为了降低单位带宽所需的端口、机架和布线成本。但速率提升也会增加光模块功耗、散热、光芯片性能和制造良率压力。

变量向上的产业影响潜在瓶颈
单端口速率光模块价值量提高DSP/光芯片/封装
端口数量模块总量增加产能与供应链
传输距离光模块渗透率提高光器件性能
功耗散热需求提高EML/DSP/模块设计
良率决定有效供给制造与测试

七、DSP 与光芯片:为什么不能只研究光模块厂

光模块是系统级产品,但价值并不平均分布在模块内部。DSP负责高速电信号处理;光芯片负责光电转换。随着速率提高,DSP功耗、光芯片带宽、调制方式和封装工艺都会成为关键约束。

因此,真正的瓶颈可能从“模块产能”转移到某种高速光芯片、DSP、激光器或封装工艺。产业研究必须持续寻找这种瓶颈迁移。

八、第四核心瓶颈:PCB 与 CCL

高速交换机对 PCB 的要求远高于普通服务器板。随着 SerDes 速率提升,信号在 PCB 中传输时的损耗越来越重要。

因此,高速低损耗材料、高层数、高密度布线以及更严格的阻抗控制都会变得重要。CCL 并不是简单的“覆铜板升级”,其介电常数、介质损耗、铜箔粗糙度等都会影响高速信号质量。

这意味着交换芯片升级可能把产业瓶颈传导到 PCB/CCL:芯片端速率已经准备好,但板级信号链无法稳定运行时,网络系统仍然无法完成升级。

九、铜缆不会消失:短距互联中的另一条路线

光模块快速增长并不意味着铜互联会被完全替代。短距离、低成本、高功率敏感的连接场景仍然存在 DAC/AEC 等方案。

因此需要区分:距离、速率、功耗、成本和端口密度共同决定铜还是光。未来网络并非“全光化”,而更可能形成铜和光的分层组合。

场景更关注的方案核心变量
极短距离DAC/板级互联成本、功耗、距离
中短距离AEC等有源铜缆信号完整性、功耗
机架/机柜间光模块距离、速率、功耗
大规模Fabric高速光互联端口规模、可靠性、成本

十、第五核心瓶颈:功耗

高速交换机的一个容易被忽略的问题是功耗。交换芯片、SerDes、DSP、光模块和电源系统都在消耗功率。随着端口数量和速率同时提升,网络设备本身会成为机架功率的重要组成部分。

于是出现一个重要反馈:网络升级 → 功耗增加 → 热密度增加 → 散热升级 → 液冷系统复杂度增加。

因此,交换机并不是纯网络问题,而会逐渐进入 AI Factory 的液冷和电力瓶颈。

十一、液冷:交换机为什么也开始进入高密度散热体系

当单台交换机的功率和机架内网络设备密度达到较高水平后,传统风冷会受到空气流量、压降和热阻的约束。

未来是否采用液冷、采用何种液冷,不应简单从“AI GPU液冷”外推,而应根据设备功率密度、机架设计、数据中心冷却架构判断。

  1. 交换芯片功耗上升会提高局部热点温度。
  2. 光模块密度提高会增加前面板热负荷。
  3. 网络设备与 GPU 共存时,机架整体功率密度进一步上升。
  4. 液冷基础设施最终可能成为网络设备扩容的边界条件。

十二、从单个零部件到完整瓶颈传导

一个典型的 AI 网络瓶颈迁移过程可能是:

GPU数量快速增长

↓

Scale-out网络扩大

↓

交换端口增加

↓

交换芯片交换容量不足

↓

新一代交换芯片推出

↓

SerDes速率提升

↓

PCB/CCL与连接器需要升级

↓

铜互联距离受限

↓

800G/1.6T光模块需求增加

↓

DSP/光芯片成为新瓶颈

↓

网络功耗上升

↓

散热与电力成为新的约束

十三、真正需要建立的是“Bottleneck Map”

阶段系统状态最值得观察的瓶颈
GPU扩张初期算力不足GPU/HBM
计算域扩张GPU间通信成为约束Scale-up互联
集群扩大跨节点通信增加Scale-out Fabric
高速化单端口速率提升交换芯片/SerDes
光化电互联距离受限光模块/光芯片
超高速化信号完整性恶化PCB/CCL/连接器
高密度化功耗快速增加液冷/电力
超大规模化网络拥塞和故障域增加拓扑/软件

十四、中国供应链应该如何拆,而不是简单列公司

研究中国供应链时,建议按物理层和瓶颈层拆分,而不是先按公司名单排列。

层级研究对象关键问题
交换芯片国产高速交换芯片性能、生态、软件兼容
NIC/DPU网卡与数据处理RDMA、卸载、生态
光模块800G/1.6T量产、功耗、良率
光芯片EML/硅光/激光器等速率、良率、成本
DSP高速信号处理功耗、性能、供应
PCB/CCL高速低损耗材料介损、插损、量产
连接器/铜缆高速互联速率、可靠性
散热风冷/液冷热阻、系统集成
软件通信库/网络管理有效带宽与稳定性

十五、最重要的不是国产替代,而是“能否形成完整系统闭环”

AI 网络产业的难点不在于某一个零部件能否单点替代,而在于交换芯片、NIC、光模块、DSP、光芯片、PCB、连接器、操作系统/驱动、通信库和上层训练框架能否形成稳定生态。

因此国产化研究至少需要同时观察三个维度:第一是物理性能;第二是大规模集群稳定性;第三是软件生态与实际有效吞吐。

如果某个零部件性能达到理论指标,但在大规模训练中出现拥塞、丢包、故障恢复或软件兼容问题,它仍然可能不是成熟的系统方案。

十六、交换机产业链的“新墙”在哪里

所谓“新墙”,不是某个公司暂时缺货,而是整个系统在继续扩张时出现难以快速突破的物理或工程约束。

  1. 更高 SerDes 带来的信号完整性墙。
  2. 更高交换容量带来的芯片功耗墙。
  3. 更高光模块速率带来的 DSP/光芯片功耗墙。
  4. 更高端口密度带来的 PCB/连接器墙。
  5. 更大 AI Factory 带来的网络拥塞墙。
  6. 更高机架功率密度带来的液冷与电力墙。
  7. 更大集群带来的软件、拓扑和故障管理墙。

十七、如何用产棱的方法跟踪交换机

如果把交换机纳入 AI Factory 的长期跟踪体系,不应该每天追踪所有公司新闻,而应该围绕“产业状态—瓶颈—传导—资产定价”建立变量体系。

观察层核心问题验证变量
产业状态AI集群是否继续扩大GPU集群订单、数据中心资本开支
网络状态网络是否成为约束训练有效吞吐、通信占比
交换机交换容量是否升级新一代芯片/设备发布
光通信800G/1.6T是否加速端口渗透、模块出货
材料高速PCB是否出现约束CCL价格/交期/产能
散热网络功耗是否形成压力机架功率、液冷渗透
资产市场是否已经定价股价相对产业状态的变化

十八、最终判断:交换机不是一个行业,而是一条高速数据通路

从 AI Factory 的角度看,“交换机行业”这个概念实际上过于粗糙。真正应该研究的是高速数据通路。

这条数据通路从 GPU/NPU 出发,经由 NIC/DPU、交换芯片、SerDes、铜缆/光模块、PCB/CCL、连接器,最终进入另一组计算资源。随着规模扩大,液冷、电力和网络软件又会反过来成为系统约束。

因此,交换机产业链最值得研究的不是“谁的产品卖得最多”,而是:下一代 AI 集群扩张时,哪个环节首先无法继续按照原来的方式扩张。

一旦这个问题被识别出来,就可以进一步判断:瓶颈出现在哪里、供给需要多久才能释放、产业利润如何传导、哪些环节会获得量价变化,以及资产价格是否已经提前反映。

这才是从“交换机研究”进入“AI Factory 产业交易研究”的关键一步。

附录:一张完整的产业传导图

AI模型规模

→ GPU/NPU数量

→ Scale-up互联

→ Scale-out Fabric

→ 交换芯片

→ SerDes

→ PCB/CCL/连接器

→ 铜/光互联选择

→ 800G/1.6T光模块

→ DSP/光芯片

→ 网络功耗

→ 液冷

→ 电力

→ AI Factory扩张能力


核心研究问题:瓶颈在哪里?瓶颈什么时候转移?谁拥有有效供给?资产价格是否已经定价?