产棱 · IndPrism China 算力全产业链传导分析

产棱 · 技术拆解11|正交无源背板深度拆解

产棱 技术拆解 高速互联
本文 24 节
  1. 1. 先给结论:一块PCB为什么可以改变整机柜架构?
  2. 2. 为什么传统“GPU → 铜缆 → Switch”开始变得困难?
  3. 3. 第一层:PCB不是普通服务器主板,而是高速互连基础设施
  4. 4. 第二层:高层数为什么不是简单“多几层铜”?
  5. 5. 第三层:低损耗材料为什么开始成为核心变量?
  6. 6. 第四层:背钻——为什么一个“没用的孔”也会影响高速通信?
  7. 7. 第五层:压合与层间对准——大尺寸PCB真正难在哪里?
  8. 8. 第六层:高速连接器——PCB做得再好,接口也可能成为瓶颈
  9. 9. 第七层:SI——为什么“能通”远远不够?
  10. 10. 第八层:PI——高速系统为什么同时也是电源系统?
  11. 11. 第九层:PCB的价值为什么远低于GPU,但工程重要性可能更高?
  12. 12. 为什么Rubin把PCB提升到了系统架构层?
  13. 13. 从NVLink到PCB:带宽压力如何一路传下来?
  14. 14. 正交无源背板真正改变的,是制造方式
  15. 15. 这块PCB为什么“低BOM、高架构价值”?
  16. 16. 真正的瓶颈不是“有没有PCB产能”,而是有没有高端有效产能
  17. 17. 正交背板进入产棱“瓶颈池”的变量
  18. 18. 下一代问题:PCB会不会继续成为“瓶颈”?
  19. 19. 产业传导:从一块PCB到整个AI硬件链
  20. 20. 如何持续跟踪,而不是只写一次?
  21. 21. 重要边界:PCB价格上涨 ≠ PCB产业价值提升
  22. 22. 最终拆解:为什么一块几万元的PCB可以影响百万美元级AI机柜?
  23. 23. 产棱最终判断
  24. 24. 研究边界与来源

拆:GPU → 高速连接器 → PCB Midplane/正交背板 → 高速连接器 → NVLink Switch → GPU

重点:高层PCB|低损耗材料|背钻|压合对准|高速连接器|信号完整性|电源完整性|可靠性|制造良率

核心判断:正交无源背板的价值不在于“这块PCB卖多少钱”,而在于它把AI机柜最难控制的一部分高速互连,从大量线缆组件转化成可制造、可验证、可模块化维护的系统级互连平台。

NVIDIA公开资料确认,Vera Rubin NVL72采用PCB-based connections,并通过robust PCB midplane实现电缆更少/无缆化的模块化Tray设计;每个计算Tray集成两颗Vera Rubin Superchip以及网络、供电、冷却和管理。需要特别注意:本文使用“正交无源背板”描述用户拆解框架中的架构概念,官方公开材料更常用“PCB midplane / cable-free modular tray”等表述,因此不把后续Kyber架构的具体背板规格直接套用到NVL72。citeturn0search1turn0search3

1. 先给结论:一块PCB为什么可以改变整机柜架构?

因为当GPU之间的通信带宽进入TB/s级别以后,互连不再只是“把两个芯片接起来”。它同时成为高速电气系统、机械结构、供电回流、散热空间、制造良率和维护效率的共同约束。

变化传统高性能服务器Rubin/NVL72方向
连接方式线缆、连接器、板卡组合PCB midplane + 模块化连接
主要工程问题线缆布线、装配、维护高层板、材料、阻抗、背钻、连接器
系统目标完成连接在高带宽下保持稳定信号与可维护性
价值来源组件数量高端制造能力、良率与系统认证

图1|从线缆互连到PCB Midplane:系统工程问题发生迁移

2. 为什么传统“GPU → 铜缆 → Switch”开始变得困难?

铜缆不是不能传高速信号,而是当连接数量、速率、距离和维护复杂度同时增加时,线缆系统会快速膨胀。AI机柜的问题不是某一根线做不到,而是成百上千条高速链路如何同时满足损耗、串扰、弯折半径、连接器一致性、装配误差和维护要求。

  1. 链路数量增加:多GPU全互联意味着大量独立高速通道。
  2. 速率提高:单通道速率越高,插损、回损、串扰和材料损耗越难控制。
  3. 机械约束增强:线缆需要弯折、固定、标识和人工装配。
  4. 维护复杂度增加:每增加一个可插拔连接点,就增加潜在失效点。

真正的迁移不是“线缆被PCB替代”这么简单,而是:把部分不可控的装配问题,转化为可设计、可仿真、可量产验证的PCB问题。

3. 第一层:PCB不是普通服务器主板,而是高速互连基础设施

普通PCB最容易被理解为“芯片的载体”。但在NVL72这类系统里,PCB的一个核心角色是传输高速差分信号。它的性能上限直接受到介质材料、铜粗糙度、线宽线距、层叠结构、过孔、参考平面和连接器共同决定。

变量对高速互连的影响
介质损耗 Df决定高频信号传播过程中的能量损耗
介电常数 Dk影响阻抗、传播速度与时序设计
铜箔粗糙度高频下影响导体损耗
线宽/线距决定布线密度与阻抗控制空间
层叠结构决定信号层与参考平面的关系
过孔/背钻决定垂直互连中的反射与残桩问题

4. 第二层:高层数为什么不是简单“多几层铜”?

当高速链路增加后,设计者需要同时安排信号层、电源层、地层以及不同区域的回流路径。层数增加本身并不等于性能提升;真正困难的是在有限厚度和有限面积内,把数以千计的连接、供电和高速信号组织起来。

  1. 信号层与参考平面需要成对设计。
  2. 高速差分对必须维持受控阻抗。
  3. 不同电压域需要隔离,避免电源噪声耦合到高速信号。
  4. 高速区域与大电流供电区域存在空间竞争。
  5. 层间对准误差会在多次压合后累积。

5. 第三层:低损耗材料为什么开始成为核心变量?

当链路速度继续提升,PCB材料不再只是机械绝缘材料,而成为射频/高速传输介质。材料的Dk、Df、玻纤结构、铜箔粗糙度都会进入链路预算。

所以AI服务器PCB的材料升级,本质上不是“更贵的树脂”,而是为了给高速链路保留足够的信号裕量。

6. 第四层:背钻——为什么一个“没用的孔”也会影响高速通信?

传统多层PCB中的通孔往往贯穿多层板,即使某条信号只连接到中间某一层,剩余部分也可能形成stub(残桩)。在低速系统中影响有限,但高速信号下,stub会形成阻抗不连续并产生反射。背钻的目标就是移除不需要的残桩。

结构高速影响
普通贯穿孔可能留下较长stub
背钻去除无效孔段,改善阻抗连续性
盲埋孔缩短连接路径,但制造复杂度更高
微孔支持更高密度的层间连接

7. 第五层:压合与层间对准——大尺寸PCB真正难在哪里?

高端AI PCB往往需要多层结构。每一次压合、钻孔、曝光和铜层加工都会带来微小尺寸变化。板越大、层越多,误差管理越困难。

  1. 热膨胀导致尺寸变化。
  2. 树脂流动导致局部厚度变化。
  3. 不同材料CTE不一致。
  4. 多次压合导致累计偏移。
  5. 最终结果不仅是“线能不能连上”,而是阻抗和高速性能是否仍处于设计窗口。

图2|高速PCB本质上是一套受控电磁传输结构

8. 第六层:高速连接器——PCB做得再好,接口也可能成为瓶颈

PCB与PCB之间必须通过连接器完成机械插接。连接器同时承担电气、机械和维护功能,因此是整个链路中非常特殊的部件。

要求对应工程问题
低插损保证高速链路预算
低串扰减少相邻通道耦合
阻抗连续避免接口处反射
高插拔可靠性支撑模块化维护
机械定位降低装配误差
热稳定性避免高功率环境下性能漂移

9. 第七层:SI——为什么“能通”远远不够?

Signal Integrity(信号完整性)关注的是信号到达接收端以后是否仍然满足系统判定窗口。真正的高速设计不是“信号有没有从A到B”,而是眼图、抖动、插损、回损、串扰和误码率是否仍然满足要求。

当NVLink进入TB/s级系统带宽后,PCB已经不是被动“导线”,而是链路的一部分。

10. 第八层:PI——高速系统为什么同时也是电源系统?

高速芯片的瞬时电流变化会通过PDN产生电压波动。供电层、去耦电容、过孔、铜厚、回流路径都影响电源完整性。高速信号和电源完整性并非完全独立:电源噪声会进一步侵入时钟和高速SerDes。

11. 第九层:PCB的价值为什么远低于GPU,但工程重要性可能更高?

这是本篇最重要的价值判断之一。BOM价格衡量的是直接采购价值,而系统架构价值还包括“没有它,系统是否能跑满性能”。一块PCB即使只占整机BOM很小比例,只要它成为系统互连瓶颈,就可能决定GPU、NVSwitch等昂贵芯片能否兑现设计能力。

价值层级代表对象价值逻辑
直接BOMPCB、连接器材料+制造+加工
性能价值SI/PI、阻抗、损耗决定高速链路能否工作
系统价值全互联Fabric决定GPU能否协同
运营价值模块化维护降低装配与维修时间

12. 为什么Rubin把PCB提升到了系统架构层?

NVIDIA公开资料显示,Vera Rubin NVL72采用第三代MGX架构,计算Tray和NVLink Switch Tray强调模块化、cable-free、hose-free、fanless设计;官方技术博客明确提到robust PCB midplane,并指出它连接计算Tray内部的Superchip与前置ConnectX-9/BlueField-4模块。citeturn0search1turn0search3

这意味着PCB承担的不只是“信号连接”,而是模块化系统架构中的机械、电气和维护接口。

13. 从NVLink到PCB:带宽压力如何一路传下来?

图3|从GPU算力增长到PCB制造难度的压力传导

NVIDIA目前公开的NVLink 6指标为每GPU最高3.6TB/s;NVL72形成72 GPU的all-to-all scale-up域。NVIDIA同时强调,NVLink 6针对大规模MoE等需要高频GPU间通信的工作负载,并在交换侧加入in-network compute。citeturn0search6turn0search9

因此链路工程的核心矛盾发生变化:GPU算力增长越快,系统越依赖高带宽互连;互连带宽越高,PCB、连接器和材料必须提供越大的电气裕量。

14. 正交无源背板真正改变的,是制造方式

过去大量线缆意味着大量“装配动作”。新的PCB互连架构则把部分装配过程转化成标准化的板卡、连接器和模块。NVIDIA公开资料称,Vera Rubin计算Tray采用PCB midplane后,装配时间可由接近两小时降至约五分钟,并强调模块化和可维护性。不同官方页面对具体时间口径有所不同,但方向一致:PCB架构的价值不仅是高速通信,还包括制造和维护效率。citeturn0search1turn0search3

15. 这块PCB为什么“低BOM、高架构价值”?

图4|正交无源背板的价值不是单一材料价值,而是制造能力与系统价值

成本项目表面价格真正决定因素
PCB基材材料成本低损耗、高频性能、稳定性
高层制造加工成本层数、对准、压合、良率
钻孔/背钻加工成本高速性能、残桩控制
连接器器件成本高速性能、机械可靠性
测试制造成本系统SI/PI验证与良率

16. 真正的瓶颈不是“有没有PCB产能”,而是有没有高端有效产能

普通PCB产能不能直接等价为AI高端PCB产能。真正需要观察的是:能够稳定量产高层数、低损耗材料、细线路、复杂背钻、严格层间对准,并通过客户认证的有效产能。

产能统计如果不区分产品等级,很容易高估真正可用于AI高速互连的供给。

17. 正交背板进入产棱“瓶颈池”的变量

图5|正交无源背板瓶颈池:从材料到制造再到测试

  1. 低损耗高速材料:Dk、Df、铜箔粗糙度。
  2. 高层数PCB:层叠、压合、尺寸稳定性。
  3. 背钻/微孔:高速互连中的垂直结构控制。
  4. 高速连接器:插损、串扰、阻抗与机械可靠性。
  5. 层间对准:大尺寸多层板的良率变量。
  6. SI/PI验证:眼图、插损、回损、BER、电源噪声。
  7. 高端有效产能:客户认证与量产良率,而非名义产能。

18. 下一代问题:PCB会不会继续成为“瓶颈”?

如果未来GPU、NVSwitch和Scale-up Fabric继续提高带宽,铜互连最终会受到距离、损耗、功耗和密度的共同约束。因此更长期的路线可能出现更高等级的高速电气材料、更先进连接器以及光电互连/共封装光学等方案。NVIDIA已经公开推进面向scale-up的co-packaged optics路线,但这并不意味着PCB失去价值:光互连仍需要高性能基板、封装、供电和机械系统。citeturn0search6

19. 产业传导:从一块PCB到整个AI硬件链

正交无源背板的产业价值可以沿以下路径理解:

AI模型规模 → GPU数量 → GPU间通信 → NVLink/NVSwitch → 高速连接 → PCB/背板 → 高速材料 → 铜箔/树脂/玻纤 → 钻孔/压合/测试 → 连接器 → 整机柜系统。

20. 如何持续跟踪,而不是只写一次?

观察层核心问题验证变量
架构GPU数量和通信域是否继续扩大?NVLink域规模、拓扑
速率每链路带宽是否继续提升?单GPU带宽、SerDes速率
PCB层数/材料/工艺是否升级?层数、材料、背钻、线宽线距
连接器接口是否成为新瓶颈?插损、串扰、可靠性
供给高端有效产能是否充足?认证产能、良率、交付周期
替代何时向光互连迁移?CPO/光I/O渗透、铜链路距离

21. 重要边界:PCB价格上涨 ≠ PCB产业价值提升

如果PCB涨价只是原材料成本推动,而没有同步发生产品结构升级、客户认证提升或高端有效产能稀缺,那么不能简单把涨价等同于产业价值提升。产棱真正关注的是:

  1. 系统带宽是否继续提升;
  2. 单位系统需要多少高速互连;
  3. 高端PCB复杂度是否提升;
  4. 供应商是否进入客户认证与量产阶段;
  5. 良率是否成为真实供给约束;
  6. 价值是否从普通PCB向高速材料、制造工艺、连接器和测试扩散。

22. 最终拆解:为什么一块几万元的PCB可以影响百万美元级AI机柜?

因为AI机柜的价值不是简单由“最贵的芯片”决定,而是由整个系统中最难兑现的工程约束决定。

GPU负责计算,NVLink负责通信协议与高速互连,NVSwitch负责组织GPU Fabric,而PCB Midplane/正交背板负责把这些高速连接真正变成可制造、可装配、可维护的物理系统。它的直接BOM价值有限,但架构价值很高。

低BOM,不等于低价值;无源,也不等于不重要。

23. 产棱最终判断

AI硬件产业正在从“芯片性能竞争”进入“系统互连工程竞争”。当单机柜GPU数量、通信带宽和功耗继续上升以后,PCB不再只是电子元件的承载板,而开始成为AI基础设施的高速互连基础设施。

因此,对正交无源背板最值得跟踪的不是一块板多少钱,而是三个变量:第一,高速互连复杂度是否继续上升;第二,高端有效产能是否形成瓶颈;第三,PCB、连接器、材料与光互连之间的价值分配是否发生变化。

24. 研究边界与来源

本文基于NVIDIA公开的Vera Rubin NVL72、NVLink 6及MGX架构资料,并结合高速PCB工程逻辑进行产业拆解。NVIDIA公开资料确认PCB midplane、cable-free tray等架构事实;“正交无源背板”作为本文的工程归纳,不将未公开的具体层数、材料牌号、连接器型号等参数当作已证实事实。citeturn0search1turn0search3turn0search9

核心来源:NVIDIA Vera Rubin NVL72;NVIDIA Vera Rubin POD技术博客;NVIDIA Inside Rubin Platform;NVIDIA NVLink技术资料。