产棱 · IndPrism China 算力全产业链传导分析

产棱拆解 | 美国AI Factory六大产业链:从瓶颈到资产传导

产棱 技术拆解 基础设施
本文 4 节
  1. 一、先建立一个总框架
  2. 1. GPU已经不是最简单的“缺货逻辑”
  3. 2. GPU供应链现在最大的约束在哪里?
  4. 1. HBM已经成为“算力密度”的约束

结论:截至2026年9月,美国AI Factory的六条产业链并不处于同一个周期位置。GPU已经从“绝对稀缺”逐渐进入规模化供给;HBM仍然是强约束;光通信处于高速升级+局部上游瓶颈;PCB正在从普通增量进入高端结构性紧张;液冷从渗透率提升进入规模化放量;电力则已经成为整个美国AI Factory扩张的最硬约束之一,而且瓶颈正在从“有没有电”进一步下沉到“变压器、UPS、燃机、并网设备能不能交付”。 NVIDIA自己在最新10-Q中也明确表示,Rubin已经开始量产,但仍存在供应约束,同时客户的数据中心土地、电力、建筑壳体和资本都可能限制GPU部署。

下面按六条链分别拆。

美国AI Factory六大产业链:从瓶颈到资产传导

一、先建立一个总框架

AI Factory不是六条平行产业链。

它实际上是一条不断向物理世界传导的链:

AI需求
│
▼
GPU / ASIC
│
┌───────────┴───────────┐
▼ ▼
HBM CPU / DPU
│ │
└───────────┬───────────┘
▼
AI Rack
│
┌───────┴────────┐
▼ ▼
Network Cooling
│ │
Optical │
│ │
└───────┬────────┘
▼
AI Cluster
│
▼
AI Factory
│
Power / Grid
│
▼
GW级电力

六条产业链的周期位置,我先用一句话概括:

产业链当前状态(2026年9月)当前核心瓶颈周期判断
GPU高需求、规模化放量系统级供给/部署能力从芯片瓶颈向基础设施瓶颈迁移
HBM强需求、供给紧DRAM晶圆、HBM堆叠/良率仍处强约束
光通信800G→1.6T升级EML/CW laser、封装、产能高景气+代际升级
PCB高端板需求快速增长高层高速板、材料、产能结构性紧张
液冷高端AI服务器快速渗透冷板/CDU/系统交付从导入期进入放量期
电力最大系统约束之一变压器、UPS、并网、燃机最强约束,且周期最长

这个表最重要的地方是:

越往产业链下游,瓶颈越偏向“物理世界”;越往上游,技术升级越快。
二、第一条:GPU产业链

1. GPU已经不是最简单的“缺货逻辑”

2023~2024年的AI行情,核心逻辑是:

GPU不够。

到了2026年,逻辑已经发生变化。

NVIDIA Rubin已经进入量产,NVL72成为新的Rack级计算单元;Vera Rubin POD甚至把1,152颗Rubin GPU、CPU、网络和存储组织成一个完整AI超级计算系统。(NVIDIA Developer)

所以现在真正的问题已经变成:

GPU能不能被快速装进一个可通电、可散热、可联网的AI Factory。

这和单纯生产GPU完全不同。

2. GPU供应链现在最大的约束在哪里?

不是简单的晶圆。

而是:

GPU Die
↓
HBM
↓
先进封装
↓
Substrate
↓
PCB
↓
NVLink
↓
NIC / DPU
↓
Server
↓
Rack
↓
Liquid Cooling
↓
Power

任何一环不足:

GPU都无法变成可用算力。

NVIDIA最新10-Q甚至直接把土地、电力、数据中心shell、资本等列为影响AI基础设施部署的关键条件。(美国证券交易委员会)

因此GPU产业正在出现一个非常重要的周期变化:

第一阶段

GPU稀缺。

第二阶段

GPU规模化供应。

第三阶段

GPU等待数据中心基础设施。

美国现在正在进入第二阶段向第三阶段过渡。

三、GPU真正的供需拐点在哪里?

不要只看:

GPU出货量。

应该看:

GPU出货量 × 可上线率。

例如:

100万GPU生产出来
↓
只有70万GPU能够部署
↓
30万GPU等待Power / Cooling / Network

那么真正的有效供给只有70万。

所以未来GPU产业的重要变量变成:

Installed GPU → Energized GPU → Utilized GPU

三者不是一回事。

四、GPU资产传导

GPU产业的传导路径:

AI需求
↓
Hyperscaler CapEx
↓
GPU采购
↓
NVIDIA / AMD
↓
HBM / Packaging
↓
Server ODM
↓
Rack
↓
AI Factory

真正需要观察的是:

Hyperscaler CapEx有没有继续向上?

如果CapEx继续增加:

GPU→HBM→Server→Network→Cooling→Power都会继续受益。

如果CapEx增速下降:

最先受影响的是:

GPU及高端服务器。

但是由于电力和基础设施存在长周期约束,CapEx放缓并不一定立即意味着电力、变压器等环节转弱。

这就是产业链不同步。

五、第二条:HBM

这一条目前比GPU更值得警惕。

1. HBM已经成为“算力密度”的约束

Rubin GPU最高配置达到:

  1. 288GB HBM4
  2. 22TB/s HBM带宽

这意味着每一颗GPU本身就消耗大量高性能DRAM。(NVIDIA Developer)

而AI Factory规模不断扩大:

GPU数量 ↑
×
HBM / GPU ↑
=
HBM需求高速增长

这会导致一个非常特殊的现象:

GPU出货增长不一定需要HBM需求同比例增长,但GPU性能升级通常会提高每颗GPU的HBM价值量。
六、当前HBM最大的瓶颈

2026年真正需要关注的是:

HBM4/HBM4e的产能爬坡和DRAM晶圆资源。

TrendForce在2026年8月的判断非常明确:DRAM供应预计到2027年仍然偏紧,HBM4e验证与12-Hi堆叠的量产存在不确定性;其预计2027年HBM bit shipments增长50%~60%,仍可能无法跟上需求增长。(TrendForce)

甚至出现一个非常值得重视的产业现象:

NVIDIA正在评估降低Rubin Ultra的HBM堆叠规格。

这不是需求下降。

恰恰相反:

是HBM供给约束开始反向影响GPU产品设计。

这就是典型的产业瓶颈证据。

七、HBM的供需拐点怎么看?

需要看三个变量:

① HBM bit supply增长

如果:

供给增速 < AI GPU需求增速

继续紧。

② HBM每GPU容量

如果:

288GB → 更高容量

需求继续加速。

③ HBM4e良率

如果良率快速提升:

供给曲线会明显改善。

因此:

HBM真正的拐点不是价格下降,而是供给增长开始超过AI GPU带来的新增需求。

这一天如果出现,HBM产业的“卖方市场”才会真正转向。

八、HBM资产传导
GPU升级
↓
HBM容量增加
↓
HBM wafer demand
↓
DRAM wafer allocation
↓
HBM ASP
↓
Samsung / SK hynix / Micron
↓
HBM利润

所以HBM是六条产业链里非常典型的:

技术升级 + 供给受限 + 高价值量

三重驱动。

九、第三条:光通信

如果说HBM解决的是:

GPU“脑子里的高速记忆”。

那么光通信解决的是:

GPU之间怎么高速交换信息。
十、为什么AI Factory让光通信发生结构性变化?

传统数据中心:

Server
↓
Switch
↓
Network

AI Factory:

GPU Rack
↓
Switch
↓
Thousands GPU
↓
Tens of Thousands GPU
↓
Hundreds of Thousands GPU

网络带宽呈指数级增长。

NVIDIA已经把Spectrum-X Ethernet Photonics直接定位为百万GPU AI Factory的网络基础设施,并采用CPO路线。(NVIDIA 投资者关系)

十一、现在光通信处于什么阶段?

非常明确:

800G规模化 → 1.6T导入 → CPO/LPO加速。

TrendForce预计2026年AI光模块市场规模约260亿美元,同比增长超过57%;800G及以上产品需求快速增长,但EML、CW laser等关键光电芯片供应仍然紧张。(TrendForce)

所以光通信现在并不是:

单纯数量增长。

而是:

数量 × 速率 × 架构升级

三重增长。

十二、光通信真正的瓶颈

目前主要在:

上游

  1. EML
  2. CW laser
  3. InP
  4. Silicon Photonics
  5. DSP

中游

  1. 光引擎
  2. 耦合
  3. 光学封装
  4. 精密对准
  5. 模块测试

下游

  1. 800G
  2. 1.6T
  3. CPO
  4. LPO

TrendForce特别指出,光模块扩产目前受制于光电芯片供应和高精度光学对准制造能力。(TrendForce)

十三、光通信的供需拐点

这里有一个很关键的判断:

800G的供需拐点与1.6T的供需拐点不会同时出现。

可能出现:

800G
需求高速增长
↓
供给扩张
↓
价格/利润率开始下降

同时

1.6T
↓
刚进入量产
↓
新一轮供给紧张

所以:

光通信不能用一个行业库存周期去看。

必须按速率代际拆。

十四、光通信资产传导
AI Cluster规模
↓
Network bandwidth
↓
800G
↓
1.6T
↓
CPO
↓
Laser / EML / Silicon Photonics
↓
Optical Module
↓
Switch

这里真正有价值的公司,不一定是“光模块数量最多”。

而可能是:

掌握下一代1.6T/CPO关键技术和产能的人。
十五、第四条:PCB

这一条非常容易被市场低估。

因为PCB看起来:

技术含量不如GPU。

但AI Rack的PCB已经不是传统服务器PCB。

十六、AI PCB发生了什么变化?

AI服务器对PCB的要求同时提高:

  1. 层数
  2. 高速信号完整性
  3. 高频材料
  4. 铜厚
  5. 尺寸
  6. 功耗
  7. 散热
  8. 连接器密度

而且交换机PCB同样升级。

例如800G交换机的PCB可能达到20~28层,高端GPU服务器主板达到16~24层。2026年相关供应链报告显示,高层高速板需求快速增加,复杂板交期出现明显拉长。(AtlasPCB)

S&P Global也指出,AI服务器的高组件密度、大内存配置以及更多连接器和电容,正在推高PCB组装成本和供应压力。(S&P Global)

十七、PCB真正的瓶颈是什么?

不是:

PCB总产能。

而是:

高端高速PCB产能。

这就是典型的结构性供需。

例如:

普通PCB
供给充足

AI高速PCB
供给紧张

所以不能看PCB行业平均产能利用率。

必须看:

高速高层板产能利用率。
十八、PCB供需拐点

PCB产业可能出现:

AI服务器数量 ↑
+
单机PCB价值量 ↑
+
交换机升级 ↑
+
高速材料使用量 ↑

所以即使:

GPU数量增速下降

PCB价值量仍可能增长。

这是非常重要的:

单位算力的PCB价值量提升。
十九、PCB资产传导
AI Rack
↓
GPU数量
↓
PCB层数
↓
PCB面积
↓
高速材料
↓
铜箔 / 覆铜板
↓
高端PCB

因此PCB产业的核心跟踪变量不是:

AI服务器增长多少。

而是:

每一代AI Rack的PCB价值量提升多少。
二十、第五条:液冷

这一条已经进入一个非常明确的拐点。

2025年:

液冷开始普及。

2026年:

液冷开始成为高端AI基础设施的标准配置。

TrendForce预计AI芯片液冷渗透率2026年达到53%,2027年接近60%,较2025年的约33%显著提升。(TrendForce)

二十一、为什么液冷的逻辑比过去强?

因为GPU功耗已经进入:

单芯片1kW以上。

而AI Rack:

数百kW。

因此空气冷却越来越难。

二十二、液冷产业链实际上分三层

第一层:芯片侧

  1. Heat Spreader
  2. Cold Plate

第二层:Rack侧

  1. Manifold
  2. Quick Connector
  3. Tubing
  4. Pump

第三层:Facility侧

  1. CDU
  2. Heat Exchanger
  3. Facility Water
  4. Heat Rejection

因此:

液冷不是一个产品,而是一套系统。
二十三、液冷真正的产业拐点

最值得关注的不是:

“液冷渗透率上升”。

而是:

液冷从GPU冷板,向整个Rack扩展。

TrendForce已经指出,Rubin采用全液冷设计,液冷覆盖范围进一步扩展到GPU、CPU、CX9 NIC、busbar/power board甚至部分光模块。(TrendForce)

这意味着:

液冷的单Rack价值量正在提升。
二十四、液冷资产传导
GPU TDP ↑
↓
Rack power ↑
↓
Liquid Cooling
↓
Cold Plate
↓
Manifold
↓
CDU
↓
Facility Cooling

这是一条非常干净的产业传导。

二十五、第六条:电力

六条产业链里:

目前最值得重视的是电力。

原因不是它增长最快。

而是:

它开始决定AI Factory能不能建成。
二十六、AI数据中心最大的瓶颈已经开始从“芯片”向“电网”迁移

TD Economics 2026年7月的分析指出,美国数据中心扩张面临严重电力接入约束,一些主要市场的并网等待时间达到数年;Northern Virginia的等待时间甚至可达到7年。(TD经济学)

更重要的是:

即使电力本身存在,也可能没有设备把它送进数据中心。
二十七、真正的电力瓶颈不是发电,而是Grid Equipment

Johns Hopkins 2026年的分析指出,下一阶段AI数据中心的瓶颈可能首先出现在:

  1. Data Center Transformer
  2. UPS
  3. Bulk Transformer

而不是发电本身。

在高增长情景下,其模型估计2027年数据中心变压器未满足需求可达14.1 GVA、UPS达到22.1 GVA。(能源研究所)

这非常重要。

因为市场容易形成一个错误认知:

“美国没电。”

实际上更准确的说法是:

美国缺的是快速、可靠、可接入AI Factory的电力基础设施。
二十八、电力产业链可以继续往下拆
Generation
↓
Transmission
↓
Substation
↓
Transformer
↓
Switchgear
↓
UPS
↓
Power Distribution
↓
800V DC
↓
Rack

现在最紧的是中间这段。

尤其:

Transformer

已经成为一个非常重要的瓶颈。

Reuters 2026年7月报道,美国变压器供应持续紧张,部分高压变压器交期已经从疫情前约一年拉长到多年。(Investing.com)

二十九、电力的供需拐点为什么最慢?

因为GPU:

几个月可以生产。

PCB:

可以扩产。

光模块:

可以扩产。

液冷:

可以扩产。

但是:

变压器、电网、发电机组、输电线路

都是多年级项目。

所以:

GPU供给周期
月
↓
HBM
季度~年度
↓
光模块
季度~年度
↓
液冷
季度~年度
↓
变压器
年
↓
电网
数年

这就是为什么:

电力可能成为AI基础设施最持久的瓶颈。
三十、电力资产传导
AI CapEx
↓
AI Factory
↓
MW / GW
↓
Grid Connection
↓
Transformer
↓
Switchgear / UPS
↓
Generation
↓
Natural Gas / Nuclear / Storage

因此电力产业的投资机会并不只是:

发电公司。

实际上最先被拉动的可能是:

变压器 → 配电设备 → UPS → 燃机 → 输电设备 → 发电。
三十一、六条产业链放在一起

现在就能看出一个非常清晰的结构:

AI需求
│
▼
GPU
│
▼
HBM
│
▼
AI Rack
┌──────┼──────┐
▼ ▼ ▼
PCB Optical Liquid
│ │ │
└──────┼──────┘
▼
AI Cluster
│
▼
AI Factory
│
▼
Power
│
▼
Grid

但是六条链的“紧张程度”不同。

三十二、当前瓶颈排序:不要简单理解为谁最重要

如果从限制AI Factory新增有效算力的程度来看,当前更应该关注:

第一层:Power

因为没有电,整个Factory不能上线。

第二层:HBM

因为HBM已经开始反向影响GPU产品配置。

第三层:Optical / Network

因为万卡以上规模下,网络决定GPU能否形成有效计算集群。

第四层:Liquid Cooling

高密度Rack必须解决热问题。

第五层:PCB

高端高速板出现结构性紧张。

第六层:GPU

GPU本身已经进入更强的规模化生产阶段,但仍存在系统级供应约束。

这里不是说GPU不重要。

而是:

GPU越来越从“唯一瓶颈”变成“整个系统瓶颈中的一个环节”。
三十三、真正值得交易研究的是“瓶颈迁移”

这是这六条链最有价值的地方。

假设2026年:

GPU紧张
HBM紧张
Optical紧张
Power紧张

那么市场可能集中交易:

GPU / HBM / Optical。

但是一年以后:

GPU供给改善
HBM扩产
Optical扩产
Power仍然紧张

市场的超额收益逻辑就可能迁移:

GPU → Power Equipment。

再之后:

Power解决
Cooling成为瓶颈

又会迁移:

Power → Cooling。

所以真正的研究框架不是:

哪个产业最好?

而是:

AI Factory的新增1GW,现在最缺什么?
三十四、建立“AI Factory边际1GW模型”

我认为这甚至可以直接成为产棱的一个核心指标。

每新增:

1GW AI Factory

需要多少:

GPU
HBM
CPU
DPU
Switch
Optical
PCB
Copper
Liquid Cooling
Transformer
UPS
Power Generation

然后每一代产品更新一次。

例如:

1GW
↓
GPU数量
↓
HBM数量
↓
Rack数量
↓
Optical ports
↓
PCB面积
↓
Cooling capacity
↓
Transformer capacity

这样你就不再是在看新闻。

而是在建立:

AI Factory物理需求模型。
三十五、六条链的“拐点”应该这样判断
产业当前阶段真正的供给拐点真正的需求拐点
GPU规模化放量先进封装/系统产能释放AI CapEx下降
HBM强约束HBM4e良率+DRAM产能GPU HBM配置下降
光通信800G→1.6TLaser/封装扩产Cluster建设放缓
PCB高端结构紧张高速板产能释放AI服务器增速下降
液冷快速渗透CDU/冷板产能释放Rack功率增长放缓
电力强约束Transformer/Grid扩产AI Factory新增GW下降

注意:

供给拐点 ≠ 股价拐点。

这两者之间还隔着:

供需
↓
价格
↓
订单
↓
收入
↓
毛利率
↓
EPS
↓
估值
↓
股价

这才是你真正要做的资产传导。

三十六、所以六条产业链的资产传导速度也不同

GPU

最快。

订单
→收入
→利润
→股价

HBM

中等。

HBM价格
→ASP
→利润
→股价

光通信

中等偏快。

800G/1.6T需求
→出货
→ASP
→利润

PCB

中等。

AI Rack
→高端板需求
→产能利用率
→价格
→利润

液冷

中等偏慢。

Rack功率
→液冷渗透
→CDU/Cold Plate
→收入

电力

最慢。

AI Factory规划
→电力订单
→设备交付
→并网
→收入
→利润

因此:

越靠近芯片,周期越快;越靠近电网,周期越长。
三十七、最值得建立的“AI Factory瓶颈仪表盘”

如果把这套东西真正放进产棱,我建议最终不要每天写六篇文章。

只需要维护一个动态状态表:

产业链当前状态瓶颈变量供给方向需求方向价格龙头业绩下一验证
GPU放量系统交付↑↑→/↑强Rubin交付
HBM紧张DRAM/HBM4↑但不足↑↑↑强HBM4e良率
Optical紧张Laser/1.6T↑↑↑↑强1.6T量产
PCB紧张高速高层板↑↑↑强高端板利用率
Liquid渗透CDU/Cold Plate↑↑↑↑→/↑改善Rack功率
Power极紧Transformer/Grid↑但慢↑↑↑改善GW并网

这张表比每天看几十条新闻有价值得多。

三十八、最后形成真正的“产棱六大瓶颈池”

我会把美国AI Factory最终压缩成六个动态变量:

AI FACTORY STATE
│
┌──────────────┼──────────────┐
│ │ │
GPU HBM Optical
│ │ │
└──────────────┼──────────────┘
│
AI Rack
│
┌─────┴─────┐
│ │
PCB Liquid
│ │
└─────┬─────┘
│
AI Factory
│
Power
│
▼
GW

每一个池都只问五个问题:

① 现在是什么状态?

紧张 / 平衡 / 宽松。

② 为什么?

需求还是供给?

③ 瓶颈在哪里?

晶圆、HBM、Laser、PCB、CDU还是Transformer?

④ 什么时候可能改变?

产能、技术、产品迭代、CapEx变化。

⑤ 资产有没有反映?

这是最重要的一层。

最终结论

目前美国AI Factory正在经历的并不是简单的:

“GPU需求继续增长。”

而是一个更加复杂的过程:

GPU规模化 → HBM约束 → 网络升级 → 光通信升级 → Rack功率密度提升 → 液冷普及 → GW级电力需求 → 电网设备成为硬约束。

也就是说:

AI算力的瓶颈正在从“芯片制造”逐步向“整个物理基础设施”迁移。

而截至2026年9月,最值得跟踪的几个拐点分别是:

GPU: 从“芯片短缺”向“系统部署能力”迁移。(美国证券交易委员会)

HBM: 仍然是最明确的半导体供应约束之一,HBM4e验证、DRAM wafer allocation和stacking yield是关键变量。(TrendForce)

光通信: 800G继续扩张,1.6T开始进入关键量产窗口,上游Laser/EML仍存在供给约束。(TrendForce)

PCB: 高速高层AI服务器/交换机板出现结构性紧张,真正需要观察的是高端板而不是整个PCB行业。(S&P Global)

液冷: 已经从“可选方案”向高端AI基础设施标准配置转变,2026年渗透率预计达到53%,2027年接近60%。(TrendForce)

电力: 正在成为最硬、最长周期的约束,且瓶颈不仅是发电,而是并网、变压器、UPS和配电设备。(能源研究所)

所以,如果把这六条产业链真正用于交易研究,我认为最重要的不是给六个行业分别下结论,而是持续寻找一个东西:

“美国AI Factory新增的下一GW,最缺什么?”

因为下一GW最缺的东西,就是下一阶段最有可能出现产业定价权转移的地方。

而当这个变量从GPU → HBM → 光通信 → 液冷 → 电力不断迁移时,AI硬件行情的领涨方向也会随之迁移。