产棱拆解 | 美国AI Factory六大产业链:从瓶颈到资产传导
结论:截至2026年9月,美国AI Factory的六条产业链并不处于同一个周期位置。GPU已经从“绝对稀缺”逐渐进入规模化供给;HBM仍然是强约束;光通信处于高速升级+局部上游瓶颈;PCB正在从普通增量进入高端结构性紧张;液冷从渗透率提升进入规模化放量;电力则已经成为整个美国AI Factory扩张的最硬约束之一,而且瓶颈正在从“有没有电”进一步下沉到“变压器、UPS、燃机、并网设备能不能交付”。 NVIDIA自己在最新10-Q中也明确表示,Rubin已经开始量产,但仍存在供应约束,同时客户的数据中心土地、电力、建筑壳体和资本都可能限制GPU部署。
下面按六条链分别拆。
美国AI Factory六大产业链:从瓶颈到资产传导
一、先建立一个总框架
AI Factory不是六条平行产业链。
它实际上是一条不断向物理世界传导的链:
六条产业链的周期位置,我先用一句话概括:
| 产业链当前状态(2026年9月)当前核心瓶颈周期判断 | |||
| GPU | 高需求、规模化放量 | 系统级供给/部署能力 | 从芯片瓶颈向基础设施瓶颈迁移 |
| HBM | 强需求、供给紧 | DRAM晶圆、HBM堆叠/良率 | 仍处强约束 |
| 光通信 | 800G→1.6T升级 | EML/CW laser、封装、产能 | 高景气+代际升级 |
| PCB | 高端板需求快速增长 | 高层高速板、材料、产能 | 结构性紧张 |
| 液冷 | 高端AI服务器快速渗透 | 冷板/CDU/系统交付 | 从导入期进入放量期 |
| 电力 | 最大系统约束之一 | 变压器、UPS、并网、燃机 | 最强约束,且周期最长 |
这个表最重要的地方是:
越往产业链下游,瓶颈越偏向“物理世界”;越往上游,技术升级越快。二、第一条:GPU产业链
1. GPU已经不是最简单的“缺货逻辑”
2023~2024年的AI行情,核心逻辑是:
GPU不够。
到了2026年,逻辑已经发生变化。
NVIDIA Rubin已经进入量产,NVL72成为新的Rack级计算单元;Vera Rubin POD甚至把1,152颗Rubin GPU、CPU、网络和存储组织成一个完整AI超级计算系统。(NVIDIA Developer)
所以现在真正的问题已经变成:
GPU能不能被快速装进一个可通电、可散热、可联网的AI Factory。
这和单纯生产GPU完全不同。
2. GPU供应链现在最大的约束在哪里?
不是简单的晶圆。
而是:
任何一环不足:
GPU都无法变成可用算力。
NVIDIA最新10-Q甚至直接把土地、电力、数据中心shell、资本等列为影响AI基础设施部署的关键条件。(美国证券交易委员会)
因此GPU产业正在出现一个非常重要的周期变化:
第一阶段
GPU稀缺。
第二阶段
GPU规模化供应。
第三阶段
GPU等待数据中心基础设施。
美国现在正在进入第二阶段向第三阶段过渡。
三、GPU真正的供需拐点在哪里?不要只看:
GPU出货量。
应该看:
GPU出货量 × 可上线率。
例如:
那么真正的有效供给只有70万。
所以未来GPU产业的重要变量变成:
Installed GPU → Energized GPU → Utilized GPU
三者不是一回事。
四、GPU资产传导GPU产业的传导路径:
真正需要观察的是:
Hyperscaler CapEx有没有继续向上?
如果CapEx继续增加:
GPU→HBM→Server→Network→Cooling→Power都会继续受益。
如果CapEx增速下降:
最先受影响的是:
GPU及高端服务器。
但是由于电力和基础设施存在长周期约束,CapEx放缓并不一定立即意味着电力、变压器等环节转弱。
这就是产业链不同步。
五、第二条:HBM这一条目前比GPU更值得警惕。
1. HBM已经成为“算力密度”的约束
Rubin GPU最高配置达到:
- 288GB HBM4
- 22TB/s HBM带宽
这意味着每一颗GPU本身就消耗大量高性能DRAM。(NVIDIA Developer)
而AI Factory规模不断扩大:
这会导致一个非常特殊的现象:
GPU出货增长不一定需要HBM需求同比例增长,但GPU性能升级通常会提高每颗GPU的HBM价值量。六、当前HBM最大的瓶颈
2026年真正需要关注的是:
HBM4/HBM4e的产能爬坡和DRAM晶圆资源。
TrendForce在2026年8月的判断非常明确:DRAM供应预计到2027年仍然偏紧,HBM4e验证与12-Hi堆叠的量产存在不确定性;其预计2027年HBM bit shipments增长50%~60%,仍可能无法跟上需求增长。(TrendForce)
甚至出现一个非常值得重视的产业现象:
NVIDIA正在评估降低Rubin Ultra的HBM堆叠规格。
这不是需求下降。
恰恰相反:
是HBM供给约束开始反向影响GPU产品设计。
这就是典型的产业瓶颈证据。
七、HBM的供需拐点怎么看?需要看三个变量:
① HBM bit supply增长
如果:
供给增速 < AI GPU需求增速
继续紧。
② HBM每GPU容量
如果:
288GB → 更高容量
需求继续加速。
③ HBM4e良率
如果良率快速提升:
供给曲线会明显改善。
因此:
HBM真正的拐点不是价格下降,而是供给增长开始超过AI GPU带来的新增需求。
这一天如果出现,HBM产业的“卖方市场”才会真正转向。
八、HBM资产传导所以HBM是六条产业链里非常典型的:
技术升级 + 供给受限 + 高价值量
三重驱动。
九、第三条:光通信如果说HBM解决的是:
GPU“脑子里的高速记忆”。
那么光通信解决的是:
GPU之间怎么高速交换信息。十、为什么AI Factory让光通信发生结构性变化?
传统数据中心:
AI Factory:
网络带宽呈指数级增长。
NVIDIA已经把Spectrum-X Ethernet Photonics直接定位为百万GPU AI Factory的网络基础设施,并采用CPO路线。(NVIDIA 投资者关系)
十一、现在光通信处于什么阶段?非常明确:
800G规模化 → 1.6T导入 → CPO/LPO加速。
TrendForce预计2026年AI光模块市场规模约260亿美元,同比增长超过57%;800G及以上产品需求快速增长,但EML、CW laser等关键光电芯片供应仍然紧张。(TrendForce)
所以光通信现在并不是:
单纯数量增长。
而是:
数量 × 速率 × 架构升级
三重增长。
十二、光通信真正的瓶颈目前主要在:
上游
- EML
- CW laser
- InP
- Silicon Photonics
- DSP
中游
- 光引擎
- 耦合
- 光学封装
- 精密对准
- 模块测试
下游
- 800G
- 1.6T
- CPO
- LPO
TrendForce特别指出,光模块扩产目前受制于光电芯片供应和高精度光学对准制造能力。(TrendForce)
十三、光通信的供需拐点这里有一个很关键的判断:
800G的供需拐点与1.6T的供需拐点不会同时出现。
可能出现:
所以:
光通信不能用一个行业库存周期去看。
必须按速率代际拆。
十四、光通信资产传导这里真正有价值的公司,不一定是“光模块数量最多”。
而可能是:
掌握下一代1.6T/CPO关键技术和产能的人。十五、第四条:PCB
这一条非常容易被市场低估。
因为PCB看起来:
技术含量不如GPU。
但AI Rack的PCB已经不是传统服务器PCB。
十六、AI PCB发生了什么变化?AI服务器对PCB的要求同时提高:
- 层数
- 高速信号完整性
- 高频材料
- 铜厚
- 尺寸
- 功耗
- 散热
- 连接器密度
而且交换机PCB同样升级。
例如800G交换机的PCB可能达到20~28层,高端GPU服务器主板达到16~24层。2026年相关供应链报告显示,高层高速板需求快速增加,复杂板交期出现明显拉长。(AtlasPCB)
S&P Global也指出,AI服务器的高组件密度、大内存配置以及更多连接器和电容,正在推高PCB组装成本和供应压力。(S&P Global)
十七、PCB真正的瓶颈是什么?不是:
PCB总产能。
而是:
高端高速PCB产能。
这就是典型的结构性供需。
例如:
所以不能看PCB行业平均产能利用率。
必须看:
高速高层板产能利用率。十八、PCB供需拐点
PCB产业可能出现:
所以即使:
GPU数量增速下降
PCB价值量仍可能增长。
这是非常重要的:
单位算力的PCB价值量提升。十九、PCB资产传导
因此PCB产业的核心跟踪变量不是:
AI服务器增长多少。
而是:
每一代AI Rack的PCB价值量提升多少。二十、第五条:液冷
这一条已经进入一个非常明确的拐点。
2025年:
液冷开始普及。
2026年:
液冷开始成为高端AI基础设施的标准配置。
TrendForce预计AI芯片液冷渗透率2026年达到53%,2027年接近60%,较2025年的约33%显著提升。(TrendForce)
二十一、为什么液冷的逻辑比过去强?因为GPU功耗已经进入:
单芯片1kW以上。
而AI Rack:
数百kW。
因此空气冷却越来越难。
二十二、液冷产业链实际上分三层第一层:芯片侧
- Heat Spreader
- Cold Plate
第二层:Rack侧
- Manifold
- Quick Connector
- Tubing
- Pump
第三层:Facility侧
- CDU
- Heat Exchanger
- Facility Water
- Heat Rejection
因此:
液冷不是一个产品,而是一套系统。二十三、液冷真正的产业拐点
最值得关注的不是:
“液冷渗透率上升”。
而是:
液冷从GPU冷板,向整个Rack扩展。
TrendForce已经指出,Rubin采用全液冷设计,液冷覆盖范围进一步扩展到GPU、CPU、CX9 NIC、busbar/power board甚至部分光模块。(TrendForce)
这意味着:
液冷的单Rack价值量正在提升。二十四、液冷资产传导
这是一条非常干净的产业传导。
二十五、第六条:电力六条产业链里:
目前最值得重视的是电力。
原因不是它增长最快。
而是:
它开始决定AI Factory能不能建成。二十六、AI数据中心最大的瓶颈已经开始从“芯片”向“电网”迁移
TD Economics 2026年7月的分析指出,美国数据中心扩张面临严重电力接入约束,一些主要市场的并网等待时间达到数年;Northern Virginia的等待时间甚至可达到7年。(TD经济学)
更重要的是:
即使电力本身存在,也可能没有设备把它送进数据中心。二十七、真正的电力瓶颈不是发电,而是Grid Equipment
Johns Hopkins 2026年的分析指出,下一阶段AI数据中心的瓶颈可能首先出现在:
- Data Center Transformer
- UPS
- Bulk Transformer
而不是发电本身。
在高增长情景下,其模型估计2027年数据中心变压器未满足需求可达14.1 GVA、UPS达到22.1 GVA。(能源研究所)
这非常重要。
因为市场容易形成一个错误认知:
“美国没电。”
实际上更准确的说法是:
美国缺的是快速、可靠、可接入AI Factory的电力基础设施。二十八、电力产业链可以继续往下拆
现在最紧的是中间这段。
尤其:
Transformer
已经成为一个非常重要的瓶颈。
Reuters 2026年7月报道,美国变压器供应持续紧张,部分高压变压器交期已经从疫情前约一年拉长到多年。(Investing.com)
二十九、电力的供需拐点为什么最慢?因为GPU:
几个月可以生产。
PCB:
可以扩产。
光模块:
可以扩产。
液冷:
可以扩产。
但是:
变压器、电网、发电机组、输电线路
都是多年级项目。
所以:
这就是为什么:
电力可能成为AI基础设施最持久的瓶颈。三十、电力资产传导
因此电力产业的投资机会并不只是:
发电公司。
实际上最先被拉动的可能是:
变压器 → 配电设备 → UPS → 燃机 → 输电设备 → 发电。三十一、六条产业链放在一起
现在就能看出一个非常清晰的结构:
但是六条链的“紧张程度”不同。
三十二、当前瓶颈排序:不要简单理解为谁最重要如果从限制AI Factory新增有效算力的程度来看,当前更应该关注:
第一层:Power
因为没有电,整个Factory不能上线。
第二层:HBM
因为HBM已经开始反向影响GPU产品配置。
第三层:Optical / Network
因为万卡以上规模下,网络决定GPU能否形成有效计算集群。
第四层:Liquid Cooling
高密度Rack必须解决热问题。
第五层:PCB
高端高速板出现结构性紧张。
第六层:GPU
GPU本身已经进入更强的规模化生产阶段,但仍存在系统级供应约束。
这里不是说GPU不重要。
而是:
GPU越来越从“唯一瓶颈”变成“整个系统瓶颈中的一个环节”。三十三、真正值得交易研究的是“瓶颈迁移”
这是这六条链最有价值的地方。
假设2026年:
那么市场可能集中交易:
GPU / HBM / Optical。
但是一年以后:
市场的超额收益逻辑就可能迁移:
GPU → Power Equipment。
再之后:
又会迁移:
Power → Cooling。
所以真正的研究框架不是:
哪个产业最好?
而是:
AI Factory的新增1GW,现在最缺什么?三十四、建立“AI Factory边际1GW模型”
我认为这甚至可以直接成为产棱的一个核心指标。
每新增:
1GW AI Factory
需要多少:
然后每一代产品更新一次。
例如:
这样你就不再是在看新闻。
而是在建立:
AI Factory物理需求模型。三十五、六条链的“拐点”应该这样判断
| 产业当前阶段真正的供给拐点真正的需求拐点 | |||
| GPU | 规模化放量 | 先进封装/系统产能释放 | AI CapEx下降 |
| HBM | 强约束 | HBM4e良率+DRAM产能 | GPU HBM配置下降 |
| 光通信 | 800G→1.6T | Laser/封装扩产 | Cluster建设放缓 |
| PCB | 高端结构紧张 | 高速板产能释放 | AI服务器增速下降 |
| 液冷 | 快速渗透 | CDU/冷板产能释放 | Rack功率增长放缓 |
| 电力 | 强约束 | Transformer/Grid扩产 | AI Factory新增GW下降 |
注意:
供给拐点 ≠ 股价拐点。
这两者之间还隔着:
这才是你真正要做的资产传导。
三十六、所以六条产业链的资产传导速度也不同GPU
最快。
HBM
中等。
光通信
中等偏快。
PCB
中等。
液冷
中等偏慢。
电力
最慢。
因此:
越靠近芯片,周期越快;越靠近电网,周期越长。三十七、最值得建立的“AI Factory瓶颈仪表盘”
如果把这套东西真正放进产棱,我建议最终不要每天写六篇文章。
只需要维护一个动态状态表:
| 产业链当前状态瓶颈变量供给方向需求方向价格龙头业绩下一验证 | |||||||
| GPU | 放量 | 系统交付 | ↑ | ↑ | →/↑ | 强 | Rubin交付 |
| HBM | 紧张 | DRAM/HBM4 | ↑但不足 | ↑↑ | ↑ | 强 | HBM4e良率 |
| Optical | 紧张 | Laser/1.6T | ↑ | ↑↑ | ↑ | 强 | 1.6T量产 |
| PCB | 紧张 | 高速高层板 | ↑ | ↑ | ↑ | 强 | 高端板利用率 |
| Liquid | 渗透 | CDU/Cold Plate | ↑↑ | ↑↑ | →/↑ | 改善 | Rack功率 |
| Power | 极紧 | Transformer/Grid | ↑但慢 | ↑↑ | ↑ | 改善 | GW并网 |
这张表比每天看几十条新闻有价值得多。
三十八、最后形成真正的“产棱六大瓶颈池”我会把美国AI Factory最终压缩成六个动态变量:
每一个池都只问五个问题:
① 现在是什么状态?
紧张 / 平衡 / 宽松。
② 为什么?
需求还是供给?
③ 瓶颈在哪里?
晶圆、HBM、Laser、PCB、CDU还是Transformer?
④ 什么时候可能改变?
产能、技术、产品迭代、CapEx变化。
⑤ 资产有没有反映?
这是最重要的一层。
最终结论目前美国AI Factory正在经历的并不是简单的:
“GPU需求继续增长。”
而是一个更加复杂的过程:
GPU规模化 → HBM约束 → 网络升级 → 光通信升级 → Rack功率密度提升 → 液冷普及 → GW级电力需求 → 电网设备成为硬约束。
也就是说:
AI算力的瓶颈正在从“芯片制造”逐步向“整个物理基础设施”迁移。
而截至2026年9月,最值得跟踪的几个拐点分别是:
GPU: 从“芯片短缺”向“系统部署能力”迁移。(美国证券交易委员会)
HBM: 仍然是最明确的半导体供应约束之一,HBM4e验证、DRAM wafer allocation和stacking yield是关键变量。(TrendForce)
光通信: 800G继续扩张,1.6T开始进入关键量产窗口,上游Laser/EML仍存在供给约束。(TrendForce)
PCB: 高速高层AI服务器/交换机板出现结构性紧张,真正需要观察的是高端板而不是整个PCB行业。(S&P Global)
液冷: 已经从“可选方案”向高端AI基础设施标准配置转变,2026年渗透率预计达到53%,2027年接近60%。(TrendForce)
电力: 正在成为最硬、最长周期的约束,且瓶颈不仅是发电,而是并网、变压器、UPS和配电设备。(能源研究所)
所以,如果把这六条产业链真正用于交易研究,我认为最重要的不是给六个行业分别下结论,而是持续寻找一个东西:
“美国AI Factory新增的下一GW,最缺什么?”
因为下一GW最缺的东西,就是下一阶段最有可能出现产业定价权转移的地方。
而当这个变量从GPU → HBM → 光通信 → 液冷 → 电力不断迁移时,AI硬件行情的领涨方向也会随之迁移。