产棱 · IndPrism China 算力全产业链传导分析

产棱拆解 | 美国百万GPU时代:从GPU集群到AI Factory的完整架构

产棱 技术拆解 基础设施
本文 3 节
  1. 核心结论
  2. 1. 第一代:服务器时代
  3. 产业跟踪变量
时间基准:2026年9月。
一个需要先说明的事实:“美国百万GPU”目前更适合作为正在形成的基础设施时代,而不是已经完成的单一项目。公开披露已经出现10GW级AI基础设施、1GW级AI集群、数万GPU跨建筑互联,以及“millions of GPUs”的部署规划。OpenAI在2025年宣布与NVIDIA合作部署至少10GW、对应数百万GPU的下一代基础设施;2026年4月又宣布其Stargate美国基础设施已超过10GW目标。(OpenAI)

核心结论

美国AI基础设施正在发生一次根本性的架构变化:

数据中心正在从“承载服务器的建筑物”,演变为“直接生产智能Token的工业系统”。

过去的数据中心以服务器、CPU、虚拟机和存储为基本单位。

未来的AI数据中心则以:

GPU Rack → GPU Pod → Supercluster → AI Factory → AI Superfactory

为基本组织方式。

这意味着,AI基础设施竞争的核心已经不再只是“谁拥有更多GPU”,而是:

谁能够把计算、HBM、网络、光通信、存储、电力、液冷、软件和数据中心工程组织成一个高利用率、高可靠性的整体。

这也是为什么2026年的美国AI基础设施建设开始出现几个明显变化:

  1. 单个GPU不再是主要工程单位,Rack成为新的计算单元;
  2. 单个数据中心不再是终点,多个数据中心开始组成一个逻辑超级集群;
  3. 网络不再只是连接服务器,而是成为计算系统的一部分;
  4. 电力和液冷不再是数据中心的后端配套,而开始参与芯片和系统设计;
  5. AI Factory开始同时优化tokens / watt / dollar;
  6. 百万GPU最终不是一个超级机房,而是一张由多个GW级AI Factory组成的计算基础设施网络。

NVIDIA在Vera Rubin平台上已经公开采用“从电网到芯片”的共同设计思路;其NVL72将72颗GPU通过NVLink 6组成一个高度耦合的计算域,单GPU双向带宽3.6TB/s,整机架达到260TB/s。(NVIDIA Developer)

与此同时,Meta的Prometheus已经采用1GW级集群架构,通过Backend Aggregation将多个数据中心建筑中的数万GPU连接为一个大型计算系统。(Engineering at Meta)

因此:

百万GPU时代真正的研究对象,不应该再叫“GPU产业链”,而应该叫“AI Factory产业链”。
一、从“GPU服务器”到“AI Factory”

1. 第一代:服务器时代

传统数据中心的逻辑非常简单:

CPU
│
├── DRAM
├── SSD
├── NIC
└── Network

服务器是独立计算单元。

服务器之间通过网络连接。

应用运行在服务器上。

因此:

服务器是计算的基本单位。
2. 第二代:GPU服务器

深度学习出现以后,架构变成:

CPU
│
├── GPU
├── GPU
├── GPU
└── GPU

CPU负责调度。

GPU负责矩阵计算。

GPU之间通过PCIe等方式通信。

此时:

GPU成为AI计算的核心。

但是当模型越来越大,这套架构出现根本性问题。

3. 第三代:GPU Rack

模型规模扩大以后,4~8颗GPU已经不足以完成任务。

于是开始出现:

8 GPU
↓
16 GPU
↓
32 GPU
↓
64 GPU
↓
72 GPU

GPU不再只是服务器中的加速卡。

而开始变成:

一个机架级计算系统。

Vera Rubin NVL72就是典型案例。

它将72颗Rubin GPU、36颗Vera CPU以及NVLink、SuperNIC、DPU等组成一个完整的Rack级系统。(NVIDIA 投资者关系)

二、为什么72颗GPU要被设计成一个整体?

这是理解AI Factory最重要的一步。

假设有72颗GPU:

GPU1
GPU2
GPU3
...
GPU72

如果它们之间通信效率很低:

GPU计算
↓
等待数据
↓
通信
↓
继续计算

那么增加GPU数量并不能线性增加有效算力。

因此真正的问题变成:

如何让72颗GPU尽可能像一颗超级GPU一样工作?

答案就是Scale-up。

三、Scale-up:NVLink成为“机架内部总线”

Vera Rubin NVL72采用第六代NVLink。

公开规格显示:

  1. 单GPU双向带宽:3.6TB/s
  2. Rack级带宽:260TB/s
  3. 72 GPU全互联
  4. 支持all-to-all通信
  5. 网络内部还能够执行部分collective operations。(NVIDIA Developer)

这意味着:

NVLink Switch
/ / | \ \
/ / | \ \
GPU GPU GPU GPU GPU
\ \ | / /
\ \ | / /
GPU Pool

软件看到的已经不再只是72个独立GPU。

而是:

一个大型统一计算域。

这就是AI基础设施第一次真正从:

“很多GPU”

转向:

“一个GPU系统”。
四、Rubin实际上在重新定义“计算机”

这是一个非常重要的变化。

传统计算机:

CPU
+
Memory
+
Storage
+
I/O

AI超级计算机:

GPU
+
HBM
+
NVLink
+
NIC
+
DPU
+
CPU
+
Storage
+
Network
+
Cooling
+
Power

因此:

AI时代的“计算机”已经从芯片扩展到了机架。

NVIDIA甚至明确将Vera Rubin定位为面向AI Factory的rack-scale平台,并通过CPU、GPU、NVLink、DPU、SuperNIC、Ethernet等共同设计形成完整系统。(NVIDIA Developer)

五、从Rack到Pod

72 GPU只是第一层。

如果需要训练更大的模型:

NVL72
↓
NVL72
↓
NVL72
↓
NVL72

就必须进一步连接。

因此:

Rack → Pod

成为第二层架构。

NVIDIA公开的Vera Rubin POD就是这种思路。

一个POD可以由不同类型的Rack组成,包括:

  1. GPU Rack
  2. CPU Rack
  3. Storage / Context Memory Rack
  4. Network Rack
  5. Inference Accelerator Rack

公开架构中的Vera Rubin POD可以达到:

1,152颗Rubin GPU。(NVIDIA Developer)

这说明:

GPU已经不是单独扩展,而是在整个系统中按功能进行模块化扩展。
六、为什么1000 GPU以后网络突然变得极其重要?

因为到了这个规模:

GPU之间的通信本身就是计算。

训练大型MoE模型时,大量GPU必须不断交换:

  1. activation
  2. gradient
  3. expert routing
  4. parameter
  5. KV cache
  6. collective communication

OpenAI公开解释过,大规模模型训练中的单个step可能涉及数百万次GPU间数据传输,因此网络可靠性和通信效率已经直接影响训练效率。(OpenAI)

所以:

网络已经从“基础设施”变成了“计算资源”。
七、Scale-out:从NVLink走向数据中心网络

Scale-up解决:

一个Rack内部怎么通信。

Scale-out解决:

数千、数万GPU之间怎么通信。

典型结构变成:

GPU
↓
SuperNIC
↓
Leaf
↓
Spine
↓
Super Spine
↓
其他GPU Rack

主要技术路线包括:

  1. InfiniBand
  2. Ethernet
  3. RoCE
  4. SuperNIC
  5. DPU
  6. AI专用交换芯片
  7. 光模块
  8. 光交换

因此到了百万GPU时代:

交换芯片、NIC、DPU和光通信不再是GPU的外围产业,而是计算系统的一部分。
八、真正具有战略意义的案例:Meta Prometheus

Meta的Prometheus提供了一个非常重要的现实样本。

它不是:

一个巨大建筑里塞满GPU。

而是:

多个数据中心建筑共同组成一个AI Cluster。

Meta公开披露:

  1. Prometheus目标规模:1GW
  2. 数万GPU
  3. 分布于多个数据中心建筑
  4. 通过Backend Aggregation连接
  5. BAG层连接多个数据中心区域
  6. 区域之间的互联能力达到PB级。(Engineering at Meta)

其架构可以抽象成:

Data Center A
│
├── GPU Fabric
│
└── Spine
│
↓
BAG
│
Data Center B
│
├── GPU Fabric
│
└── Spine
│
↓
BAG
│
Data Center C

于是:

建筑物边界不再等于计算边界。

这是AI数据中心最重要的变化之一。

九、AI Factory为什么必须跨建筑?

因为GPU密度越来越高。

如果把所有GPU放在一个建筑里,会产生:

  1. 电力集中问题
  2. 散热问题
  3. 供电可靠性问题
  4. 网络故障域问题
  5. 施工问题
  6. 电网接入问题
  7. 土地限制

所以更加合理的方式是:

AI Factory
│
┌─────────┼─────────┐
↓ ↓ ↓
Building A Building B Building C
│ │ │
GPU GPU GPU
└─────────┼─────────┘
↓
High-speed
Network

因此未来:

AI Factory实际上是一个逻辑计算空间,而不是一栋建筑。
十、百万GPU不是一个数据中心

这是理解“百万GPU”的关键。

假设:

1个AI Factory
≈ 数万GPU

10个AI Factory
≈ 数十万GPU

几十个AI Factory
≈ 百万GPU

所以百万GPU更合理的架构是:

U.S. AI Compute
│
┌────────────────────┼────────────────────┐
│ │ │
AI Factory A AI Factory B AI Factory C
│ │ │
1GW+ 1GW+ 1GW+
│ │ │
10K+ GPU 10K+ GPU 10K+ GPU
│ │ │
└────────────────────┼────────────────────┘
│
AI WAN / Backbone
│
Distributed Compute

所以:

百万GPU实际上是一张计算基础设施网络。
十一、真正的瓶颈开始从GPU向电力转移

这是整个产业链最值得关注的变化。

2023年,美国数据中心耗电约176TWh,占美国电力消费约4.4%。

DOE/LBNL预计,到2028年可能达到325~580TWh,对应美国总用电量的6.7%~12%。(The Department of Energy's Energy.gov)

这意味着:

AI算力扩张已经开始成为美国电力基础设施问题。
十二、GW已经成为AI基础设施的新单位

传统数据中心讨论:

MW。

未来越来越讨论:

GW。

OpenAI在Stargate体系中已经进入10GW级基础设施规划;Microsoft 2026年公布的Pecos数据中心园区也规划增加约2GW容量。(OpenAI)

因此:

MW Data Center
↓
100MW
↓
500MW
↓
1GW
↓
5GW
↓
10GW

这不是简单扩大服务器数量。

而是:

工业基础设施尺度的变化。
十三、为什么电力开始反向决定芯片设计?

以前逻辑:

Chip
↓
Server
↓
Data Center
↓
Power

现在越来越变成:

Grid
↓
Power Architecture
↓
Rack Power
↓
Cooling
↓
System Architecture
↓
Chip

Microsoft近期公开讨论的趋势非常明确:

Rack已经从几十kW进入数百kW级,数据中心园区可以达到GW级。

因此电力、散热已经开始参与系统设计,而不是部署完成之后再解决。(The Official Microsoft Blog)

十四、800V DC:电力架构开始重构

AI Rack功率越来越高以后,传统低压配电面临效率、铜材、损耗和空间问题。

2026年,Google、Microsoft和NVIDIA在OCP框架下推动800V DC作为下一代AI数据中心的开放电力架构。

核心原因很简单:

更高电压,可以用更少的导体传输同样功率。

(开放计算项目)

于是AI数据中心的电力链开始出现:

Grid
↓
Substation
↓
High Voltage
↓
800V DC
↓
Power Shelf
↓
Rack
↓
GPU

这意味着:

AI芯片正在反向推动电力电子产业升级。
十五、液冷成为计算系统的一部分

GPU功耗持续上升以后,空气冷却越来越难以承担高密度Rack。

因此:

GPU
↓
Cold Plate
↓
Coolant
↓
CDU
↓
Facility Water
↓
Heat Rejection

液冷不再只是“服务器散热”。

它已经成为:

AI Factory的基础设施层。

更重要的是:

功率密度越高 → 液冷需求越强。

所以:

GPU升级 → Rack功率提高 → 液冷升级

形成直接产业传导。

十六、HBM为什么仍然是整个系统的核心瓶颈之一?

GPU算力再强,如果数据喂不进去:

GPU就会等待。

因此:

GPU Compute
↕
HBM Bandwidth
↕
Network Bandwidth
↕
Storage Bandwidth

必须共同增长。

Rubin GPU采用HBM4,公开资料显示单GPU最高可提供22TB/s内存带宽和288GB容量。(NVIDIA Developer)

因此HBM的价值不能只看:

每颗GPU需要多少HBM。

真正应该看:

AI Factory每增加1GW,需要多少GPU?每颗GPU需要多少HBM?整个系统需要多少内存带宽?

这才是需求模型。

十七、存储开始从“容量”转向“数据供给速度”

传统存储强调:

GB / TB / PB。

AI Factory越来越强调:

数据能多快地喂给GPU。

因此存储架构变成:

AI Compute
│
┌───────────┼───────────┐
↓ ↓ ↓
HBM DRAM NVMe
│ │ │
└───────────┼───────────┘
↓
Distributed Storage
↓
Object Storage

而推理时代又增加:

KV Cache / Context Memory。

这意味着未来存储产业链不能只研究:

  1. NAND价格
  2. SSD容量

而需要研究:

GPU计算和Memory之间如何重新分工。

NVIDIA已经把BlueField-4 STX、Context Memory Storage等纳入Rubin体系,说明存储已经进入AI Factory核心架构。(NVIDIA Developer)

十八、DPU:把GPU从“杂事”中解放出来

当GPU达到数万甚至百万规模以后,GPU不能浪费计算资源处理:

  1. 网络
  2. 存储
  3. 安全
  4. 虚拟化
  5. 数据搬运

因此:

GPU
│
└── AI计算

CPU
│
└── 应用/控制

DPU
│
├── Network
├── Storage
├── Security
└── Infrastructure

这就是DPU存在的意义。

所以:

DPU实际上是在提高昂贵GPU的有效利用率。
十九、软件成为AI Factory最重要的“隐形基础设施”

硬件堆起来并不等于算力。

真正有效的是:

Goodput。

也就是:

单位时间真正完成了多少有效AI工作。

所以未来AI Factory的核心指标会越来越从:

GPU FLOPS

转向:

tokens / watt / dollar

Microsoft已经明确将tokens per watt per dollar作为其Cloud & Token Factory的重要优化指标。(微软)

这非常重要。

因为:

100万GPU × 30%利用率

和

100万GPU × 70%利用率

实际上是完全不同的计算基础设施。

二十、因此软件优化会直接产生“虚拟算力”

例如:

GPU数量不变
↓
网络优化
↓
通信等待下降
↓
GPU利用率提高
↓
有效Token增加

或者:

GPU数量不变
↓
模型并行优化
↓
通信减少
↓
训练效率提高
↓
等价于增加GPU

所以未来:

软件优化本身就是一种算力供给。

这也是为什么NVIDIA、Microsoft、Meta、OpenAI都在进行硬件—网络—软件共同设计。

OpenAI甚至已经联合AMD、Broadcom、Intel、Microsoft和NVIDIA推动MRC网络协议,以提高超大训练集群中的网络性能和可靠性。(OpenAI)

二十一、百万GPU时代的完整物理架构

把所有东西放到一起:

AI APPLICATION
│
MODEL / AGENT
│
┌────────────┴────────────┐
│ │
Training Inference
│ │
└────────────┬────────────┘
↓
AI SOFTWARE
│
┌────────────────┼────────────────┐
↓ ↓ ↓
Compute Network Storage
│ │ │
GPU / CPU NIC / Switch HBM / DRAM
│ │ │
│ Optical │
│ │ │
└────────────────┼────────────────┘
↓
GPU RACK / NVL72
│
NVLink Scale-up
│
↓
GPU POD
│
Ethernet / IB
│
↓
SUPERCLUSTER
│
Backend Aggregation
│
↓
AI FACTORY
│
┌────────────┴────────────┐
│ │
POWER COOLING
│ │
Grid / Substation Liquid Cooling
│ │
Generation / Storage CDU / Heat Rejection
│ │
└────────────┬────────────┘
↓
MULTI-SITE CAMPUS
│
↓
AI SUPERFACTORY
│
↓
MILLIONS OF GPUs

这就是未来真正的AI基础设施。

二十二、百万GPU真正的“六大瓶颈”

从产业研究角度,我认为整个体系可以压缩成六个核心瓶颈池。

瓶颈核心变量向上影响
ComputeGPU / CPU / Accelerator算力
MemoryHBM / DRAM / KV Cache数据供给
NetworkNVLink / NIC / Switch / DPUGPU协同
Optical800G / 1.6T / CPOScale-out
ThermalLiquid Cooling / CDU功率密度
PowerGrid / Transformer / 800V DCAI Factory扩张

这六个瓶颈并不是平行关系。

而是存在明显的传导:

AI需求
↓
GPU需求
↓
HBM需求
↓
Rack密度提高
↓
Network需求
↓
Optical需求
↓
Power density提高
↓
Liquid Cooling
↓
GW电力需求
↓
Transformer / Grid / Generation

因此:

AI产业链本质上是一条“算力密度不断向物理世界传导”的链条。
二十三、最重要的变化:瓶颈会不断迁移

这可能是研究AI硬件最重要的方法论。

不能问:

“AI最大的瓶颈是什么?”

应该问:

“当前阶段最大的瓶颈是什么?它什么时候会被解决?解决之后瓶颈会迁移到哪里?”

例如:

阶段A

GPU供应不足

GPU涨价。

↓

阶段B

GPU供应改善。

HBM不足

HBM成为瓶颈。

↓

阶段C

HBM改善。

Network不足

光模块、交换机成为瓶颈。

↓

阶段D

Network改善。

Power不足

变压器、电网、发电成为瓶颈。

↓

阶段E

Power改善。

Cooling不足

液冷成为瓶颈。

↓

阶段F

全部基础设施改善。

AI workload不足

最终开始检验:

这些算力有没有真正被模型需求吃掉。
二十四、所以“百万GPU”真正需要跟踪的不是GPU数量

这是整个报告最重要的结论之一。

如果只跟踪:

NVIDIA GPU出货量

会丢失大量信息。

真正应该跟踪:

第一层:AI需求

Training demand
Inference demand
Reasoning
Agentic workload
Token generation

↓

第二层:算力建设

GPU shipments
Rack shipments
Cluster deployment
AI Factory GW

↓

第三层:基础设施瓶颈

HBM
Networking
Optical
Cooling
Power

↓

第四层:实际利用率

GPU utilization
Training efficiency
Inference throughput
Tokens / watt
Tokens / dollar

↓

第五层:资产价格

产业状态
↓
供需变化
↓
企业订单
↓
利润
↓
资产定价

这才真正形成:

产业状态 → 资产状态
二十五、美国百万GPU时代的核心产业传导

可以进一步浓缩成一条主链:

AI应用需求
↓
模型规模 / 推理Token
↓
AI Compute Demand
↓
GPU
↓
HBM
↓
AI Rack
↓
NVLink
↓
Network
↓
Optical
↓
Cluster
↓
AI Factory
↓
Power
↓
Grid / Generation

同时从另外一条路径:

GPU功率
↓
Rack功率密度
↓
Liquid Cooling
↓
CDU
↓
Facility Cooling

两条路径最终汇合:

AI Factory
/ \
Network Power
│ │
Optical Cooling
\ /
\ /
Compute

这才是美国AI基础设施的真实产业结构。

二十六、一个非常重要的判断:AI Factory正在成为新的“超级计算机”

传统超级计算机:

一栋建筑 + 一套超级计算系统。

AI Factory:

多栋建筑 + 多个计算Fabric + 多层网络 + GW级电力 + 大规模液冷 + 软件调度系统。

因此AI Factory其实是在重新定义:

什么叫一台计算机。

过去:

一台电脑 = CPU + Memory + Storage。

现在:

一台AI超级计算机 = 一个AI Factory。

甚至未来:

一个AI Superfactory = 多个AI Factory的集合。
二十七、这也是美国AI基础设施最值得研究的地方

OpenAI的Stargate、Microsoft的AI Superfactory、Meta的Prometheus,并不是三个孤立项目。

它们代表的是同一个产业方向:

从单点GPU集群向超大规模、跨建筑、跨园区、网络化AI计算基础设施演进。

Microsoft已经将不同地点的数据中心通过专用AI WAN连接成AI superfactory;Meta则通过BAG将多个数据中心区域连接为大型计算集群。(Source)

因此未来美国的算力基础设施更可能呈现:

AI SUPERFACTORY
│
┌────────────┼────────────┐
│ │ │
Factory A Factory B Factory C
│ │ │
1GW+ 1GW+ 1GW+
│ │ │
10K+ GPU 10K+ GPU 10K+ GPU
│ │ │
└────────────┼────────────┘
│
AI WAN
│
Distributed Compute

最终形成:

美国级AI计算网络。
二十八、为什么这可能是未来几年最大的产业基础设施周期之一?

因为它同时推动多个产业发生资本开支扩张:

半导体

GPU、CPU、DPU、交换芯片。

存储

HBM、DRAM、SSD、KV Cache Memory。

光通信

800G、1.6T、CPO、硅光。

PCB

高速高频、高层数、大尺寸、高速连接。

封装

先进封装、Chiplet、HBM封装。

服务器

Rack、液冷服务器、系统集成。

电力

变压器、开关设备、UPS、配电。

电网

输电、变电、并网。

发电

天然气、核电、地热、储能以及其他稳定电源。

热管理

冷板、CDU、液冷系统、热交换器。

所以:

AI Factory不是一个产业,而是一轮跨产业资本开支周期。
二十九、但最大的风险也恰恰在这里

百万GPU并不自动意味着:

百万GPU都能产生同等价值。

真正需要验证的是:

Capital Expenditure
↓
GPU Deployment
↓
Cluster Availability
↓
GPU Utilization
↓
Token Production
↓
Revenue
↓
Cash Flow

中间任何一个环节出现问题,都会造成:

算力供给超过有效需求。

因此AI基础设施研究不能停留在:

“又建了一个GW数据中心。”

而必须继续问:

这个GW最终被什么工作负载吃掉?

三十、最终研究框架:从“GPU数量”升级为“AI Factory状态”

未来跟踪美国AI算力,我认为最有效的框架应该是:

观察层核心问题
AI需求Token / Agent / Reasoning是否继续增长?
ComputeGPU部署速度是否加快?
MemoryHBM是否仍然约束GPU扩张?
NetworkScale-up/Scale-out是否出现瓶颈?
Optical800G→1.6T→CPO的迁移速度如何?
PowerGW级电力是否成为主要约束?
CoolingRack功率密度是否推动液冷升级?
FactoryAI Factory建设速度是否加快?
UtilizationGPU实际利用率是否提高?
Economicstokens/watt/dollar是否改善?
Asset产业变化是否已经反映到资产价格?

最终形成一个真正可以持续跟踪的状态模型:

AI DEMAND
↓
COMPUTE DEMAND
↓
┌───────────┼───────────┐
↓ ↓ ↓
Compute Memory Network
│ │ │
└───────────┼───────────┘
↓
AI RACK
↓
POD
↓
SUPERCLUSTER
↓
AI FACTORY
↙ ↘
POWER COOLING
↘ ↙
AI FACTORY
↓
TOKEN OUTPUT
↓
REVENUE
↓
ASSET PRICING
三十一、最终判断

美国“百万GPU时代”真正发生的事情,并不是:

美国要建很多GPU服务器。

而是:

计算正在从“芯片产品”升级为“工业基础设施”。

GPU只是最上游的计算核心。

真正决定百万GPU能否发挥作用的,是:

HBM能否持续供给;

NVLink能否把GPU组织成统一计算域;

网络能否把数万GPU连接起来;

光通信能否支撑跨机架、跨建筑、跨园区的数据交换;

存储能否持续喂给GPU;

液冷能否处理越来越高的功率密度;

电网能否提供GW级稳定电力;

软件能否把硬件转化为高利用率的Token生产能力。

因此,AI基础设施的终极形态不是:

GPU Cluster。

而是:

AI Factory。

而百万GPU也不是一个数字终点。

它代表的是:

一个国家开始把计算能力按照电力、钢铁、通信网络一样的工业基础设施来建设。

这也是为什么未来几年研究AI产业,不能再单独研究“GPU行情”。

真正需要研究的是:

AI Factory建设处于什么阶段?当前最大的物理瓶颈在哪里?瓶颈正在向哪里迁移?哪一层的资本开支开始加速?哪一层的供给开始改善?最后这些产业变化是否已经传导到企业利润和资产价格?

这才是“美国百万GPU时代”最核心的研究框架。

产业跟踪变量

如果把这套报告最终落到实际交易研究,我会把它压缩成下面这张表:

层级每周/每月跟踪变量真正要判断的东西
AI需求Token、Agent、Reasoning算力需求是否继续上升
GPUNVIDIA/AMD系统出货Compute供给
HBM价格、产能、订单Memory瓶颈
RackNVL72等部署量GPU密度
NetworkIB/Ethernet/SuperNICScale-out
Optical800G/1.6T/CPO网络带宽瓶颈
PCB高速层数、材料系统复杂度
Liquid CoolingCDU、冷板、液冷渗透率功率密度
PowerMW/GW并网、变压器算力扩张上限
Factory新园区、建设进度CapEx周期
UtilizationGPU利用率、tokens/watt有效算力
EconomicsCapEx/Token/Revenue商业闭环
Asset龙头业绩与股价产业是否已经定价

其中最值得长期盯的不是“GPU卖了多少”,而是最后三个变量:

AI Factory新增GW → GPU实际利用率 → 每GW产生多少有效Token/收入。

因为这三个变量,最终决定:

美国到底是在建设“更多算力”,还是正在形成真正可以持续产生经济价值的“AI工业体系”。