产棱拆解 | 美国百万GPU时代:从GPU集群到AI Factory的完整架构
本文 3 节
时间基准:2026年9月。
一个需要先说明的事实:“美国百万GPU”目前更适合作为正在形成的基础设施时代,而不是已经完成的单一项目。公开披露已经出现10GW级AI基础设施、1GW级AI集群、数万GPU跨建筑互联,以及“millions of GPUs”的部署规划。OpenAI在2025年宣布与NVIDIA合作部署至少10GW、对应数百万GPU的下一代基础设施;2026年4月又宣布其Stargate美国基础设施已超过10GW目标。(OpenAI)
核心结论
美国AI基础设施正在发生一次根本性的架构变化:
数据中心正在从“承载服务器的建筑物”,演变为“直接生产智能Token的工业系统”。
过去的数据中心以服务器、CPU、虚拟机和存储为基本单位。
未来的AI数据中心则以:
GPU Rack → GPU Pod → Supercluster → AI Factory → AI Superfactory
为基本组织方式。
这意味着,AI基础设施竞争的核心已经不再只是“谁拥有更多GPU”,而是:
谁能够把计算、HBM、网络、光通信、存储、电力、液冷、软件和数据中心工程组织成一个高利用率、高可靠性的整体。
这也是为什么2026年的美国AI基础设施建设开始出现几个明显变化:
- 单个GPU不再是主要工程单位,Rack成为新的计算单元;
- 单个数据中心不再是终点,多个数据中心开始组成一个逻辑超级集群;
- 网络不再只是连接服务器,而是成为计算系统的一部分;
- 电力和液冷不再是数据中心的后端配套,而开始参与芯片和系统设计;
- AI Factory开始同时优化tokens / watt / dollar;
- 百万GPU最终不是一个超级机房,而是一张由多个GW级AI Factory组成的计算基础设施网络。
NVIDIA在Vera Rubin平台上已经公开采用“从电网到芯片”的共同设计思路;其NVL72将72颗GPU通过NVLink 6组成一个高度耦合的计算域,单GPU双向带宽3.6TB/s,整机架达到260TB/s。(NVIDIA Developer)
与此同时,Meta的Prometheus已经采用1GW级集群架构,通过Backend Aggregation将多个数据中心建筑中的数万GPU连接为一个大型计算系统。(Engineering at Meta)
因此:
百万GPU时代真正的研究对象,不应该再叫“GPU产业链”,而应该叫“AI Factory产业链”。一、从“GPU服务器”到“AI Factory”
1. 第一代:服务器时代
传统数据中心的逻辑非常简单:
服务器是独立计算单元。
服务器之间通过网络连接。
应用运行在服务器上。
因此:
服务器是计算的基本单位。2. 第二代:GPU服务器
深度学习出现以后,架构变成:
CPU负责调度。
GPU负责矩阵计算。
GPU之间通过PCIe等方式通信。
此时:
GPU成为AI计算的核心。
但是当模型越来越大,这套架构出现根本性问题。
3. 第三代:GPU Rack模型规模扩大以后,4~8颗GPU已经不足以完成任务。
于是开始出现:
GPU不再只是服务器中的加速卡。
而开始变成:
一个机架级计算系统。
Vera Rubin NVL72就是典型案例。
它将72颗Rubin GPU、36颗Vera CPU以及NVLink、SuperNIC、DPU等组成一个完整的Rack级系统。(NVIDIA 投资者关系)
二、为什么72颗GPU要被设计成一个整体?这是理解AI Factory最重要的一步。
假设有72颗GPU:
如果它们之间通信效率很低:
那么增加GPU数量并不能线性增加有效算力。
因此真正的问题变成:
如何让72颗GPU尽可能像一颗超级GPU一样工作?
答案就是Scale-up。
三、Scale-up:NVLink成为“机架内部总线”Vera Rubin NVL72采用第六代NVLink。
公开规格显示:
- 单GPU双向带宽:3.6TB/s
- Rack级带宽:260TB/s
- 72 GPU全互联
- 支持all-to-all通信
- 网络内部还能够执行部分collective operations。(NVIDIA Developer)
这意味着:
软件看到的已经不再只是72个独立GPU。
而是:
一个大型统一计算域。
这就是AI基础设施第一次真正从:
“很多GPU”
转向:
“一个GPU系统”。四、Rubin实际上在重新定义“计算机”
这是一个非常重要的变化。
传统计算机:
AI超级计算机:
因此:
AI时代的“计算机”已经从芯片扩展到了机架。
NVIDIA甚至明确将Vera Rubin定位为面向AI Factory的rack-scale平台,并通过CPU、GPU、NVLink、DPU、SuperNIC、Ethernet等共同设计形成完整系统。(NVIDIA Developer)
五、从Rack到Pod72 GPU只是第一层。
如果需要训练更大的模型:
就必须进一步连接。
因此:
Rack → Pod
成为第二层架构。
NVIDIA公开的Vera Rubin POD就是这种思路。
一个POD可以由不同类型的Rack组成,包括:
- GPU Rack
- CPU Rack
- Storage / Context Memory Rack
- Network Rack
- Inference Accelerator Rack
公开架构中的Vera Rubin POD可以达到:
1,152颗Rubin GPU。(NVIDIA Developer)
这说明:
GPU已经不是单独扩展,而是在整个系统中按功能进行模块化扩展。六、为什么1000 GPU以后网络突然变得极其重要?
因为到了这个规模:
GPU之间的通信本身就是计算。
训练大型MoE模型时,大量GPU必须不断交换:
- activation
- gradient
- expert routing
- parameter
- KV cache
- collective communication
OpenAI公开解释过,大规模模型训练中的单个step可能涉及数百万次GPU间数据传输,因此网络可靠性和通信效率已经直接影响训练效率。(OpenAI)
所以:
网络已经从“基础设施”变成了“计算资源”。七、Scale-out:从NVLink走向数据中心网络
Scale-up解决:
一个Rack内部怎么通信。
Scale-out解决:
数千、数万GPU之间怎么通信。
典型结构变成:
主要技术路线包括:
- InfiniBand
- Ethernet
- RoCE
- SuperNIC
- DPU
- AI专用交换芯片
- 光模块
- 光交换
因此到了百万GPU时代:
交换芯片、NIC、DPU和光通信不再是GPU的外围产业,而是计算系统的一部分。八、真正具有战略意义的案例:Meta Prometheus
Meta的Prometheus提供了一个非常重要的现实样本。
它不是:
一个巨大建筑里塞满GPU。
而是:
多个数据中心建筑共同组成一个AI Cluster。
Meta公开披露:
- Prometheus目标规模:1GW
- 数万GPU
- 分布于多个数据中心建筑
- 通过Backend Aggregation连接
- BAG层连接多个数据中心区域
- 区域之间的互联能力达到PB级。(Engineering at Meta)
其架构可以抽象成:
于是:
建筑物边界不再等于计算边界。
这是AI数据中心最重要的变化之一。
九、AI Factory为什么必须跨建筑?因为GPU密度越来越高。
如果把所有GPU放在一个建筑里,会产生:
- 电力集中问题
- 散热问题
- 供电可靠性问题
- 网络故障域问题
- 施工问题
- 电网接入问题
- 土地限制
所以更加合理的方式是:
因此未来:
AI Factory实际上是一个逻辑计算空间,而不是一栋建筑。十、百万GPU不是一个数据中心
这是理解“百万GPU”的关键。
假设:
所以百万GPU更合理的架构是:
所以:
百万GPU实际上是一张计算基础设施网络。十一、真正的瓶颈开始从GPU向电力转移
这是整个产业链最值得关注的变化。
2023年,美国数据中心耗电约176TWh,占美国电力消费约4.4%。
DOE/LBNL预计,到2028年可能达到325~580TWh,对应美国总用电量的6.7%~12%。(The Department of Energy's Energy.gov)
这意味着:
AI算力扩张已经开始成为美国电力基础设施问题。十二、GW已经成为AI基础设施的新单位
传统数据中心讨论:
MW。
未来越来越讨论:
GW。
OpenAI在Stargate体系中已经进入10GW级基础设施规划;Microsoft 2026年公布的Pecos数据中心园区也规划增加约2GW容量。(OpenAI)
因此:
这不是简单扩大服务器数量。
而是:
工业基础设施尺度的变化。十三、为什么电力开始反向决定芯片设计?
以前逻辑:
现在越来越变成:
Microsoft近期公开讨论的趋势非常明确:
Rack已经从几十kW进入数百kW级,数据中心园区可以达到GW级。
因此电力、散热已经开始参与系统设计,而不是部署完成之后再解决。(The Official Microsoft Blog)
十四、800V DC:电力架构开始重构AI Rack功率越来越高以后,传统低压配电面临效率、铜材、损耗和空间问题。
2026年,Google、Microsoft和NVIDIA在OCP框架下推动800V DC作为下一代AI数据中心的开放电力架构。
核心原因很简单:
更高电压,可以用更少的导体传输同样功率。
(开放计算项目)
于是AI数据中心的电力链开始出现:
这意味着:
AI芯片正在反向推动电力电子产业升级。十五、液冷成为计算系统的一部分
GPU功耗持续上升以后,空气冷却越来越难以承担高密度Rack。
因此:
液冷不再只是“服务器散热”。
它已经成为:
AI Factory的基础设施层。
更重要的是:
功率密度越高 → 液冷需求越强。
所以:
GPU升级 → Rack功率提高 → 液冷升级
形成直接产业传导。
十六、HBM为什么仍然是整个系统的核心瓶颈之一?GPU算力再强,如果数据喂不进去:
GPU就会等待。
因此:
必须共同增长。
Rubin GPU采用HBM4,公开资料显示单GPU最高可提供22TB/s内存带宽和288GB容量。(NVIDIA Developer)
因此HBM的价值不能只看:
每颗GPU需要多少HBM。
真正应该看:
AI Factory每增加1GW,需要多少GPU?每颗GPU需要多少HBM?整个系统需要多少内存带宽?
这才是需求模型。
十七、存储开始从“容量”转向“数据供给速度”传统存储强调:
GB / TB / PB。
AI Factory越来越强调:
数据能多快地喂给GPU。
因此存储架构变成:
而推理时代又增加:
KV Cache / Context Memory。
这意味着未来存储产业链不能只研究:
- NAND价格
- SSD容量
而需要研究:
GPU计算和Memory之间如何重新分工。
NVIDIA已经把BlueField-4 STX、Context Memory Storage等纳入Rubin体系,说明存储已经进入AI Factory核心架构。(NVIDIA Developer)
十八、DPU:把GPU从“杂事”中解放出来当GPU达到数万甚至百万规模以后,GPU不能浪费计算资源处理:
- 网络
- 存储
- 安全
- 虚拟化
- 数据搬运
因此:
这就是DPU存在的意义。
所以:
DPU实际上是在提高昂贵GPU的有效利用率。十九、软件成为AI Factory最重要的“隐形基础设施”
硬件堆起来并不等于算力。
真正有效的是:
Goodput。
也就是:
单位时间真正完成了多少有效AI工作。
所以未来AI Factory的核心指标会越来越从:
GPU FLOPS
转向:
tokens / watt / dollar
Microsoft已经明确将tokens per watt per dollar作为其Cloud & Token Factory的重要优化指标。(微软)
这非常重要。
因为:
实际上是完全不同的计算基础设施。
二十、因此软件优化会直接产生“虚拟算力”例如:
或者:
所以未来:
软件优化本身就是一种算力供给。
这也是为什么NVIDIA、Microsoft、Meta、OpenAI都在进行硬件—网络—软件共同设计。
OpenAI甚至已经联合AMD、Broadcom、Intel、Microsoft和NVIDIA推动MRC网络协议,以提高超大训练集群中的网络性能和可靠性。(OpenAI)
二十一、百万GPU时代的完整物理架构把所有东西放到一起:
这就是未来真正的AI基础设施。
二十二、百万GPU真正的“六大瓶颈”从产业研究角度,我认为整个体系可以压缩成六个核心瓶颈池。
| 瓶颈核心变量向上影响 | ||
| Compute | GPU / CPU / Accelerator | 算力 |
| Memory | HBM / DRAM / KV Cache | 数据供给 |
| Network | NVLink / NIC / Switch / DPU | GPU协同 |
| Optical | 800G / 1.6T / CPO | Scale-out |
| Thermal | Liquid Cooling / CDU | 功率密度 |
| Power | Grid / Transformer / 800V DC | AI Factory扩张 |
这六个瓶颈并不是平行关系。
而是存在明显的传导:
因此:
AI产业链本质上是一条“算力密度不断向物理世界传导”的链条。二十三、最重要的变化:瓶颈会不断迁移
这可能是研究AI硬件最重要的方法论。
不能问:
“AI最大的瓶颈是什么?”
应该问:
“当前阶段最大的瓶颈是什么?它什么时候会被解决?解决之后瓶颈会迁移到哪里?”
例如:
阶段A
GPU涨价。
↓
阶段B
GPU供应改善。
HBM成为瓶颈。
↓
阶段C
HBM改善。
光模块、交换机成为瓶颈。
↓
阶段D
Network改善。
变压器、电网、发电成为瓶颈。
↓
阶段E
Power改善。
液冷成为瓶颈。
↓
阶段F
全部基础设施改善。
最终开始检验:
这些算力有没有真正被模型需求吃掉。二十四、所以“百万GPU”真正需要跟踪的不是GPU数量
这是整个报告最重要的结论之一。
如果只跟踪:
NVIDIA GPU出货量
会丢失大量信息。
真正应该跟踪:
第一层:AI需求
↓
第二层:算力建设
↓
第三层:基础设施瓶颈
↓
第四层:实际利用率
↓
第五层:资产价格
这才真正形成:
产业状态 → 资产状态二十五、美国百万GPU时代的核心产业传导
可以进一步浓缩成一条主链:
同时从另外一条路径:
两条路径最终汇合:
这才是美国AI基础设施的真实产业结构。
二十六、一个非常重要的判断:AI Factory正在成为新的“超级计算机”传统超级计算机:
一栋建筑 + 一套超级计算系统。
AI Factory:
多栋建筑 + 多个计算Fabric + 多层网络 + GW级电力 + 大规模液冷 + 软件调度系统。
因此AI Factory其实是在重新定义:
什么叫一台计算机。
过去:
一台电脑 = CPU + Memory + Storage。
现在:
一台AI超级计算机 = 一个AI Factory。
甚至未来:
一个AI Superfactory = 多个AI Factory的集合。二十七、这也是美国AI基础设施最值得研究的地方
OpenAI的Stargate、Microsoft的AI Superfactory、Meta的Prometheus,并不是三个孤立项目。
它们代表的是同一个产业方向:
从单点GPU集群向超大规模、跨建筑、跨园区、网络化AI计算基础设施演进。
Microsoft已经将不同地点的数据中心通过专用AI WAN连接成AI superfactory;Meta则通过BAG将多个数据中心区域连接为大型计算集群。(Source)
因此未来美国的算力基础设施更可能呈现:
最终形成:
美国级AI计算网络。二十八、为什么这可能是未来几年最大的产业基础设施周期之一?
因为它同时推动多个产业发生资本开支扩张:
半导体
GPU、CPU、DPU、交换芯片。
存储
HBM、DRAM、SSD、KV Cache Memory。
光通信
800G、1.6T、CPO、硅光。
PCB
高速高频、高层数、大尺寸、高速连接。
封装
先进封装、Chiplet、HBM封装。
服务器
Rack、液冷服务器、系统集成。
电力
变压器、开关设备、UPS、配电。
电网
输电、变电、并网。
发电
天然气、核电、地热、储能以及其他稳定电源。
热管理
冷板、CDU、液冷系统、热交换器。
所以:
AI Factory不是一个产业,而是一轮跨产业资本开支周期。二十九、但最大的风险也恰恰在这里
百万GPU并不自动意味着:
百万GPU都能产生同等价值。
真正需要验证的是:
中间任何一个环节出现问题,都会造成:
算力供给超过有效需求。
因此AI基础设施研究不能停留在:
“又建了一个GW数据中心。”
而必须继续问:
这个GW最终被什么工作负载吃掉?
三十、最终研究框架:从“GPU数量”升级为“AI Factory状态”未来跟踪美国AI算力,我认为最有效的框架应该是:
| 观察层核心问题 | |
| AI需求 | Token / Agent / Reasoning是否继续增长? |
| Compute | GPU部署速度是否加快? |
| Memory | HBM是否仍然约束GPU扩张? |
| Network | Scale-up/Scale-out是否出现瓶颈? |
| Optical | 800G→1.6T→CPO的迁移速度如何? |
| Power | GW级电力是否成为主要约束? |
| Cooling | Rack功率密度是否推动液冷升级? |
| Factory | AI Factory建设速度是否加快? |
| Utilization | GPU实际利用率是否提高? |
| Economics | tokens/watt/dollar是否改善? |
| Asset | 产业变化是否已经反映到资产价格? |
最终形成一个真正可以持续跟踪的状态模型:
美国“百万GPU时代”真正发生的事情,并不是:
美国要建很多GPU服务器。
而是:
计算正在从“芯片产品”升级为“工业基础设施”。
GPU只是最上游的计算核心。
真正决定百万GPU能否发挥作用的,是:
HBM能否持续供给;
NVLink能否把GPU组织成统一计算域;
网络能否把数万GPU连接起来;
光通信能否支撑跨机架、跨建筑、跨园区的数据交换;
存储能否持续喂给GPU;
液冷能否处理越来越高的功率密度;
电网能否提供GW级稳定电力;
软件能否把硬件转化为高利用率的Token生产能力。
因此,AI基础设施的终极形态不是:
GPU Cluster。
而是:
AI Factory。
而百万GPU也不是一个数字终点。
它代表的是:
一个国家开始把计算能力按照电力、钢铁、通信网络一样的工业基础设施来建设。
这也是为什么未来几年研究AI产业,不能再单独研究“GPU行情”。
真正需要研究的是:
AI Factory建设处于什么阶段?当前最大的物理瓶颈在哪里?瓶颈正在向哪里迁移?哪一层的资本开支开始加速?哪一层的供给开始改善?最后这些产业变化是否已经传导到企业利润和资产价格?
这才是“美国百万GPU时代”最核心的研究框架。
产业跟踪变量
如果把这套报告最终落到实际交易研究,我会把它压缩成下面这张表:
| 层级每周/每月跟踪变量真正要判断的东西 | ||
| AI需求 | Token、Agent、Reasoning | 算力需求是否继续上升 |
| GPU | NVIDIA/AMD系统出货 | Compute供给 |
| HBM | 价格、产能、订单 | Memory瓶颈 |
| Rack | NVL72等部署量 | GPU密度 |
| Network | IB/Ethernet/SuperNIC | Scale-out |
| Optical | 800G/1.6T/CPO | 网络带宽瓶颈 |
| PCB | 高速层数、材料 | 系统复杂度 |
| Liquid Cooling | CDU、冷板、液冷渗透率 | 功率密度 |
| Power | MW/GW并网、变压器 | 算力扩张上限 |
| Factory | 新园区、建设进度 | CapEx周期 |
| Utilization | GPU利用率、tokens/watt | 有效算力 |
| Economics | CapEx/Token/Revenue | 商业闭环 |
| Asset | 龙头业绩与股价 | 产业是否已经定价 |
其中最值得长期盯的不是“GPU卖了多少”,而是最后三个变量:
AI Factory新增GW → GPU实际利用率 → 每GW产生多少有效Token/收入。
因为这三个变量,最终决定:
美国到底是在建设“更多算力”,还是正在形成真正可以持续产生经济价值的“AI工业体系”。