产棱 · IndPrism China 算力全产业链传导分析

产棱拆解 | 美国 AI Factory 与中国 AI Factory —百万级算力时代两套基础设施体系的深度对比

产棱 技术拆解 基础设施
本文 9 节
  1. 一、先给出核心结论
  2. AI Factory 的完整物理链
  3. 第一瓶颈:Compute
  4. 第二瓶颈:Memory
  5. 第三瓶颈:Packaging
  6. 第四瓶颈:Interconnect
  7. 第五瓶颈:Cooling
  8. 第六瓶颈:Power
  9. 六大物理瓶颈 + 三个系统变量

研究时间:2026年9月

一、先给出核心结论

如果把 AI 算力竞争继续理解成“谁的 GPU/NPU 更强”,已经不足以解释 2026 年之后的产业变化。

真正的竞争对象已经从:

芯片 → 芯片集群 → AI 超节点 → AI Factory → 超大规模算力网络

发生迁移。

而到了百万级处理器时代,真正决定系统能力的已经不是单颗处理器的 TOPS/FLOPS,而是:

有效AI产出=芯片数量×单芯片有效算力×集群利用率×网络效率×内存效率×软件效率\text{有效AI产出} = \text{芯片数量} \times \text{单芯片有效算力} \times \text{集群利用率} \times \text{网络效率} \times \text{内存效率} \times \text{软件效率}

再往前一步,则应该看:

AI Factory价值=有效Token资本投入+能源+运营成本\boxed{\text{AI Factory价值}=\frac{\text{有效Token}}{\text{资本投入+能源+运营成本}}}

因此,美国和中国真正需要比较的,不是“GPU 和 NPU 谁强”,而是:

谁能够把 10 万、50 万、100 万颗处理器,真正变成一个高利用率、高可靠、低成本、持续产生有效智能 Token 的计算系统。

这是整个问题的核心。

二、两套体系的第一性原理

先把美国和中国都放进同一个 AI Factory 模型。

AI Factory 的完整物理链

电力
↓
变电 / UPS / HVDC / 配电
↓
数据中心
↓
液冷
↓
机架
↓
CPU / GPU / NPU
↓
HBM / DRAM / SSD
↓
先进封装
↓
高速PCB
↓
SerDes
↓
NIC / DPU / SuperNIC
↓
光模块 / CPO / NPO
↓
Scale-up网络
↓
Scale-out网络
↓
存储网络
↓
集群调度
↓
训练 / 推理 / RL
↓
Token
↓
AI应用与商业收入

因此:

AI Factory 本质上不是数据中心。

它更接近:

一个把电力、半导体、通信、计算、软件和资本全部转换成“智能产出”的工业系统。
三、美国方案:以 GPU 为核心的“高度垂直整合 AI Factory”

美国路线目前最典型的代表是 NVIDIA。

但准确地说:

美国并不是只有 NVIDIA 路线。

至少存在三类体系:

第一类:NVIDIA GPU Factory

NVIDIA GPU + NVLink + InfiniBand / Spectrum-X + CUDA + DGX/MGX + AI Factory。

第二类:Google TPU Factory

TPU + ICI + Virgo Network + Pathways/JAX + Google Cloud。

第三类:云厂商/超大规模自研 ASIC

AWS、Microsoft、Meta 等围绕自身模型和云业务进行 ASIC、网络、存储和数据中心协同设计。

所以美国真正的优势不是“只有 GPU”。

而是:

形成了高度成熟的“芯片—网络—软件—云—模型—数据中心—资本”协同体系。
四、美国 AI Factory 的第一层:处理器

NVIDIA Vera Rubin 已经不是传统意义上的“GPU”。

它实际上已经演化成一个完整计算平台。

Vera Rubin 平台包括:

  1. Rubin GPU
  2. Vera CPU
  3. NVLink 6
  4. ConnectX-9 SuperNIC
  5. BlueField-4 DPU
  6. Spectrum-6 Ethernet
  7. Groq 3 LPX
  8. BlueField 存储体系
  9. AI Factory 管理软件

NVIDIA 明确把这些组件组合成一个 POD-scale 的超级计算系统。

这意味着:

NVIDIA 正在从 GPU 公司进一步向“AI 计算机公司”演化。
五、美国方案真正的关键:GPU 不再单独存在

传统服务器:

CPU
↓
PCIe
↓
GPU
↓
NIC

已经不适合百万级 AI。

新一代 AI Factory 更接近:

GPU ─ GPU ─ GPU
│ │ │
CPU ─ NIC ─ DPU
│ │ │
HBM SSD Network

所有组件都需要高度协同。

NVIDIA 的 Rubin NVL72 就是这种思路。

单个 NVL72:

  1. 72 GPU
  2. 36 Vera CPU
  3. NVLink 6
  4. 液冷
  5. 网络
  6. 存储
  7. 管理体系

共同形成一个计算单元。

因此:

NVL72 已经不是服务器,而是“计算机”。
六、美国第二层:HBM

GPU 算力再强,如果 HBM 跟不上,GPU 就无法持续发挥。

因此 AI Factory 的实际瓶颈正在从:

FLOPS

逐渐转向:

FLOPS + Memory Bandwidth + Memory Capacity

NVIDIA Rubin GPU 的公开架构已经达到:

  1. HBM4
  2. 288GB HBM
  3. 最高 22TB/s HBM 带宽

同时 NVLink 6 达到 3.6TB/s 级别的 GPU scale-up 带宽。

这说明一个非常重要的变化:

GPU 本身已经开始变成“计算 + 内存带宽”的融合系统。

因此:

HBM 已经不是 GPU 的配件,而是 AI Factory 的计算资源。
七、美国第三层:Scale-up

这是 NVIDIA 最核心的系统能力之一。

普通网络:

GPU
↓
NIC
↓
Switch
↓
NIC
↓
GPU

存在大量网络协议、交换、拥塞、延迟。

而 Scale-up:

GPU ←→ GPU
GPU ←→ GPU
GPU ←→ GPU

要求:

  1. 极低延迟
  2. 极高带宽
  3. 高效 collective communication
  4. 高可靠性
  5. 高利用率

NVIDIA 的 NVLink 正是解决这个问题。

所以:

NVLink 的价值不是“网络更快”,而是把多颗 GPU 的计算行为尽可能变成一个整体。
八、美国第四层:Scale-out

当 GPU 数量从几十颗扩大到数千、数万、数十万以后,NVLink 本身已经不够。

必须出现:

SuperPod
↓
Cluster
↓
SuperCluster
↓
AI Factory

这就是 InfiniBand / Spectrum-X 的位置。

NVIDIA 已经把 Spectrum-X Ethernet Photonics 纳入 Rubin AI Factory,并明确将 CPO 光互连作为百万 GPU AI Factory 的网络基础。

这说明:

美国百万 GPU 的真正瓶颈之一,是网络。
九、为什么美国开始进入 CPO?

原因非常简单。

当 GPU 数量增加:

1,000 GPU
10,000 GPU
100,000 GPU
1,000,000 GPU

光模块数量近似同步增长。

传统 pluggable optics:

Switch
↓
SerDes
↓
Electrical
↓
Optical Module
↓
Fiber

距离越长、速率越高:

  1. 功耗增加
  2. SerDes损耗增加
  3. 光模块数量增加
  4. 插拔模块增加
  5. 散热困难
  6. 故障点增加

所以最终会走向:

光电融合。

CPO 的意义不是单纯降低光模块功耗。

更深层的意义是:

让网络逐渐成为计算系统的一部分。
十、美国 AI Factory 的一个重要特点:网络与计算高度绑定

NVIDIA Rubin 的设计已经明显体现这一点。

GPU、CPU、DPU、NIC、Switch、Optics、Storage 不是分别设计,而是共同设计。

NVIDIA 甚至推出 DSX AI Factory reference design,把:

  1. 计算
  2. 电力
  3. 网络
  4. 液冷
  5. 调度
  6. 数据中心

共同优化。

NVIDIA 宣称 DSX Max-Q 可以在固定电力约束下部署更多 AI 基础设施,并通过软件调节实现 AI Factory 的电网灵活性。

这意味着美国方案正在从:

“提高芯片效率”

转向:

“提高整个 AI Factory 的有效产出效率”。
十一、美国方案的另一个核心:软件

这是中国方案目前最需要认真理解的地方。

NVIDIA 真正最深的护城河并不是 GPU。

而是:

CUDA
↓
cuDNN
↓
TensorRT
↓
NCCL
↓
NVLink
↓
DPU/NIC
↓
Cluster Manager
↓
AI Framework
↓
Cloud
↓
Model

最终形成一个完整生态。

所以 NVIDIA GPU 的价值实际上是:

GPU+Software+Network+EcosystemGPU + Software + Network + Ecosystem

而不是:

GPUGPU十二、Google 说明美国并不只有 NVIDIA

Google TPU 8 是非常重要的对照组。

Google TPU 8t:

  1. 9,600 TPU
  2. 121 EFLOPS
  3. 2PB shared memory
  4. ICI
  5. Virgo Network
  6. Pathways
  7. JAX

Google 已经公开表示可以走向:

1 million+ TPU chips in a single cluster

所以美国真正的技术路线不是:

“NVIDIA 赢。”

而是:

美国拥有多种高度垂直整合的 AI 超算体系。
十三、中国方案:并不是简单复制 NVIDIA

中国路线目前正在形成另一套体系。

核心可以概括为:

Ascend NPU
↓
HBM / Memory
↓
先进封装
↓
Atlas
↓
灵衢 UB
↓
SuperPoD
↓
SuperCluster
↓
3D Data Center
↓
国家算力网络

其中最重要的变化发生在 2026 年 9 月。

华为正式发布:

Peerium Computing Architecture

中文可以理解为:

面向 AI 时代的新计算架构。

其核心目标直接指向:

让百万处理器真正成为一台计算机。
十四、中国方案最值得研究的地方:灵衢

灵衢不是简单的“高速网络”。

它的设计目标是:

统一计算、内存、存储、网络的互联语义。

华为描述的 UB 可以连接:

  1. CPU
  2. NPU
  3. Memory
  4. SSD
  5. NIC
  6. Switch

并支持统一内存寻址与 Peer Interconnect。

这意味着:

CPU
NPU
Memory
SSD
NIC
Switch

正在从传统的:

主从结构

变成:

Peer-to-Peer 计算系统。

这实际上非常接近 AI 时代“超级计算机”的重新定义。

十五、美国与中国在 Scale-up 上的核心区别

可以这样理解。

维度美国 NVIDIA中国 Huawei
核心处理器GPUNPU
Scale-up核心NVLink灵衢
Scale-outInfiniBand / Ethernet灵衢 / RoCE / Ethernet
内存HBM4HBM体系
软件CUDA生态CANN/昇腾生态
网络方向Spectrum-X / CPO灵衢 / NPO
系统NVL72 / SuperPodAtlas SuperPoD
超集群Million GPUMillion NPU
数据中心AI Factory3D Data Center
国家层面云/资本/能源/企业协同算力网络/算电协同

这里真正值得注意的是:

两边都在从“服务器”走向“计算机”,再从“计算机”走向“计算工厂”。
十六、中国 Atlas 960 是一个非常重要的观察点

华为 2026 年 9 月公布的 Atlas 960 SuperPoD:

  1. 4096 NPU
  2. 8 EFLOPS FP8
  3. 16 EFLOPS FP4
  4. 全液冷
  5. 5500 个 Hi-ONE 光引擎
  6. 约 7.2 Tbit/s / 光引擎
  7. 采用 NPO
  8. 大量减少传统 800G 光模块数量

这一设计的意义非常大。

因为它说明:

中国也正在直接进入“光互连成为计算机内部结构”的阶段。

而不是继续把光模块当成传统网络设备。

十七、NPO 与 CPO 是两套体系里非常重要的共同趋势

美国:

CPO

中国:

NPO

虽然工程实现路径并不完全相同,但背后的物理逻辑高度一致:

电连接正在成为高带宽系统的瓶颈。

因此未来:

铜
↓
高速SerDes
↓
光模块
↓
NPO/CPO
↓
光互连成为计算系统内部结构

这是整个产业链未来几年非常重要的结构性趋势。

十八、最大的共同瓶颈:功率

这一点可能比 GPU、NPU 更重要。

AI Factory 最终不是:

GPU Factory

而是:

Power Factory + Compute Factory

美国已经非常明确地面对这个问题。

美国能源部目前已经把数据中心电力、输电、可靠电源、核电、天然气、电网升级全部纳入 AI 基础设施战略。

DOE 最新资料显示,美国数据中心到 2030 年可能占全国电力消费约 11.8%,情景区间约 9.5%—15.3%。

美国 DOE 还披露:

Ohio Portsmouth 项目规划 10GW 新电力,对应 10GW 数据中心。

这说明美国 AI Factory 已经进入:

GW 级工业基础设施竞争。
十九、中国也正在进入同样的阶段

中国 2026 年 7 月底:

全国智算总规模达到 245 万 PFLOPS(FP16)

其中:

八大国家算力枢纽和三个算电协同发展区,占全国智算规模超过 85%。

同时有:

145 万 PFLOPS 纳入国家级监测调度平台。

这说明中国的算力建设已经不是单个企业的数据中心问题。

而是:

国家级算力基础设施。
二十、所以中美电力路线存在一个非常有意思的区别

美国更接近:

AI企业
↓
数据中心
↓
电厂
↓
电网

大型企业直接寻找:

  1. 土地
  2. 电力
  3. 天然气
  4. 核电
  5. 输电
  6. 数据中心

形成自己的 AI Factory。

而中国更接近:

国家算力网络
↓
区域算力中心
↓
数据中心
↓
AI集群
↓
行业应用

因此中国更容易形成:

算力基础设施网络化。

美国更容易形成:

企业级 AI Factory 巨型化。

这不是简单的优劣关系,而是两种组织方式。

二十一、数据中心也开始分化

传统数据中心:

土地
机房
服务器
空调
网络

AI Data Center:

电力
↓
配电
↓
液冷
↓
高密度机架
↓
GPU/NPU
↓
高速网络
↓
存储

所以数据中心正在从:

Real Estate

转变为:

Industrial Infrastructure
二十二、美国已经出现“1GW AI Factory”逻辑

美国一些大型 AI 项目已经直接按照 GW 级别规划。

OpenAI Stargate 公开表示,原先目标是 2029 年在美国 확보 10GW AI 基础设施;2026 年 4 月公开表示已经超过这一目标,并在此前 90 天新增超过 3GW。

所以:

10MW 数据中心

和

1GW AI Factory

实际上已经不是同一种产业。

后者需要:

  1. 发电
  2. 输电
  3. 变电
  4. 配电
  5. 冷却
  6. 服务器
  7. 网络
  8. 光纤
  9. 存储
  10. 芯片
  11. 建筑

同时建设。

二十三、中国出现了另外一个非常重要的变化:3D Data Center

华为在 2026 年 9 月发布 3D 数据中心架构。

核心逻辑是:

把数据中心从建筑问题变成工业制造问题。

传统:

建筑
├─ 电
├─ 冷
├─ IT
└─ 备电

3D Data Center:

垂直分层

Power
────────
Cooling
────────
IT
────────
Backup

类似半导体工厂:

Utility Layer + Production Layer

这意味着 AI Data Center 开始出现:

模块化、标准化、工厂预制化。
二十四、这是一个非常重要的产业变化

以前数据中心:

一座楼里装服务器。

未来 AI Factory:

像建造一座芯片工厂一样建造算力工厂。

因此:

  1. 钢结构
  2. 电力
  3. 冷却
  4. 管道
  5. 变压器
  6. UPS
  7. 配电
  8. 液冷CDU
  9. 机架
  10. 网络

都可能模块化。

二十五、液冷:中美路线高度趋同

AI 芯片功耗不断上升。

因此:

风冷 → 液冷

已经越来越不是“可选项”。

TrendForce 对 2026 年 AI Factory 的判断也显示,下一代 AI 架构正在全面采用液冷,液冷正在从可选配置逐步变成必要配置。

美国:

GB300 / Rubin → 液冷

中国:

Atlas → 液冷

这意味着液冷是一个典型的:

全球共同产业变量。
二十六、PCB:容易被忽略,但实际上是 AI Factory 的物理底座

随着:

  1. 800G
  2. 1.6T
  3. 224G SerDes
  4. 更高层数
  5. 更高频
  6. 更低损耗

PCB 正从普通电子连接部件变成:

高速信号完整性基础设施。

尤其是:

GPU
↓
Switch
↓
NIC
↓
Optical

之间大量高速连接都要求:

  1. 低介损
  2. 低损耗
  3. 高层数
  4. 高可靠性
  5. 精细线路
  6. 更高制造良率

因此:

AI Factory 越大,PCB 越不是“小零件”。
二十七、HBM 是中美两套体系共同的“上游瓶颈”

这是一个极其重要的结论。

即使:

  1. NVIDIA GPU
  2. Huawei NPU
  3. Google TPU

完全不同。

但都需要:

HBM。

所以 HBM 是真正的全球共同约束。

AI 算力增长:

Compute Growth\text{Compute Growth}

必须同时满足:

HBM Capacity Growth\text{HBM Capacity Growth}

以及:

Advanced Packaging Growth\text{Advanced Packaging Growth}

如果 HBM 供应增长跟不上:

GPU/NPU 出货也无法真正形成有效算力增长。
二十八、因此 AI Factory 的上游可以重新画成六大瓶颈

第一瓶颈:Compute

GPU / NPU / TPU

第二瓶颈:Memory

HBM / DRAM / SSD

第三瓶颈:Packaging

先进封装 / TSV / CoWoS 类技术 / Chiplet

第四瓶颈:Interconnect

NVLink / UB / InfiniBand / Ethernet / CPO / NPO

第五瓶颈:Cooling

液冷 / CDU / 冷板 / 管路

第六瓶颈:Power

发电 / 输电 / 变电 / UPS / HVDC / 配电

二十九、但还缺一个第七瓶颈

就是:

软件。

因为硬件再多:

100万 GPU

如果:

利用率 20%

那么实际效果可能只相当于:

20万 GPU

这也是为什么大型集群越来越强调:

Utilization / Goodput

而不是简单 FLOPS。

三十、这正是 AI Factory 与传统超级计算机最大的区别

传统 HPC:

算力峰值。

AI Factory:

有效智能产出。

因此真正应该跟踪:

Goodput\text{Goodput}

而不是:

FLOPS\text{FLOPS}

最终应该看:

TokensMW\boxed{ \frac{Tokens}{MW} }

以及:

Tokens$\boxed{ \frac{Tokens}{\$} }

甚至:

RevenueGW\boxed{ \frac{Revenue}{GW} }三十一、美国方案的真正核心:垂直整合

可以画成:

NVIDIA
│
├── GPU
├── CPU
├── DPU
├── NIC
├── Switch
├── NVLink
├── InfiniBand
├── Ethernet
├── CPO
├── Storage
├── CUDA
├── TensorRT
└── AI Factory

再往上:

Microsoft
Google
Amazon
Meta
OpenAI
xAI
Oracle
CoreWeave

形成需求侧。

因此美国的核心优势体现为:

系统级协同。
三十二、中国方案的核心则越来越接近“体系化基础设施”

可以画成:

Ascend
│
├── NPU
├── CANN
├── Atlas
├── 灵衢
├── Hi-ONE
├── NPO
├── SuperPoD
├── SuperCluster
├── 3D Data Center
└── 算力网络

再向外:

运营商
云
大型IDC
地方算力中心
国家算力枢纽
行业客户

形成一个更强的基础设施网络。

三十三、这里出现了一个极其重要的区别

美国的核心问题:

如何快速获得足够的电力和数据中心,并把更多 GPU 填进去。

中国的核心问题:

如何把国产处理器、国产互联、国产存储、国产服务器、国产数据中心组织成一个高效率的大规模计算体系。

因此:

美国首先面对:

Physical Scaling

中国同时面对:

Physical Scaling + Architecture Scaling + Ecosystem Scaling
三十四、但是中国有一个非常特殊的潜在变量:成本

如果未来出现:

单位算力成本下降
+
电价低
+
土地成本低
+
建设成本低
+
服务器成本低
+
大量国产供应链

那么中国可能形成另一种 AI Factory 经济模型。

不是单纯追求:

最大算力。

而是:

最低 Token 成本。
三十五、这可能成为中美 AI Factory 最值得跟踪的长期变量

假设:

美国:

$1→1000Tokens\$1 \rightarrow 1000 Tokens

中国:

$1→1500Tokens\$1 \rightarrow 1500 Tokens

即使美国芯片单卡性能更高:

中国仍然可能在大规模 AI 服务中形成成本优势。

反过来,如果美国:

$1→3000Tokens\$1 \rightarrow 3000 Tokens

那么中国的硬件规模优势也可能被抵消。

所以最终不是比较:

GPU vs NPU。

而是:

Token Economics。
三十六、真正的竞争单位已经变成“每GW产生多少Token”

这是整个研究框架最重要的一层。

以前:

GPU 性能

后来:

集群性能

现在:

AI Factory 性能

未来:

Token/GW\boxed{ \text{Token/GW} }

才是最重要的产业指标之一。

三十七、由此重新理解电力

如果一个 AI Factory:

1GW

能够产生:

100 亿 Token/小时

另一个:

1GW

只能产生:

50 亿 Token/小时

那么:

第一套系统并不是简单“算力更强”。

而是:

电力转换成智能的效率更高。
三十八、这会改变整个产业链的价值排序

过去市场容易关注:

GPU

未来必须同时看:

计算效率

GPU/NPU/TPU

内存效率

HBM

通信效率

NVLink / UB / Ethernet / IB

光效率

CPO / NPO

散热效率

Liquid Cooling

电力效率

Power Delivery

软件效率

CUDA / CANN / JAX / Compiler

集群效率

Scheduling / Collective / Fault Tolerance

工厂效率

PUE / Utilization / Goodput

最终:

Token Efficiency

三十九、从产业链投资研究角度重新分类

如果把中美两套体系放在同一个表里:

层级美国中国核心变量
ComputeGPU/TPU/ASICNPU/CPU/ASIC算力
MemoryHBMHBM/DRAM带宽/容量
Packaging先进封装先进封装良率
Scale-upNVLink/ICI灵衢延迟/带宽
Scale-outIB/EthernetUB/RoCE集群效率
OpticalCPO/OpticsNPO/OpticsW/bit
PCB高速PCB高速PCB信号完整性
Cooling液冷液冷W/Rack
PowerGW Power算电协同MW/GW
DCAI Factory3D AIDC建设效率
SoftwareCUDA/JAXCANN利用率
CloudHyperscalerCloud/算力中心利用率
National企业主导算力网络资源调度
OutputTokenTokenToken/$
四十、最重要的是“瓶颈会不断迁移”

这才是未来几年产业研究真正应该关注的东西。

例如:

第一阶段

GPU 缺。

↓

GPU 涨。

第二阶段

GPU 供应增加。

HBM 缺。

↓

HBM 涨。

第三阶段

HBM 增加。

先进封装缺。

↓

封装设备/材料/产能受益。

第四阶段

芯片和封装增加。

网络缺。

↓

光模块 / Switch / SerDes / CPO受益。

第五阶段

网络解决。

电力缺。

↓

变压器 / UPS / HVDC / 发电 / 电网受益。

第六阶段

电力解决。

冷却缺。

↓

液冷 / CDU / 冷板受益。

第七阶段

硬件全部增加。

软件和利用率成为瓶颈。

↓

AI Infra Software / Scheduling / Compiler / Runtime。

第八阶段

全部解决。

最终竞争:

Token Economics。
四十一、所以真正应该建立“AI Factory Bottleneck Clock”

产棱未来如果要把这套体系变成真正的产业交易系统,我认为最重要的不是继续增加行业数量,而是建立一个:

AI Factory Bottleneck Clock

每天回答:

问题当前状态
Compute 是否紧张?↑ / → / ↓
HBM 是否紧张?↑ / → / ↓
Packaging 是否紧张?↑ / → / ↓
Optical 是否紧张?↑ / → / ↓
PCB 是否紧张?↑ / → / ↓
Cooling 是否紧张?↑ / → / ↓
Power 是否紧张?↑ / → / ↓
Network 是否紧张?↑ / → / ↓
Utilization 是否改善?↑ / → / ↓
Token Economics 是否改善?↑ / → / ↓

这比单纯跟踪新闻价值高得多。

四十二、然后再做“瓶颈 → 订单 → 龙头 → 股价”的传导

真正的产业交易链应该是:

AI需求
↓
AI Factory扩张
↓
新增GW
↓
新增GPU/NPU
↓
HBM需求
↓
先进封装
↓
PCB
↓
高速网络
↓
光互连
↓
液冷
↓
电力
↓
订单
↓
收入
↓
利润
↓
资本市场定价

但是这个链条不是同时发生的。

真正有价值的是:

找到最先发生变化的那个环节。
四十三、因此“美国 AI Factory”不能简单等同于“买 NVIDIA”

例如 NVIDIA 出货增长:

GPU ↑

但如果:

HBM ↑↑
Optical ↑↑
Power ↑↑
Cooling ↑↑

那么产业链真正的边际变化可能发生在后面。

反过来,如果:

GPU ↑
HBM ↑
Optical ↑
Power ↑

但:

AI利用率 ↓

那么继续扩产可能出现资本效率下降。

所以:

产业链研究必须最终回到 AI Factory utilization。
四十四、同样,中国也不能简单等同于“买国产算力”

如果:

Ascend出货 ↑

但:

HBM供应不足
先进封装不足
CANN效率不足
集群利用率不足

那么:

NPU 出货 ≠ 有效算力增长。

这也是为什么以后研究中国 AI 算力,不能只看:

国产替代率。

必须看:

有效 AI Compute。
四十五、两套体系最大的共同点

最终其实高度一致:

第一

单芯片性能越来越不重要。

第二

内存越来越重要。

第三

Scale-up越来越重要。

第四

Scale-out越来越重要。

第五

光互连越来越重要。

第六

液冷越来越重要。

第七

电力越来越重要。

第八

软件越来越重要。

第九

集群利用率越来越重要。

第十

最终全部回到:

Token Economics。
四十六、两套体系最大的结构差异

可以压缩成一句话:

美国更偏向“企业驱动的垂直 AI Factory”,中国更偏向“产业链国产化 + 算力基础设施网络化 + 超大规模系统架构”。

美国的核心组织单位:

NVIDIA / Google / Microsoft / Amazon / Meta / OpenAI 等 AI 基础设施主体。

中国的核心组织单位:

华为 + 云 + IDC + 运营商 + 国家算力枢纽 + 国产供应链。
四十七、但中国现在正在发生一个非常关键的变化

过去中国:

“我要做国产 GPU/NPU。”

现在:

“我要让百万处理器成为一台计算机。”

这是完全不同的思维层级。

前者解决:

芯片问题。

后者解决:

计算机体系结构问题。

而华为 2026 年 9 月正式发布 Peerium,实际上已经把这个问题公开化。

四十八、美国也发生了完全类似的变化

NVIDIA 过去:

GPU

现在:

AI Factory

Rubin 平台已经把:

  1. GPU
  2. CPU
  3. DPU
  4. NIC
  5. Switch
  6. Optical
  7. Storage
  8. Software

统一进 AI Factory 架构。

所以:

美国和中国实际上都已经进入“计算系统时代”。

只是两套系统的技术实现、生态组织方式、供应链基础和基础设施组织方式不同。

四十九、最终真正应该比较的不是“谁的芯片强”

而是下面这张表。

指标美国体系中国体系
单芯片能力高持续提升
芯片生态高度成熟快速构建
HBM强依赖全球供应链国产化持续推进
先进封装强持续追赶
Scale-upNVLink等灵衢
Scale-outIB/EthernetUB/RoCE
光互连CPO加速NPO加速
软件CUDA/JAX等CANN等
AI云成熟快速扩大
电力GW级扩张算电协同
数据中心AI Factory3D AIDC
国家级算力调度相对分散网络化程度较高
成本结构高资本密度有潜在成本优势
集群规模百万级路线百万级路线
最终目标Intelligence FactoryIntelligence Factory

这里不应该简单得出一个“谁赢”的结论。

因为两边真正的差异,是:

谁在哪一个环节拥有更强的边际改善能力。
五十、这也是未来几年最重要的产业研究方法

不要再问:

“AI 算力还增长吗?”

应该问:

第一问

下一座 1GW AI Factory 在建什么?

第二问

这一 GW 最缺什么?

第三问

瓶颈持续多久?

第四问

瓶颈是否开始释放?

第五问

释放之后,下一个瓶颈是谁?

第六问

谁拿到了订单?

第七问

订单什么时候进入收入?

第八问

收入增长是否已经反映到资产价格?
五十一、这就形成真正的“AI Factory 产业钟”

可以把未来几年 AI 硬件行情理解成:

算力需求
↓
GPU/NPU
↓
HBM
↓
先进封装
↓
PCB
↓
网络
↓
光模块
↓
CPO/NPO
↓
液冷
↓
电力
↓
数据中心
↓
软件
↓
Token

但行情不会按照这个顺序机械上涨。

而是:

哪里出现新的供需缺口,哪里就形成新的产业定价权。

这就是“新墙”。

五十二、因此产棱真正应该跟踪的不是六大行业

而是:

六大物理瓶颈 + 三个系统变量

六大物理瓶颈

  1. Compute
  2. HBM
  3. Packaging
  4. Optical/Network
  5. Cooling
  6. Power

三个系统变量

  1. Utilization
  2. Goodput
  3. Token Economics

这样就形成:

AIFactory=Compute+Memory+Network+Cooling+Power+Software\boxed{ AI Factory = Compute + Memory + Network + Cooling + Power + Software }

最终:

AIFactory→Token\boxed{ AI Factory \rightarrow Token }五十三、对产棱来说,最有价值的不是继续扩大研究范围

恰恰相反。

应该把美国和中国统一进一个:

全球 AI Factory 状态模型

例如每天只更新:

Compute:紧张
HBM:紧张
Packaging:改善
Optical:紧张
PCB:紧张
Cooling:扩产
Power:严重约束
Network:升级
Utilization:改善
Token Economics:改善

然后再回答:

今天市场涨的是哪一个变量?

这时候:

“光模块为什么涨?”

就不再是新闻解释。

而是:

AI Factory规模 ↑
→ GPU数量 ↑
→ Scale-out流量 ↑
→ 1.6T渗透 ↑
→ 光互连需求 ↑
→ 供应约束
→ 龙头订单 ↑
→ 利润预期 ↑
→ 资产价格变化

这才是完整产业传导。

五十四、最后:中美 AI Factory 的真正分水岭

未来几年最重要的,不是:

美国 GPU vs 中国 NPU。

而是:

谁能够把越来越多的电力,转换成越来越低成本、越来越高可靠、越来越高利用率的有效智能。

最终的终极公式可以浓缩成:

AIFactory Value=Effective IntelligencePower+Capital+Memory+Network+Cooling+Operations\boxed{ AI Factory\ Value = \frac{Effective\ Intelligence} {Power+Capital+Memory+Network+Cooling+Operations} }

而有效智能最终可以近似观察为:

Effective Intelligence≈Tokens×Quality×Reliability\boxed{ Effective\ Intelligence \approx Tokens\times Quality\times Reliability }

因此未来真正需要跟踪的终极变量是:

Tokens / $\boxed{ \text{Tokens / \$} } Tokens / MW\boxed{ \text{Tokens / MW} } Tokens / GW\boxed{ \text{Tokens / GW} }

以及:

AI Factory Utilization\boxed{ \text{AI Factory Utilization} }五十五、最终形成一个完整的全球 AI Factory 研究框架
AI需求
│
▼
┌──────────────┐
│ AI Factory │
└──────┬───────┘
│
┌────────────────┼────────────────┐
▼ ▼ ▼
Compute Memory Network
GPU/NPU/TPU HBM/SSD NVLink/UB/IB
│ │ │
└────────────────┼────────────────┘
▼
Advanced Packaging
│
▼
Optical Interconnect
CPO / NPO / 1.6T
│
▼
Rack / SuperPod
│
┌─────────┴─────────┐
▼ ▼
Cooling Power
Liquid Cooling MW / GW
│ │
└─────────┬─────────┘
▼
AI Data Center
│
▼
Cluster Utilization
│
▼
Goodput
│
▼
Effective Tokens
│
▼
AI Revenue / ROI
│
▼
Asset Pricing

这才是百万级算力时代真正完整的产业链。

美国的路线正在把 NVIDIA/Google 等企业级体系推向 Million-GPU/TPU AI Factory;中国则正在通过昇腾、灵衢、SuperPoD、SuperCluster、3D 数据中心和国家算力网络,把国产算力推进到 Million-NPU Computing System。两边最终都在从“堆芯片”进入“构建一台超大规模 AI 计算机”,再进入“建设智能工厂”的阶段。