产棱 · IndPrism China 算力全产业链传导分析

产棱拆解 | 中国百万GPU/NPU时代:国产算力集群到AI Factoryory从昇腾超节点,灵衢互联到百万NPU 的完整架构

产棱 技术拆解 基础设施
本文 15 节
  1. 一、核心结论
  2. ① NPU / GPU
  3. ② HBM
  4. ③ 光通信
  5. ④ PCB
  6. ⑤ 液冷
  7. ⑥ 电力
  8. 第一种:企业私有AI Factory
  9. 第二种:云厂商AI Factory
  10. 第三种:国家级算力网络
  11. 美国
  12. 中国
  13. “下一万卡,最缺什么?”
  14. “下一GW,最缺什么?”
  15. “这一GW最终产生多少有效Token?”

时间基准:2026年9月

一、核心结论

2026年9月,中国AI基础设施出现了一个非常重要的架构拐点。

9月17日,华为发布Peerium计算架构,提出让百万级处理器真正成为一台计算机;同时发布基于灵衢互联和Hi-ONE近封装光学(NPO)的昇腾960超节点。

按照华为公布的架构:

  1. 单个昇腾960超节点最高4096 NPU;
  2. 多个超节点可组成最大51.2万卡集群;
  3. 通过多轨道拓扑,最大支持100万卡昇腾NPU超节点集群;
  4. Atlas 950超节点已有25.6万卡集群进入部署;
  5. 华为同时推出3D数据中心,为十万卡以上昇腾超节点集群设计新的数据中心物理架构。

这意味着:

中国的AI基础设施已经开始从“国产GPU/NPU替代”进入“国产AI Factory架构竞争”。

这两个概念完全不同。

过去中国AI算力建设主要解决:

有没有国产AI芯片。

现在开始解决:

几十万、百万颗国产AI处理器如何成为一个整体计算机。

因此,中国AI Factory的产业链也必须重新定义:

NPU / GPU
↓
HBM / Memory
↓
先进封装
↓
AI Rack
↓
灵衢 / RoCE / Ethernet
↓
光互联
↓
超节点
↓
超节点集群
↓
液冷
↓
3D数据中心
↓
电力
↓
算力网络
↓
百万NPU AI Factory

这已经不是传统服务器产业。

而是一套新的:

“计算—网络—存储—散热—电力—数据中心”一体化工业体系。
二、中国与美国AI Factory的根本区别

美国AI Factory的典型路线正在形成:

GPU
↓
NVLink
↓
NVL72
↓
SuperPod
↓
Ethernet / InfiniBand
↓
AI Cluster
↓
AI Factory
↓
GW Power

中国正在出现另一条路线:

NPU
↓
灵衢互联
↓
昇腾超节点
↓
SuperPod
↓
全光互联
↓
超节点集群
↓
算力网络
↓
百万NPU AI Factory

两者表面上非常相似。

但底层思路存在一个明显区别:

美国

更强调:

GPU + 高性能网络 + 分布式Scale-out

华为

更强调:

统一协议 + 统一内存 + 对等互联 + 超节点 + 光互联

这并不是说两者谁一定优于谁。

而是:

中国正在尝试通过系统架构创新,降低单颗AI芯片与传统网络之间的边界。

这可能是中国AI基础设施非常值得研究的一条路线。

三、为什么中国必须走“超节点”路线?

这是由中国当前AI芯片产业结构决定的。

如果单颗NPU性能与最先进GPU存在差距,那么简单堆:

NPU × 1000

并不能自然得到:

1000 × 单NPU性能

因为会产生:

  1. 通信开销;
  2. 内存访问开销;
  3. 数据搬运;
  4. 网络拥塞;
  5. 同步等待;
  6. 节点故障;
  7. 软件调度损耗。

因此:

芯片之间的互联效率,决定了国产芯片集群最终能发挥多少有效算力。

华为在2026年9月公开指出,随着集群规模扩大,传统架构可能导致模型算力利用率下降;其给出的公开数据是,十万卡集群实际模型算力利用率可能只有约20%。这也是其提出灵衢和Peerium架构的直接背景之一。

这句话非常重要。

因为:

AI算力的真正单位正在从“芯片算力”转向“有效集群算力”。
四、第一层:NPU

中国AI Factory最底层仍然是芯片。

目前公开路线中最重要的是:

昇腾NPU。

华为已经从早期:

Ascend 910

逐步进入:

Ascend 910系列
↓
Ascend 910C
↓
Ascend 950
↓
Ascend 960

但是研究国产AI算力,不能只研究:

单颗NPU性能。

真正应该研究:

NPU × 每Rack数量 × HBM × 互联 × 利用率
五、昇腾950:从芯片变成超节点

2026年7月公开亮相的Atlas 950 SuperPoD已经达到:

  1. 1024卡;
  2. 1 EFLOPS FP8;
  3. 2 EFLOPS FP4;
  4. 256TB全局统一内存编址空间;
  5. TB级NPU互联带宽;
  6. RTT约3μs。

华为将其定位为面向万亿级乃至更大模型训练与高并发推理的超节点。

这说明中国AI计算正在发生一个非常重要的变化:

1024张NPU不再被当作1024台服务器。

而是:

一个整体计算机。
六、昇腾960:进入4096卡超节点

9月17日发布的昇腾960进一步把这个规模提升到:

4096 NPU / SuperPoD

官方公布:

  1. FP8:8 EFLOPS
  2. FP4:16 EFLOPS
  3. 全液冷
  4. 灵衢统一内存寻址
  5. Hi-ONE NPO光引擎
  6. 5500个Hi-ONE
  7. 系统可用度99.8%。

这里真正值得注意的不是:

8 EFLOPS。

而是:

4096张NPU被组织成一个计算单元。

这已经进入AI Factory的基本架构。

七、第二层:灵衢互联

这可能是中国AI Factory最值得研究的技术之一。

华为把灵衢定义为:

可连接CPU、NPU、内存、SSD、网卡和交换机的高速总线。

其核心思想是:

传统:

CPU
↓
PCIe
↓
NPU
↓
Network
↓
Storage

变成:

UnifiedBus
│
┌──────────────┼──────────────┐
↓ ↓ ↓
CPU NPU Memory
↓ ↓ ↓
SSD NIC Switch

也就是说:

计算、存储和网络不再是严格分层的孤立系统。

而开始成为:

一个统一互联资源池。

华为公布的灵衢架构可以把互联带宽从百GB级提升到TB级,并将RTT从约7μs压缩至2μs;其跨柜设备单端口达到1.6T、单机280T全光互联。

八、为什么灵衢可能比单纯“国产GPU”更重要?

因为中国真正面对的问题并不是:

造一颗NPU。

而是:

如何把百万NPU组织起来。

如果:

NPU性能 = 100

但集群利用率:

20%

那么:

有效算力 = 20

如果通过架构优化:

利用率 = 50%

即使NPU本身不变:

有效算力 = 50

等价于:

算力供给增加150%。

所以:

互联架构实际上可以创造“虚拟算力”。

这也是中国AI Factory路线中最值得关注的地方。

九、第三层:百万NPU真正的核心——Peerium

2026年9月17日,华为又把这个概念往上推进了一层:

Peerium计算架构。

其目标不是:

让100万张NPU组成100万个节点。

而是:

让百万级处理器成为一台更大的计算机。

官方给出的核心技术包括:

  1. Nested BSP;
  2. 嵌套并行;
  3. 统一内存寻址;
  4. 对等互联;
  5. 灵衢统一互联。

这是一个非常重要的架构变化。

十、百万NPU不是“100万个芯片”

必须把这件事情理解清楚。

传统:

1000服务器
=
1000个计算节点

AI Factory:

1000服务器
↓
多个Rack
↓
多个Pod
↓
一个Cluster

百万NPU进一步:

1,000,000 NPU
↓
数百/数千个SuperPod
↓
统一网络
↓
统一内存
↓
统一调度
↓
统一计算系统

因此:

百万NPU真正的价值不在于数字“100万”,而在于百万级规模下还能不能保持有效扩展。
十一、第四层:光通信

这里中国AI Factory开始出现一个非常有意思的架构变化。

美国目前正在从:

800G → 1.6T → CPO

推进。

中国同样如此。

但华为进一步把光通信:

直接推进到了超节点内部。
十二、Hi-ONE:从光模块走向NPO

昇腾960采用:

Hi-ONE NPO光引擎。

华为公开数据:

  1. 单个Hi-ONE传输容量:7.2Tbit/s;
  2. 5500个Hi-ONE;
  3. 用于替代原本约4.8万个800G光模块;
  4. 系统功耗降低超过550kW。

这个数字非常值得研究。

因为它说明:

中国AI Factory并不是简单复制传统“GPU+800G光模块”架构。

而是在尝试:

把光互联进一步靠近计算节点。

也就是:

传统:

NPU
↓
Electrical
↓
NIC
↓
Optical Module
↓
Fiber

新架构:

NPU
↓
NPO
↓
Optical Fabric
↓
Fiber
十三、这意味着光通信产业链发生变化

过去研究光通信:

光模块
↓
交换机
↓
数据中心

未来需要增加:

NPU
↓
NPO
↓
Optical Engine
↓
Switch
↓
Cluster

因此未来中国AI光通信产业需要重点关注:

  1. EML;
  2. CW Laser;
  3. InP;
  4. Silicon Photonics;
  5. NPO;
  6. 光引擎;
  7. 光纤;
  8. 连接器;
  9. 高速SerDes;
  10. 光交换。

2026年9月中国国际光电博览会期间,多家产业链企业公开反馈1.6T需求增长、部分产品订单与产能已经排至2027年,说明中国AI光通信正在进入新的扩产阶段。

十四、第五层:HBM / Memory

这里是中国AI Factory与美国之间最大的结构性差异之一。

美国AI GPU生态:

NVIDIA → HBM4 → SK hynix / Samsung / Micron

而中国AI Factory:

国产NPU → 高带宽存储 → 国内/全球供应链

这里真正的核心问题是:

中国能否建立与百万NPU相匹配的高带宽内存供应体系。
十五、为什么HBM是中国AI Factory最大的潜在“硬约束”之一?

因为:

NPU数量 ↑
×
每NPU HBM容量 ↑
×
带宽 ↑
=
HBM需求高速增长

如果未来:

1,000,000 NPU

每颗需要数百GB级高带宽内存,那么:

这是一个极其庞大的HBM需求。

这会把中国AI Factory直接连接到:

  1. DRAM;
  2. TSV;
  3. 先进封装;
  4. 硅中介层;
  5. HBM封装;
  6. 高端封装设备;
  7. 材料。
十六、中国HBM产业的真正瓶颈

这里必须保持谨慎。

目前中国DRAM产业正在快速扩张。

例如长鑫科技2026年已经进入新的DRAM技术平台量产阶段,并继续扩充产能。

但:

普通DRAM进步 ≠ HBM已经完全解决。

HBM涉及:

DRAM Die
↓
TSV
↓
Thin Wafer
↓
Stacking
↓
Bonding
↓
Interposer
↓
Advanced Packaging

所以中国HBM真正需要观察的是:

高带宽内存的量产规模、良率和每颗NPU实际配置。

而不是简单看:

“中国有没有DRAM。”
十七、HBM可能成为中国AI Factory的第一大外部瓶颈

如果百万NPU架构真正快速建设:

NPU
↓
HBM

的需求可能非常巨大。

因此中国AI Factory可能形成:

NPU供给速度受HBM约束。

这会产生一个非常典型的瓶颈迁移:

NPU
↓
HBM
↓
先进封装
↓
光互联
↓
PCB
↓
液冷
↓
电力

谁先解决,瓶颈就向下一个环节迁移。

十八、第六层:PCB

中国AI Factory的PCB需求与美国非常类似,但存在一个特殊变量:

国产AI芯片生态正在提高服务器、交换机和高速网络系统的国产化比例。

AI服务器PCB正在从:

普通多层板

进入:

高速
+
高层
+
高频
+
大尺寸
+
高可靠

而且:

NPU越多 → PCB价值量越高。
十九、PCB的真正需求公式

不要简单:

AI服务器数量 × PCB价值。

应该:

AI Factory
×
Rack数量
×
每Rack PCB价值
×
高速交换机数量
×
每交换机PCB价值

因此AI Factory越大:

PCB价值量呈系统级增长。

中国PCB产业在2026年也已经出现明显的AI高端板扩产信号;部分企业披露正在建设面向AI服务器、高速光模块等高附加值产品的新增产能。

二十、PCB真正的供需拐点

中国PCB行业不能看:

整体PCB产能。

真正需要看:

高速高层AI PCB。

因为:

消费电子PCB
可能宽松

普通服务器PCB
可能平衡

AI高速PCB
可能紧张

这就是典型的:

结构性供需。
二十一、第七层:液冷

中国AI Factory的液冷实际上已经非常明确。

2025年中国信通院数据显示,我国智算中心智能算力规模已经达到788 EFLOPS(FP16),并且液冷正在成为高密度智算中心的重要基础设施。

工信部2026年进一步明确推动:

智算中心复合液冷、液冷服务器、高密度服务器以及高效UPS等技术。
二十二、华为正在把液冷推到更高密度

2025年华为云已经公开披露:

  1. CloudMatrix 384;
  2. 全液冷AI数据中心;
  3. 单机柜80kW散热;
  4. PUE最低约1.1;
  5. 规划更高密度机柜。

2026年昇腾960则进一步采用:

全液冷超节点。

这说明液冷已经从:

数据中心节能方案

变成:

AI计算架构的一部分。
二十三、中国液冷真正的供需拐点

中国液冷与美国的逻辑基本一致:

AI芯片功耗 ↑
↓
Rack功率 ↑
↓
风冷极限
↓
液冷渗透
↓
全液冷

但中国有一个额外变量:

大量既有IDC需要改造。

因此市场可能同时存在:

新建AI Factory

全液冷。

老数据中心

液冷改造。

这会扩大液冷产业链的需求范围。

二十四、第八层:电力

中国AI Factory的电力逻辑与美国有一个非常明显的区别。

美国:

电力供应与并网本身已经成为非常大的约束。

中国:

更强的是电网建设、能源结构和全国算力网络的统筹能力。

但这不意味着中国没有电力瓶颈。

恰恰相反:

百万NPU时代,电力仍然是最大的物理约束之一。
二十五、从“数据中心”进入“算电协同”

中国正在推进:

算电协同。

2026年国家数据局披露,截至2026年7月底,全国智算总规模已经达到245万PFLOPS(FP16),八大国家算力枢纽和三个算电协同发展区的智算规模占全国超过85%。

这意味着中国不是单纯:

在城市里堆数据中心。

而是在尝试:

能源
↓
算力
↓
网络
↓
数据
↓
应用

进行全国级优化。

二十六、中国AI Factory的一个特殊优势:全国算力网

美国AI Factory更偏:

Mega Campus
↓
Mega Cluster

中国则同时出现:

Local AI Factory
↓
Regional Cluster
↓
National Computing Network

也就是:

超节点 + 算力网络

双重结构。

国家数据局已经明确提出进一步优化全国算力布局、提升供给能力、加强监测调度和深化算电协同。

二十七、因此中国百万NPU并不一定是一座“超级机房”

更可能是:

中国AI算力网络
│
┌────────────────┼────────────────┐
│ │ │
华东AI 华北AI 西部AI
Factory Factory Factory
│ │ │
超节点 超节点 超节点
│ │ │
└────────────────┼────────────────┘
│
算力网络
│
跨区域任务调度

所以:

中国百万NPU时代可能天然具有“分布式AI Factory”特征。
二十八、华为3D数据中心:这是另一个非常关键的信号

2026年9月16日,华为发布所谓全球首个3D数据中心。

其核心不是建筑造型。

而是:

把数据中心从二维水平布局变成垂直分层的工业产品。

架构为:

备电层
──────────────
供电层
──────────────
IT设备层
──────────────
供冷层
──────────────

华为明确提出:

通过“动力层”和“生产层”分离,以及标准化、预制化、现场装配,实现AI数据中心批量复制。

这其实意味着:

AI Factory正在从“建设工程”变成“标准化工业产品”。
二十九、这是一个非常重要的产业变化

传统数据中心:

设计
↓
施工
↓
安装
↓
调试
↓
上线

AI Factory:

标准设计
↓
工厂预制
↓
模块化运输
↓
现场装配
↓
快速复制

结果就是:

AI算力建设周期开始工业化。

这会进一步推动:

  1. 模块化数据中心;
  2. 液冷模块;
  3. 供电模块;
  4. CDU;
  5. UPS;
  6. 变压器;
  7. 高速网络;
  8. 机柜;
  9. 预制机房。
三十、中国AI Factory六大产业链

现在重新建立完整产业链:

层级美国中国
ComputeGPUGPU + NPU
MemoryHBM4/HBM4eHBM + 国产高带宽存储
InterconnectNVLink灵衢
NetworkEthernet/IB灵衢/RoCE/Ethernet
Optical800G/1.6T/CPO800G/1.6T/NPO
RackNVL72昇腾SuperPoD
SuperPod数千GPU1024→4096 NPU
Cluster数万~更大25.6万→100万NPU
CoolingLiquidLiquid
Data CenterAI Campus3D AIDC
PowerGW级GW级+算电协同
NetworkAI WAN全国算力网

这里真正值得注意:

中国已经不是“没有AI Factory”。

而是开始形成自己的架构。

三十一、六大产业链的当前状态

① NPU / GPU

状态:规模化放量阶段。

核心瓶颈:

芯片供应 + HBM + 先进封装 + 软件生态 + 集群部署。

真正拐点:

国产NPU供给能力超过AI Factory建设速度。

② HBM

状态:强约束。

核心瓶颈:

HBM产能、先进封装、良率。

真正拐点:

国产HBM进入稳定规模化量产,并且每颗NPU的HBM配置进一步提升。

③ 光通信

状态:快速升级。

核心瓶颈:

1.6T光模块、光芯片、NPO、光引擎。

真正拐点:

1.6T从高端量产进入大规模标准化部署。

目前中国产业链已经出现部分1.6T产品订单和产能紧张的反馈。

④ PCB

状态:结构性紧张。

核心瓶颈:

高速、高层、大尺寸、高频材料。

真正拐点:

高端AI PCB扩产完成。

⑤ 液冷

状态:快速渗透→规模化。

核心瓶颈:

冷板、CDU、管路、连接器、系统集成。

真正拐点:

AI Rack进入200kW甚至更高功率密度。

华为公开信息已经把AI机柜从70kW、80kW进一步推向100~200kW及更高密度。

⑥ 电力

状态:长期约束。

核心瓶颈:

变压器、配电、UPS、并网、数据中心供电架构。

真正拐点:

AI Factory新增容量开始受到电力接入限制。
三十二、但中国和美国最大的差异是“瓶颈结构”

可以把两者画成:

美国

GPU
↓
HBM
↓
Optical
↓
Cooling
↓
Power
↓
Grid

中国

NPU
↓
HBM
↓
Interconnect
↓
Optical
↓
Cooling
↓
Power
↓
Computing Network

中国多出来一个非常重要的变量:

算力网络。

因为中国未来可能不是单纯建设:

一个超级AI Factory。

而是:

多个AI Factory + 全国算力网络。
三十三、中国真正可能形成的AI Factory模式

未来可能出现三种形态。

第一种:企业私有AI Factory

大型互联网公司
↓
自建AI Factory
↓
NPU/GPU
↓
训练/推理

第二种:云厂商AI Factory

华为云
阿里云
腾讯云
运营商
↓
SuperPod
↓
SuperCluster
↓
Token服务

第三种:国家级算力网络

多个AI Factory
↓
算力调度
↓
全国算力网
↓
任务迁移

这三者最终可能形成:

中国AI计算基础设施三层结构。
三十四、真正的竞争不是“谁的NPU更像GPU”

这一点非常重要。

如果把中美AI竞争简化成:

NVIDIA vs Ascend

实际上会错过真正的产业变化。

更准确的比较应该是:

层级美国中国
芯片NVIDIA/AMDAscend等国产NPU
内存HBM供应链国产+全球供应链
Scale-upNVLink灵衢
OpticalCPONPO/Hi-ONE
SuperPodNVIDIA体系Ascend SuperPoD
ClusterAI SuperclusterSuperCluster
Cooling液冷液冷
PowerGW级GW级
SoftwareCUDA生态CANN/国产生态
NetworkAI WAN全国算力网
FactoryAI FactoryAIDC/算力基础设施

所以真正的竞争单位已经从:

芯片

变成:

AI计算体系。
三十五、一个非常重要的变化:华为正在把“光”变成计算基础设施

过去华为最强的能力之一就是通信和光。

现在这套能力开始进入AI计算内部。

形成:

光通信
↓
交换机
↓
数据中心
↓
超节点
↓
NPO
↓
NPU内部互联

Hi-ONE就是一个非常典型的信号。

华为甚至公开表示,昇腾960通过5500个Hi-ONE替代约48000个800G光模块,并降低超过550kW功耗。

如果这一架构能够规模化:

光通信在AI Factory中的价值量可能进一步上移。

过去光模块是:

网络设备的组件。

未来可能变成:

计算系统的组成部分。
三十六、这对中国光通信产业意味着什么?

产业链可能从:

800G
↓
1.6T

进一步变成:

800G
↓
1.6T
↓
NPO
↓
Optical Engine
↓
Optical Fabric
↓
Optical Compute Interconnect

因此未来研究中国光通信不能只问:

800G出货多少?

而应该问:

光互联是否正在进入NPU计算域?

如果答案是肯定的:

光通信的产业价值量会继续上移。
三十七、中国AI Factory最值得研究的第二个变量:内存池化

华为灵衢架构还有一个重要变化:

Memory不再一定属于某一颗NPU。

传统:

NPU
↓
自己的HBM

未来:

NPU
↓
HBM
↓
DDR
↓
SSD
↓
KV Cache
↓
Global Memory Pool

华为已经发布OceanStor M900,作为基于灵衢的上下文记忆存储系统,支持PB级KV Cache。

这意味着:

AI Factory正在形成新的Memory Hierarchy。
三十八、Agent时代进一步改变AI Factory

训练时代:

GPU最重要。

推理时代:

GPU + Memory。

Agent时代:

GPU + CPU + Memory + Storage + Network。

因为Agent不断产生:

  1. KV Cache;
  2. 长上下文;
  3. 工具调用;
  4. 沙箱;
  5. 向量搜索;
  6. 数据交换。

所以:

AI Factory将从“GPU工厂”逐渐变成“Token工厂”。
三十九、Token Factory才是最终形态

最终:

Power
↓
Compute
↓
Memory
↓
Network
↓
Model
↓
Agent
↓
Token
↓
Economic Output

所以未来评价一个AI Factory:

不能只看:

PFLOPS。

而应该看:

Tokens / Watt / RMB / 秒

以及:

每GW能产生多少有效Token。
四十、中国百万NPU的真正经济学

假设未来:

1,000,000 NPU

那么真正需要计算的是:

1,000,000
×
平均利用率
×
每NPU有效Token产出
×
有效运行时间

最终得到:

有效Token产能。

而不是:

理论算力。

这就是中国AI Factory真正需要建立的新经济指标。

四十一、因此六条产业链最终会形成一张“瓶颈迁移图”
AI需求
│
▼
NPU
│
HBM / Memory
│
▼
SuperPod
│
┌─────────┴─────────┐
▼ ▼
Optical PCB
│ │
└─────────┬─────────┘
▼
Cluster
│
▼
Liquid
│
▼
Power
│
▼
AI Factory
│
▼
Computing Grid

瓶颈会不断迁移:

NPU
↓
HBM
↓
Optical
↓
PCB
↓
Cooling
↓
Power
↓
Software
↓
AI Demand
四十二、这也是最值得交易跟踪的地方

不能问:

“中国AI哪个行业最好?”

应该问:

“中国AI Factory当前新增的1000卡/1万卡/10万卡,最缺什么?”

例如:

如果NPU供应不足

看:

NPU → HBM → 封装。

如果NPU供应改善

看:

光通信 → PCB。

如果万卡集群建设加速

看:

光通信 → 网络。

如果机柜功率超过100kW

看:

液冷。

如果数据中心建设达到GW级

看:

变压器 → UPS → 配电 → 电网。

这就是:

瓶颈迁移交易框架。
四十三、中国AI Factory的六大状态变量

最终可以建立一个非常简单的模型:

变量核心观察
NPU国产算力供给速度
HBM高带宽内存供给
Optical1.6T/NPO放量
PCB高端高速板供需
Cooling单Rack功率密度
PowerAI Factory可获得GW容量

再增加三个:

上层变量观察
Cluster超节点规模
Utilization实际有效算力
Token最终需求

最终形成:

NPU
↓
HBM
↓
Optical
↓
PCB
↓
Cooling
↓
Power
↓
Cluster
↓
Utilization
↓
Token
四十四、与美国AI Factory最大的结构性区别

如果把两套体系极度简化:

美国

NVIDIA
↓
CUDA
↓
NVLink
↓
SuperPod
↓
Ethernet / IB
↓
AI Factory
↓
Power

核心优势:

GPU性能 + 软件生态 + 系统整合。

中国

Ascend / 国产NPU
↓
CANN
↓
灵衢
↓
SuperPod
↓
NPO
↓
AI Factory
↓
算力网络

核心路线:

系统架构 + 网络 + 光互联 + 算力网络 + 国产化。

因此:

中国真正可能形成的不是一个“NVIDIA的低配复制品”,而是一套不同的AI基础设施架构。

至少从华为最新公开的Peerium、灵衢、昇腾960、Hi-ONE和3D数据中心来看,这条路线已经非常明确。

四十五、但必须看到一个关键边界

这里必须把:

架构能力

和:

规模化产业能力

分开。

华为已经公开给出100万NPU的架构能力,但目前公开信息不能等同于:

中国已经部署了100万张昇腾960。

目前可以确认的是:

  1. Atlas 950 25.6万卡超节点集群已经进入部署;
  2. Atlas 960已经发布;
  3. 4096卡SuperPoD已经公开;
  4. 51.2万卡集群架构已经公开;
  5. 通过多轨道拓扑支持100万卡架构已经公开。

因此真正需要跟踪的是:

100万卡“架构上限” → 25.6万卡部署 → 50万卡部署 → 百万卡实际运行

这才是产业验证链。

四十六、中国AI Factory真正的产业拐点

我认为未来几年最重要的不是某一颗芯片。

而是下面这条链是否依次被验证:

① NPU供给
↓
② HBM供给
↓
③ 超节点规模化
↓
④ 光互联规模化
↓
⑤ 液冷规模化
↓
⑥ AI Factory建设
↓
⑦ 算力网络调度
↓
⑧ AI模型利用率
↓
⑨ Token需求
↓
⑩ 商业价值

只有走完后半段:

国产AI基础设施才真正从“算力建设”变成“AI生产力”。
四十七、最终形成中国AI Factory产业状态模型

如果把这篇报告最终压缩成一个产棱模型:

AI需求
│
▼
国产NPU/GPU
│
▼
HBM / Memory
│
▼
AI SuperPod
│
┌───────────┼───────────┐
▼ ▼ ▼
灵衢 光通信 PCB
│ │ │
└───────────┼───────────┘
▼
SuperCluster
│
▼
液冷
│
▼
AI Factory
│
▼
电力
│
▼
算电协同
│
▼
算力网络
│
▼
百万NPU体系
│
▼
Token生产
│
▼
AI经济价值
四十八、最终判断

中国AI基础设施正在进入一个新的阶段。

过去讨论的是:

中国能不能造AI芯片。

现在开始变成:

中国能不能把几十万乃至百万颗国产AI处理器组织成一个高效计算系统。

华为2026年9月的连续发布,实际上已经把这条路线完整地展示出来:

昇腾960:4096 NPU超节点;

灵衢:统一CPU、NPU、内存、SSD、网络;

Hi-ONE:把光互联推进到超节点内部;

OceanStor M900:把Memory进一步池化;

3D数据中心:重新设计AI Factory的物理基础设施;

Peerium:把百万级处理器定义成一个更大的计算机;

多SuperPoD:最终扩展到100万NPU。

因此,中国AI Factory的核心并不是:

“国产GPU替代NVIDIA GPU”。

更准确的表述应该是:

中国正在尝试建立一套从国产AI处理器、统一互联、光通信、内存池化、液冷、3D数据中心、电力到全国算力网络的完整AI计算基础设施。

而真正值得长期跟踪的,是三个层次:

第一层:能不能造出来

NPU、HBM、光芯片、PCB、液冷、电力。

第二层:能不能连起来

灵衢、NPO、超节点、SuperCluster。

第三层:能不能跑起来并产生经济价值

百万NPU
↓
有效算力
↓
模型利用率
↓
Token
↓
AI应用
↓
收入

第三层才是最终验证。

所以未来研究中国AI硬科技,我认为可以建立一个非常清晰的核心指标:

“下一万卡,最缺什么?”

然后再进一步:

“下一GW,最缺什么?”

再进一步:

“这一GW最终产生多少有效Token?”

这三个问题,把产业研究、产业状态和资产定价真正连接起来。

而华为这次的100万NPU架构发布,使得“中国百万GPU/NPU时代”已经不再只是一个假设性的远景概念,而开始拥有了明确的产品、互联、数据中心和集群架构坐标。真正还需要验证的,是从架构上限到大规模部署,再到利用率和经济回报的全过程。