产棱拆解 | 中国百万GPU/NPU时代:国产算力集群到AI Factoryory从昇腾超节点,灵衢互联到百万NPU 的完整架构
本文 15 节
时间基准:2026年9月
一、核心结论
2026年9月,中国AI基础设施出现了一个非常重要的架构拐点。
9月17日,华为发布Peerium计算架构,提出让百万级处理器真正成为一台计算机;同时发布基于灵衢互联和Hi-ONE近封装光学(NPO)的昇腾960超节点。
按照华为公布的架构:
- 单个昇腾960超节点最高4096 NPU;
- 多个超节点可组成最大51.2万卡集群;
- 通过多轨道拓扑,最大支持100万卡昇腾NPU超节点集群;
- Atlas 950超节点已有25.6万卡集群进入部署;
- 华为同时推出3D数据中心,为十万卡以上昇腾超节点集群设计新的数据中心物理架构。
这意味着:
中国的AI基础设施已经开始从“国产GPU/NPU替代”进入“国产AI Factory架构竞争”。
这两个概念完全不同。
过去中国AI算力建设主要解决:
有没有国产AI芯片。
现在开始解决:
几十万、百万颗国产AI处理器如何成为一个整体计算机。
因此,中国AI Factory的产业链也必须重新定义:
这已经不是传统服务器产业。
而是一套新的:
“计算—网络—存储—散热—电力—数据中心”一体化工业体系。二、中国与美国AI Factory的根本区别
美国AI Factory的典型路线正在形成:
中国正在出现另一条路线:
两者表面上非常相似。
但底层思路存在一个明显区别:
美国
更强调:
GPU + 高性能网络 + 分布式Scale-out
华为
更强调:
统一协议 + 统一内存 + 对等互联 + 超节点 + 光互联
这并不是说两者谁一定优于谁。
而是:
中国正在尝试通过系统架构创新,降低单颗AI芯片与传统网络之间的边界。
这可能是中国AI基础设施非常值得研究的一条路线。
三、为什么中国必须走“超节点”路线?这是由中国当前AI芯片产业结构决定的。
如果单颗NPU性能与最先进GPU存在差距,那么简单堆:
并不能自然得到:
因为会产生:
- 通信开销;
- 内存访问开销;
- 数据搬运;
- 网络拥塞;
- 同步等待;
- 节点故障;
- 软件调度损耗。
因此:
芯片之间的互联效率,决定了国产芯片集群最终能发挥多少有效算力。
华为在2026年9月公开指出,随着集群规模扩大,传统架构可能导致模型算力利用率下降;其给出的公开数据是,十万卡集群实际模型算力利用率可能只有约20%。这也是其提出灵衢和Peerium架构的直接背景之一。
这句话非常重要。
因为:
AI算力的真正单位正在从“芯片算力”转向“有效集群算力”。四、第一层:NPU
中国AI Factory最底层仍然是芯片。
目前公开路线中最重要的是:
昇腾NPU。
华为已经从早期:
逐步进入:
但是研究国产AI算力,不能只研究:
单颗NPU性能。
真正应该研究:
NPU × 每Rack数量 × HBM × 互联 × 利用率五、昇腾950:从芯片变成超节点
2026年7月公开亮相的Atlas 950 SuperPoD已经达到:
- 1024卡;
- 1 EFLOPS FP8;
- 2 EFLOPS FP4;
- 256TB全局统一内存编址空间;
- TB级NPU互联带宽;
- RTT约3μs。
华为将其定位为面向万亿级乃至更大模型训练与高并发推理的超节点。
这说明中国AI计算正在发生一个非常重要的变化:
1024张NPU不再被当作1024台服务器。
而是:
一个整体计算机。六、昇腾960:进入4096卡超节点
9月17日发布的昇腾960进一步把这个规模提升到:
4096 NPU / SuperPoD
官方公布:
- FP8:8 EFLOPS
- FP4:16 EFLOPS
- 全液冷
- 灵衢统一内存寻址
- Hi-ONE NPO光引擎
- 5500个Hi-ONE
- 系统可用度99.8%。
这里真正值得注意的不是:
8 EFLOPS。
而是:
4096张NPU被组织成一个计算单元。
这已经进入AI Factory的基本架构。
七、第二层:灵衢互联这可能是中国AI Factory最值得研究的技术之一。
华为把灵衢定义为:
可连接CPU、NPU、内存、SSD、网卡和交换机的高速总线。
其核心思想是:
变成:
也就是说:
计算、存储和网络不再是严格分层的孤立系统。
而开始成为:
一个统一互联资源池。
华为公布的灵衢架构可以把互联带宽从百GB级提升到TB级,并将RTT从约7μs压缩至2μs;其跨柜设备单端口达到1.6T、单机280T全光互联。
八、为什么灵衢可能比单纯“国产GPU”更重要?因为中国真正面对的问题并不是:
造一颗NPU。
而是:
如何把百万NPU组织起来。
如果:
但集群利用率:
那么:
如果通过架构优化:
即使NPU本身不变:
等价于:
算力供给增加150%。
所以:
互联架构实际上可以创造“虚拟算力”。
这也是中国AI Factory路线中最值得关注的地方。
九、第三层:百万NPU真正的核心——Peerium2026年9月17日,华为又把这个概念往上推进了一层:
Peerium计算架构。
其目标不是:
让100万张NPU组成100万个节点。
而是:
让百万级处理器成为一台更大的计算机。
官方给出的核心技术包括:
- Nested BSP;
- 嵌套并行;
- 统一内存寻址;
- 对等互联;
- 灵衢统一互联。
这是一个非常重要的架构变化。
十、百万NPU不是“100万个芯片”必须把这件事情理解清楚。
传统:
AI Factory:
百万NPU进一步:
因此:
百万NPU真正的价值不在于数字“100万”,而在于百万级规模下还能不能保持有效扩展。十一、第四层:光通信
这里中国AI Factory开始出现一个非常有意思的架构变化。
美国目前正在从:
800G → 1.6T → CPO
推进。
中国同样如此。
但华为进一步把光通信:
直接推进到了超节点内部。十二、Hi-ONE:从光模块走向NPO
昇腾960采用:
Hi-ONE NPO光引擎。
华为公开数据:
- 单个Hi-ONE传输容量:7.2Tbit/s;
- 5500个Hi-ONE;
- 用于替代原本约4.8万个800G光模块;
- 系统功耗降低超过550kW。
这个数字非常值得研究。
因为它说明:
中国AI Factory并不是简单复制传统“GPU+800G光模块”架构。
而是在尝试:
把光互联进一步靠近计算节点。
也就是:
过去研究光通信:
未来需要增加:
因此未来中国AI光通信产业需要重点关注:
- EML;
- CW Laser;
- InP;
- Silicon Photonics;
- NPO;
- 光引擎;
- 光纤;
- 连接器;
- 高速SerDes;
- 光交换。
2026年9月中国国际光电博览会期间,多家产业链企业公开反馈1.6T需求增长、部分产品订单与产能已经排至2027年,说明中国AI光通信正在进入新的扩产阶段。
十四、第五层:HBM / Memory这里是中国AI Factory与美国之间最大的结构性差异之一。
美国AI GPU生态:
NVIDIA → HBM4 → SK hynix / Samsung / Micron
而中国AI Factory:
国产NPU → 高带宽存储 → 国内/全球供应链
这里真正的核心问题是:
中国能否建立与百万NPU相匹配的高带宽内存供应体系。十五、为什么HBM是中国AI Factory最大的潜在“硬约束”之一?
因为:
如果未来:
每颗需要数百GB级高带宽内存,那么:
这是一个极其庞大的HBM需求。
这会把中国AI Factory直接连接到:
- DRAM;
- TSV;
- 先进封装;
- 硅中介层;
- HBM封装;
- 高端封装设备;
- 材料。
这里必须保持谨慎。
目前中国DRAM产业正在快速扩张。
例如长鑫科技2026年已经进入新的DRAM技术平台量产阶段,并继续扩充产能。
但:
普通DRAM进步 ≠ HBM已经完全解决。
HBM涉及:
所以中国HBM真正需要观察的是:
高带宽内存的量产规模、良率和每颗NPU实际配置。
而不是简单看:
“中国有没有DRAM。”十七、HBM可能成为中国AI Factory的第一大外部瓶颈
如果百万NPU架构真正快速建设:
的需求可能非常巨大。
因此中国AI Factory可能形成:
NPU供给速度受HBM约束。
这会产生一个非常典型的瓶颈迁移:
谁先解决,瓶颈就向下一个环节迁移。
十八、第六层:PCB中国AI Factory的PCB需求与美国非常类似,但存在一个特殊变量:
国产AI芯片生态正在提高服务器、交换机和高速网络系统的国产化比例。
AI服务器PCB正在从:
进入:
而且:
NPU越多 → PCB价值量越高。十九、PCB的真正需求公式
不要简单:
AI服务器数量 × PCB价值。
应该:
因此AI Factory越大:
PCB价值量呈系统级增长。
中国PCB产业在2026年也已经出现明显的AI高端板扩产信号;部分企业披露正在建设面向AI服务器、高速光模块等高附加值产品的新增产能。
二十、PCB真正的供需拐点中国PCB行业不能看:
整体PCB产能。
真正需要看:
高速高层AI PCB。
因为:
这就是典型的:
结构性供需。二十一、第七层:液冷
中国AI Factory的液冷实际上已经非常明确。
2025年中国信通院数据显示,我国智算中心智能算力规模已经达到788 EFLOPS(FP16),并且液冷正在成为高密度智算中心的重要基础设施。
工信部2026年进一步明确推动:
智算中心复合液冷、液冷服务器、高密度服务器以及高效UPS等技术。二十二、华为正在把液冷推到更高密度
2025年华为云已经公开披露:
- CloudMatrix 384;
- 全液冷AI数据中心;
- 单机柜80kW散热;
- PUE最低约1.1;
- 规划更高密度机柜。
2026年昇腾960则进一步采用:
全液冷超节点。
这说明液冷已经从:
数据中心节能方案
变成:
AI计算架构的一部分。二十三、中国液冷真正的供需拐点
中国液冷与美国的逻辑基本一致:
但中国有一个额外变量:
大量既有IDC需要改造。
因此市场可能同时存在:
新建AI Factory
全液冷。
老数据中心
液冷改造。
这会扩大液冷产业链的需求范围。
二十四、第八层:电力中国AI Factory的电力逻辑与美国有一个非常明显的区别。
美国:
电力供应与并网本身已经成为非常大的约束。
中国:
更强的是电网建设、能源结构和全国算力网络的统筹能力。
但这不意味着中国没有电力瓶颈。
恰恰相反:
百万NPU时代,电力仍然是最大的物理约束之一。二十五、从“数据中心”进入“算电协同”
中国正在推进:
算电协同。
2026年国家数据局披露,截至2026年7月底,全国智算总规模已经达到245万PFLOPS(FP16),八大国家算力枢纽和三个算电协同发展区的智算规模占全国超过85%。
这意味着中国不是单纯:
在城市里堆数据中心。
而是在尝试:
进行全国级优化。
二十六、中国AI Factory的一个特殊优势:全国算力网美国AI Factory更偏:
中国则同时出现:
也就是:
超节点 + 算力网络
双重结构。
国家数据局已经明确提出进一步优化全国算力布局、提升供给能力、加强监测调度和深化算电协同。
二十七、因此中国百万NPU并不一定是一座“超级机房”更可能是:
所以:
中国百万NPU时代可能天然具有“分布式AI Factory”特征。二十八、华为3D数据中心:这是另一个非常关键的信号
2026年9月16日,华为发布所谓全球首个3D数据中心。
其核心不是建筑造型。
而是:
把数据中心从二维水平布局变成垂直分层的工业产品。
架构为:
华为明确提出:
通过“动力层”和“生产层”分离,以及标准化、预制化、现场装配,实现AI数据中心批量复制。
这其实意味着:
AI Factory正在从“建设工程”变成“标准化工业产品”。二十九、这是一个非常重要的产业变化
传统数据中心:
AI Factory:
结果就是:
AI算力建设周期开始工业化。
这会进一步推动:
- 模块化数据中心;
- 液冷模块;
- 供电模块;
- CDU;
- UPS;
- 变压器;
- 高速网络;
- 机柜;
- 预制机房。
现在重新建立完整产业链:
| 层级美国中国 | ||
| Compute | GPU | GPU + NPU |
| Memory | HBM4/HBM4e | HBM + 国产高带宽存储 |
| Interconnect | NVLink | 灵衢 |
| Network | Ethernet/IB | 灵衢/RoCE/Ethernet |
| Optical | 800G/1.6T/CPO | 800G/1.6T/NPO |
| Rack | NVL72 | 昇腾SuperPoD |
| SuperPod | 数千GPU | 1024→4096 NPU |
| Cluster | 数万~更大 | 25.6万→100万NPU |
| Cooling | Liquid | Liquid |
| Data Center | AI Campus | 3D AIDC |
| Power | GW级 | GW级+算电协同 |
| Network | AI WAN | 全国算力网 |
这里真正值得注意:
中国已经不是“没有AI Factory”。
而是开始形成自己的架构。
三十一、六大产业链的当前状态① NPU / GPU
状态:规模化放量阶段。
核心瓶颈:
芯片供应 + HBM + 先进封装 + 软件生态 + 集群部署。
真正拐点:
国产NPU供给能力超过AI Factory建设速度。
② HBM
状态:强约束。
核心瓶颈:
HBM产能、先进封装、良率。
真正拐点:
国产HBM进入稳定规模化量产,并且每颗NPU的HBM配置进一步提升。
③ 光通信
状态:快速升级。
核心瓶颈:
1.6T光模块、光芯片、NPO、光引擎。
真正拐点:
1.6T从高端量产进入大规模标准化部署。
目前中国产业链已经出现部分1.6T产品订单和产能紧张的反馈。
④ PCB
状态:结构性紧张。
核心瓶颈:
高速、高层、大尺寸、高频材料。
真正拐点:
高端AI PCB扩产完成。
⑤ 液冷
状态:快速渗透→规模化。
核心瓶颈:
冷板、CDU、管路、连接器、系统集成。
真正拐点:
AI Rack进入200kW甚至更高功率密度。
华为公开信息已经把AI机柜从70kW、80kW进一步推向100~200kW及更高密度。
⑥ 电力
状态:长期约束。
核心瓶颈:
变压器、配电、UPS、并网、数据中心供电架构。
真正拐点:
AI Factory新增容量开始受到电力接入限制。三十二、但中国和美国最大的差异是“瓶颈结构”
可以把两者画成:
美国
中国
中国多出来一个非常重要的变量:
算力网络。
因为中国未来可能不是单纯建设:
一个超级AI Factory。
而是:
多个AI Factory + 全国算力网络。三十三、中国真正可能形成的AI Factory模式
未来可能出现三种形态。
第一种:企业私有AI Factory
第二种:云厂商AI Factory
第三种:国家级算力网络
这三者最终可能形成:
中国AI计算基础设施三层结构。三十四、真正的竞争不是“谁的NPU更像GPU”
这一点非常重要。
如果把中美AI竞争简化成:
NVIDIA vs Ascend
实际上会错过真正的产业变化。
更准确的比较应该是:
| 层级美国中国 | ||
| 芯片 | NVIDIA/AMD | Ascend等国产NPU |
| 内存 | HBM供应链 | 国产+全球供应链 |
| Scale-up | NVLink | 灵衢 |
| Optical | CPO | NPO/Hi-ONE |
| SuperPod | NVIDIA体系 | Ascend SuperPoD |
| Cluster | AI Supercluster | SuperCluster |
| Cooling | 液冷 | 液冷 |
| Power | GW级 | GW级 |
| Software | CUDA生态 | CANN/国产生态 |
| Network | AI WAN | 全国算力网 |
| Factory | AI Factory | AIDC/算力基础设施 |
所以真正的竞争单位已经从:
芯片
变成:
AI计算体系。三十五、一个非常重要的变化:华为正在把“光”变成计算基础设施
过去华为最强的能力之一就是通信和光。
现在这套能力开始进入AI计算内部。
形成:
Hi-ONE就是一个非常典型的信号。
华为甚至公开表示,昇腾960通过5500个Hi-ONE替代约48000个800G光模块,并降低超过550kW功耗。
如果这一架构能够规模化:
光通信在AI Factory中的价值量可能进一步上移。
过去光模块是:
网络设备的组件。
未来可能变成:
计算系统的组成部分。三十六、这对中国光通信产业意味着什么?
产业链可能从:
进一步变成:
因此未来研究中国光通信不能只问:
800G出货多少?
而应该问:
光互联是否正在进入NPU计算域?
如果答案是肯定的:
光通信的产业价值量会继续上移。三十七、中国AI Factory最值得研究的第二个变量:内存池化
华为灵衢架构还有一个重要变化:
Memory不再一定属于某一颗NPU。
传统:
未来:
华为已经发布OceanStor M900,作为基于灵衢的上下文记忆存储系统,支持PB级KV Cache。
这意味着:
AI Factory正在形成新的Memory Hierarchy。三十八、Agent时代进一步改变AI Factory
训练时代:
GPU最重要。
推理时代:
GPU + Memory。
Agent时代:
GPU + CPU + Memory + Storage + Network。
因为Agent不断产生:
- KV Cache;
- 长上下文;
- 工具调用;
- 沙箱;
- 向量搜索;
- 数据交换。
所以:
AI Factory将从“GPU工厂”逐渐变成“Token工厂”。三十九、Token Factory才是最终形态
最终:
所以未来评价一个AI Factory:
不能只看:
PFLOPS。
而应该看:
Tokens / Watt / RMB / 秒
以及:
每GW能产生多少有效Token。四十、中国百万NPU的真正经济学
假设未来:
那么真正需要计算的是:
最终得到:
有效Token产能。
而不是:
理论算力。
这就是中国AI Factory真正需要建立的新经济指标。
四十一、因此六条产业链最终会形成一张“瓶颈迁移图”瓶颈会不断迁移:
不能问:
“中国AI哪个行业最好?”
应该问:
“中国AI Factory当前新增的1000卡/1万卡/10万卡,最缺什么?”
例如:
如果NPU供应不足
看:
NPU → HBM → 封装。
如果NPU供应改善
看:
光通信 → PCB。
如果万卡集群建设加速
看:
光通信 → 网络。
如果机柜功率超过100kW
看:
液冷。
如果数据中心建设达到GW级
看:
变压器 → UPS → 配电 → 电网。
这就是:
瓶颈迁移交易框架。四十三、中国AI Factory的六大状态变量
最终可以建立一个非常简单的模型:
| 变量核心观察 | |
| NPU | 国产算力供给速度 |
| HBM | 高带宽内存供给 |
| Optical | 1.6T/NPO放量 |
| PCB | 高端高速板供需 |
| Cooling | 单Rack功率密度 |
| Power | AI Factory可获得GW容量 |
再增加三个:
| 上层变量观察 | |
| Cluster | 超节点规模 |
| Utilization | 实际有效算力 |
| Token | 最终需求 |
最终形成:
如果把两套体系极度简化:
美国
核心优势:
GPU性能 + 软件生态 + 系统整合。
中国
核心路线:
系统架构 + 网络 + 光互联 + 算力网络 + 国产化。
因此:
中国真正可能形成的不是一个“NVIDIA的低配复制品”,而是一套不同的AI基础设施架构。
至少从华为最新公开的Peerium、灵衢、昇腾960、Hi-ONE和3D数据中心来看,这条路线已经非常明确。
四十五、但必须看到一个关键边界这里必须把:
架构能力
和:
规模化产业能力
分开。
华为已经公开给出100万NPU的架构能力,但目前公开信息不能等同于:
中国已经部署了100万张昇腾960。
目前可以确认的是:
- Atlas 950 25.6万卡超节点集群已经进入部署;
- Atlas 960已经发布;
- 4096卡SuperPoD已经公开;
- 51.2万卡集群架构已经公开;
- 通过多轨道拓扑支持100万卡架构已经公开。
因此真正需要跟踪的是:
100万卡“架构上限” → 25.6万卡部署 → 50万卡部署 → 百万卡实际运行
这才是产业验证链。
四十六、中国AI Factory真正的产业拐点我认为未来几年最重要的不是某一颗芯片。
而是下面这条链是否依次被验证:
只有走完后半段:
国产AI基础设施才真正从“算力建设”变成“AI生产力”。四十七、最终形成中国AI Factory产业状态模型
如果把这篇报告最终压缩成一个产棱模型:
中国AI基础设施正在进入一个新的阶段。
过去讨论的是:
中国能不能造AI芯片。
现在开始变成:
中国能不能把几十万乃至百万颗国产AI处理器组织成一个高效计算系统。
华为2026年9月的连续发布,实际上已经把这条路线完整地展示出来:
昇腾960:4096 NPU超节点;
灵衢:统一CPU、NPU、内存、SSD、网络;
Hi-ONE:把光互联推进到超节点内部;
OceanStor M900:把Memory进一步池化;
3D数据中心:重新设计AI Factory的物理基础设施;
Peerium:把百万级处理器定义成一个更大的计算机;
多SuperPoD:最终扩展到100万NPU。
因此,中国AI Factory的核心并不是:
“国产GPU替代NVIDIA GPU”。
更准确的表述应该是:
中国正在尝试建立一套从国产AI处理器、统一互联、光通信、内存池化、液冷、3D数据中心、电力到全国算力网络的完整AI计算基础设施。
而真正值得长期跟踪的,是三个层次:
第一层:能不能造出来
NPU、HBM、光芯片、PCB、液冷、电力。
第二层:能不能连起来
灵衢、NPO、超节点、SuperCluster。
第三层:能不能跑起来并产生经济价值
第三层才是最终验证。
所以未来研究中国AI硬科技,我认为可以建立一个非常清晰的核心指标:
“下一万卡,最缺什么?”
然后再进一步:
“下一GW,最缺什么?”
再进一步:
“这一GW最终产生多少有效Token?”
这三个问题,把产业研究、产业状态和资产定价真正连接起来。
而华为这次的100万NPU架构发布,使得“中国百万GPU/NPU时代”已经不再只是一个假设性的远景概念,而开始拥有了明确的产品、互联、数据中心和集群架构坐标。真正还需要验证的,是从架构上限到大规模部署,再到利用率和经济回报的全过程。