产棱 · IndPrism China 算力全产业链传导分析

产棱框架v2 | AI Factory动态瓶颈地图 ,从六大产业链到可计算的产业系统

产棱 方法论
本文 5 节
  1. 第一张地图:产业地图
  2. 第二张地图:资产地图
  3. 第一层:物理证据
  4. 第二层:产业证据
  5. 第三层:资产证据

引言:AI产业研究正在进入“瓶颈迁移”时代

过去研究人工智能产业,最常见的方法是按照产业链进行拆分:

GPU、高带宽存储器、光通信、PCB、高频覆铜板、液冷、电力……

这种方法可以帮助我们认识产业,但它仍然停留在“产业链地图”层面。

真正进入大规模AI基础设施建设之后,产业运行方式发生了变化。

AI算力系统并不是六条独立发展的产业链。

它实际上是一个高度耦合的物理系统:

计算需要存储提供数据,存储需要先进封装,计算单元需要高速通信,通信需要光学和电连接,越来越高的计算密度需要液冷,而所有这些设备最终都需要电力。

因此,一个产业环节的变化,会改变另外一个环节的约束条件。

更重要的是:

AI产业最大的机会,并不一定来自景气度最高的产业,而往往来自当前最紧张的瓶颈,以及瓶颈解决之后发生的下一次瓶颈迁移。

因此,研究AI产业真正应该回答的,不只是:

哪个行业在增长?

而应该进一步回答:

AI系统当前最紧张的地方在哪里?为什么紧张?紧张程度正在上升还是下降?如果这个瓶颈被解决,下一个瓶颈会转移到哪里?这个变化最终又会如何传导到产业链和资产价格?

这就是“AI Factory动态瓶颈地图”的核心。

一、AI Factory不是六条产业链,而是一个完整的物理系统

所谓AI Factory,可以简单理解为:

围绕大规模AI计算建立的一整套计算、存储、通信、散热和能源基础设施。

它的核心并不是某一颗GPU。

而是下面这条完整链条:

计算

↓

数据供应

↓

数据交换

↓

设备连接

↓

热量排出

↓

能源供应

最终形成一个完整闭环。

如果把AI Factory拆成六个最重要的产业系统,可以得到:

系统核心产业解决的问题
计算系统GPU、AI加速器算得够不够快
存储系统HBM、DRAM数据供不供得上
通信系统交换机、光模块、光纤GPU之间传得够不够快
电连接系统PCB、高频覆铜板、封装基板芯片和设备如何连接
散热系统液冷、冷板、冷却系统热量能不能及时带走
能源系统电网、变电站、变压器、UPS有没有足够的电

这六个系统不是并列关系。

它们之间存在明显的因果关系。

二、第一层:计算系统——AI需求的起点

AI Factory最上游的需求来源,是计算。

核心设备包括:

  1. GPU;
  2. AI专用加速器;
  3. CPU;
  4. 网络处理器;
  5. 其他AI计算芯片。

GPU或者AI加速器承担真正的计算任务。

因此:

计算规模决定整个AI基础设施需要多少数据、多少通信、多少电力以及多少散热能力。

如果AI模型规模扩大,首先增加的是计算需求。

计算需求增加以后,会产生一系列连锁反应:

GPU数量增加

↓

高带宽存储器需求增加

↓

GPU之间通信需求增加

↓

交换机和光通信需求增加

↓

服务器功耗增加

↓

液冷需求增加

↓

数据中心电力需求增加

因此:

GPU不是孤立的一个产业,而是整个AI Factory需求的源头。

三、第二层:存储系统——计算需要“数据燃料”

GPU算得再快,如果数据供应不上,也无法充分发挥性能。

因此AI系统中存在一个非常重要的矛盾:

计算速度不断提高,而数据供应速度是否能够同步提高?

这就是所谓的“存储墙”。

高带宽存储器,英文简称 HBM(High Bandwidth Memory,高带宽存储器),就是解决这一问题的重要产品。

它通过非常高的存储带宽,让GPU能够更快获得数据。

因此可以把HBM理解为:

GPU的高速数据仓库。

四、HBM的瓶颈并不只是存储芯片

这是研究HBM时非常重要的一点。

HBM并不是简单的一颗DRAM芯片。

它涉及:

DRAM存储芯片

↓

芯片堆叠

↓

垂直连接

↓

封装

↓

高密度连接

↓

GPU

所以HBM的供给瓶颈可能出现在不同位置:

  1. DRAM晶圆;
  2. 存储芯片制造;
  3. 芯片堆叠;
  4. TSV等垂直连接技术;
  5. 封装;
  6. 测试;
  7. 先进封装产能。

因此:

看到HBM需求增长,并不意味着整个HBM产业链的所有环节都会同时成为瓶颈。

真正需要跟踪的是:

HBM产业链中究竟哪一个环节最紧张?

五、第三层:通信系统——GPU越多,通信越重要

当AI系统只有少量GPU时,GPU之间的数据交换相对有限。

但当GPU数量增加到几千、几万甚至更大规模以后:

GPU之间需要交换的数据量会急剧增加。

这时候,AI系统出现新的瓶颈:

GPU算得很快

但

GPU之间的数据传输不够快。

这就是“通信墙”。

通信系统主要包括:

  1. 交换芯片;
  2. 高速接口;
  3. 光模块;
  4. 光学引擎;
  5. 光纤;
  6. 网络设备;
  7. 高速连接器等。

六、为什么光通信越来越重要?

数据传输可以简单分成两种方式:

电信号传输

和

光信号传输。

在短距离范围内,电连接仍然具有很强的优势。

但是随着传输速度提高、距离增加,电连接会面临:

  1. 信号损耗;
  2. 信号完整性问题;
  3. 功耗增加;
  4. 传输距离限制。

因此,越来越多的高速、长距离数据传输开始向光通信迁移。

这就是为什么:

AI算力增长最终会传导到光通信。

但需要注意:

光通信并不是简单替代PCB或者所有电连接。

未来更可能形成:

短距离、高密度连接 → 电连接

长距离、超高速连接 → 光连接

两种技术长期共存。

七、第四层:电连接系统——PCB并没有消失

AI产业研究中,一个容易产生的误区是:

光通信发展以后,PCB的重要性会下降。

实际上并不是这么简单。

AI服务器仍然需要大量电连接:

  1. 电源;
  2. 控制;
  3. 管理;
  4. 高速信号;
  5. 芯片连接;
  6. 设备连接。

因此PCB、高频覆铜板和封装基板仍然是整个AI系统的重要基础。

尤其随着高速信号速率不断提高:

PCB本身也需要不断升级。

高频高速材料需要解决:

  1. 信号损耗;
  2. 介电性能;
  3. 信号完整性;
  4. 高速传输稳定性。

因此:

光通信的增长与PCB升级并不是简单的替代关系。

它们实际上是在重新分工。

八、第五层:散热系统——计算密度越高,热就越成为问题

GPU功耗不断提高。

与此同时,服务器内部GPU数量也不断增加。

于是出现一个非常直接的物理问题:

电能最终有相当一部分会转化成热量。

如果这些热量不能及时排出去:

  1. 芯片温度升高;
  2. 性能受到限制;
  3. 稳定性下降;
  4. 设备寿命受到影响。

因此AI Factory必须建立越来越强的散热系统。

九、液冷不是一个单独的产品,而是一整套系统

AI液冷产业链可以简单理解为:

GPU

↓

导热材料

↓

冷板

↓

冷却液

↓

管路

↓

冷却液分配装置

↓

泵

↓

换热器

↓

数据中心冷却设施

其中,冷却液分配装置通常简称 CDU(Coolant Distribution Unit,冷却液分配装置)。

它负责将冷却液输送到不同服务器和设备。

随着AI服务器功率密度提高,液冷的意义已经从:

“一种提高散热效率的方案”

逐渐变成:

支撑更高计算密度的基础设施。

十、第六层:能源系统——AI最终必须面对“电”

AI Factory最终无法绕开一个最基础的物理约束:

电从哪里来?

一座大型AI数据中心可能需要非常巨大的持续电力供应。

完整链条可以理解为:

电网

↓

变电站

↓

变压器

↓

不间断电源系统

↓

配电系统

↓

服务器电源

↓

GPU

因此AI发展最终会传导到:

  1. 电网;
  2. 变电站;
  3. 变压器;
  4. UPS;
  5. 配电设备;
  6. 电源模块;
  7. 高压直流供电等领域。

这意味着:

AI产业的终极约束之一,可能不是芯片,而是能源。

十一、六大产业实际上对应六种物理状态

到这里,可以把六大产业重新抽象。

AI Factory系统对应的核心问题需要观察的状态
计算算力够不够计算状态
存储数据供不供得上存储状态
通信数据传不传得动通信状态
电连接电信号能不能稳定传输电连接状态
散热热能不能及时排出散热状态
能源有没有足够的电能源状态

因此,AI Factory实际上可以被描述成一个六维状态空间:

计算状态 + 存储状态 + 通信状态 + 电连接状态 + 散热状态 + 能源状态

十二、关键不是产业景气,而是“状态变化”

这是整个体系最重要的变化。

传统产业研究喜欢判断:

GPU景气。
HBM景气。
光通信景气。

但对于AI Factory来说,这种判断仍然太粗。

真正应该判断的是:

这个环节正在变得更紧张,还是正在变得更宽松?

例如:

HBM

需求快速增加。

供应跟不上。

↓

存储状态:趋紧。

先进封装

HBM和GPU需求继续增长。

封装产能无法同步增加。

↓

封装状态:趋紧。

光通信

GPU集群规模继续扩大。

通信带宽需求增长。

↓

通信状态:趋紧。

液冷

单机架功率继续提高。

传统风冷逐渐无法满足需求。

↓

散热状态:趋紧。

电力

AI数据中心规模继续扩大。

电网接入和变电能力不足。

↓

能源状态:趋紧。

因此:

真正需要跟踪的是“状态变化”,而不是静态行业标签。

十三、产业状态可以形成一个动态状态机

一个产业环节不会永远处于同一种状态。

可以把它抽象成:

正常

↓

需求增加

↓

逐渐趋紧

↓

瓶颈形成

↓

供给短缺

↓

价格/利润改善

↓

资本开支增加

↓

产能释放

↓

供需重新平衡

↓

正常化

这就是一个完整的产业周期。

因此:

产业研究的核心,不是判断一个行业“好不好”,而是判断它现在处于周期的哪个状态。

十四、真正重要的是“瓶颈”

但是,仅仅判断产业状态仍然不够。

因为:

产业景气不等于产业瓶颈。

例如:

GPU需求非常强。

但如果GPU供给已经大量增加,GPU本身可能已经不是整个AI系统最紧张的地方。

反过来:

某个看起来规模很小的零部件,如果它决定整个系统能不能继续扩张,那么它反而可能成为真正的瓶颈。

所以应该进一步增加一层:

瓶颈状态。

十五、AI Factory的核心不是“六个行业”,而是“瓶颈在哪里”

因此完整逻辑应该变成:

六大产业

↓

产业状态

↓

瓶颈状态

↓

瓶颈变化

↓

下一个瓶颈

这时候研究方式就发生了根本变化。

我们不再只是问:

“光通信是不是好行业?”

而是问:

“随着AI集群规模扩大,通信是不是正在成为限制系统继续扩张的因素?”

同样:

不只是问:

“液冷是不是景气?”

而是问:

“当单机架功率达到更高水平以后,散热是不是开始限制AI服务器继续提高计算密度?”

这才是真正的系统研究。

十六、瓶颈不会消失,只会迁移

这是AI Factory最重要的规律之一。

假设某一阶段:

GPU是瓶颈。

GPU供给增加以后:

↓

HBM成为瓶颈。

HBM扩产以后:

↓

先进封装成为瓶颈。

封装能力提升以后:

↓

高速通信成为瓶颈。

通信能力提升以后:

↓

光学封装成为瓶颈。

光学能力提升以后:

↓

散热成为瓶颈。

散热解决以后:

↓

电力成为瓶颈。

因此:

解决一个瓶颈,并不意味着AI产业进入“没有瓶颈”的状态。

而是:

瓶颈从一个位置迁移到了另一个位置。

十七、因此需要建立“瓶颈迁移图”

可以把AI Factory理解成一张动态地图。

例如:

计算瓶颈

↓

GPU供给增加

↓

存储瓶颈

↓

HBM供给增加

↓

先进封装瓶颈

↓

封装能力增加

↓

通信瓶颈

↓

光通信能力增加

↓

散热瓶颈

↓

液冷能力增加

↓

电力瓶颈

这张图比单纯的产业链图更有价值。

因为产业链图告诉我们:

谁和谁有关系。

而瓶颈迁移图告诉我们:

下一步哪里可能最重要。

十八、但是产业瓶颈还不能直接等于投资机会

这是整个系统中必须增加的一层。

例如:

某个产业成为瓶颈。

并不意味着:

所有相关公司的股票都会上涨。

真正需要建立的是:

产业状态

↓

瓶颈状态

↓

产业传导

↓

资产表达

↓

价格状态

这五层必须分开。

十九、产业瓶颈如何传导到资产?

假设:

AI服务器功率继续提高。

↓

传统风冷能力不足。

↓

液冷需求增加。

↓

冷板、冷却液、冷却液分配装置需求增加。

↓

部分企业订单增加。

↓

收入和利润预期改善。

↓

资本市场开始重新定价。

这才是一条完整的:

物理瓶颈 → 产业需求 → 企业盈利 → 资产价格

传导链。

因此真正需要研究的不是:

“液冷是不是热点?”

而是:

“AI功率密度提高以后,哪个具体环节首先受到物理约束?这个约束是否已经传导到企业订单和资产价格?”

二十、因此必须增加“资产状态”

最终,AI Factory需要同时观察两张地图。

第一张地图:产业地图

物理现实

↓

工程变量

↓

产业状态

↓

瓶颈状态

↓

瓶颈迁移

第二张地图:资产地图

产业变化

↓

企业受益程度

↓

市场预期

↓

资产价格

↓

价格是否已经充分反映

这样才能避免一个非常常见的问题:

产业判断正确,但投资判断错误。

因为产业方向正确,并不意味着资产价格一定还有空间。

二十一、瓶颈真正解决,需要三个层面的证据

这是判断“瓶颈是否已经过去”的关键。

不能因为新闻说:

“产能正在扩张。”

就认为瓶颈已经解决。

真正应该至少观察三个层面。

第一层:物理证据

生产能力有没有真正增加?

例如:

  1. 产能增加;
  2. 设备增加;
  3. 良率提高;
  4. 工艺改善;
  5. 产品性能提升。

第二层:产业证据

供需关系有没有真正改变?

例如:

  1. 交货周期缩短;
  2. 库存增加;
  3. 价格下降;
  4. 订单变化;
  5. 供应能力改善。

第三层:资产证据

市场是否已经开始反映这种变化?

例如:

  1. 股价表现;
  2. 相对收益;
  3. 估值变化;
  4. 资金行为;
  5. 产业链内部的价格分化。

只有三层证据逐渐形成一致方向,才能更有把握地判断:

原来的瓶颈正在真正缓解。

二十二、瓶颈解决之后,要立即寻找“下一个约束”

这是动态瓶颈地图真正有价值的地方。

例如:

HBM供给增加。

不能停留在:

“HBM瓶颈解决了。”

而应该马上问:

HBM解决以后,GPU还能不能继续扩张?

如果答案是:

GPU继续增加以后,先进封装开始不足。

那么:

先进封装就成为新的候选瓶颈。

如果先进封装继续扩张:

再问:

GPU之间的数据交换是否开始成为新的限制?

于是:

通信成为候选瓶颈。

这就是动态研究。

二十三、AI Factory真正需要建立的是一个“时间轴”

因此,最终的研究框架不是:

六大产业链

而应该是:

时间

↓

AI Factory系统状态

↓

当前瓶颈

↓

瓶颈变化

↓

产业传导

↓

资产表达

↓

瓶颈解决

↓

下一个瓶颈

可以进一步压缩成:

TIME → STATE → BOTTLENECK → TRANSITION → ASSET → VALIDATION → NEXT STATE

中文就是:

时间 → 系统状态 → 瓶颈 → 瓶颈迁移 → 资产表达 → 验证 → 下一状态

这样,AI产业就从一张静态地图变成了一套动态系统。

二十四、从“产业链研究”走向“产业系统研究”

传统产业研究通常是:

行业 → 公司 → 产品 → 市场。

而AI Factory研究应该进一步升级:

物理系统 → 工程变量 → 产业状态 → 瓶颈 → 传导 → 企业 → 资产 → 验证 → 下一阶段。

这两种研究方式最大的区别是:

传统方法回答:

“这个行业是什么?”

动态瓶颈方法回答:

“这个系统现在发生了什么?”

传统方法回答:

“谁属于这个产业?”

动态瓶颈方法回答:

“谁真正受到这个瓶颈驱动?”

传统方法回答:

“这个行业未来会增长吗?”

动态瓶颈方法回答:

“当前最紧张的地方在哪里,以及这个紧张状态会向哪里迁移?”

二十五、最终形成AI Factory六维动态状态空间

最终,可以把整个AI Factory抽象成六个核心状态:

① 计算状态

GPU和AI加速器的供给、性能、功耗、集群规模。

② 存储状态

高带宽存储器、DRAM、存储带宽、容量以及先进封装。

③ 通信状态

交换芯片、高速接口、光模块、光纤以及GPU之间的数据交换能力。

④ 电连接状态

PCB、高频覆铜板、封装基板以及高速电信号传输能力。

⑤ 散热状态

功率密度、液冷、冷板、冷却液以及整个热管理系统。

⑥ 能源状态

电网、变电站、变压器、UPS、配电以及AI数据中心可获得的电力。

这六个状态共同构成:

AI Factory的动态状态空间。

二十六、真正的核心不是六条产业链,而是“状态之间的相互作用”

例如:

计算能力提升

↓

产生更多数据需求

↓

存储压力增加

↓

通信压力增加

↓

功耗增加

↓

散热压力增加

↓

电力需求增加

因此:

任何一个状态的变化,都可能改变其他五个状态的约束条件。

这就是为什么AI产业不能再用简单的线性产业链理解。

它实际上更接近一个:

动态耦合系统。

二十七、最终形成产棱式的产业系统表达

如果把整个体系进一步抽象,AI Factory最终可以形成这样一条完整链条:

物理现实

↓

工程变量

↓

产业状态

↓

候选瓶颈

↓

瓶颈证据

↓

反证与排除

↓

真正瓶颈

↓

产业传导

↓

受影响节点

↓

资产映射

↓

资产验证

↓

瓶颈转移

↓

下一阶段系统状态

这已经不再是一篇普通的行业研究报告。

它实际上是一套:

可以持续运行、持续更新、持续验证的产业系统。

二十八、真正值得保护的核心能力

如果最终把这套体系做成系统,那么最有价值的部分并不是:

  1. 六大产业链;
  2. GPU股票池;
  3. HBM数据库;
  4. 光通信数据库;
  5. 液冷数据库。

这些内容本身都可以被复制。

真正难以复制的是:

把现实世界中的复杂产业,转换成可以持续跟踪、持续判断、持续验证、持续演化的结构化系统。

也就是:

现实产业

↓

结构化产业对象

↓

传感器与数据

↓

状态判断

↓

瓶颈识别

↓

证据与反证

↓

产业传导

↓

资产映射

↓

结果验证

↓

系统更新

这才是整个体系真正的核心。

二十九、最终结论

AI Factory并不是六条产业链简单叠加起来的结果。

它是一个由:

计算、存储、通信、电连接、散热、电力

共同构成的复杂物理系统。

这个系统最大的特征不是:

每个产业都会一直增长。

而是:

系统的瓶颈会不断迁移。

一个瓶颈被解决之后,新的瓶颈会在其他位置出现。

因此,未来研究AI基础设施最重要的能力,不是简单判断:

哪个行业最景气。

而是持续回答:

现在的瓶颈在哪里?
为什么它成为瓶颈?
瓶颈是在强化还是缓解?
什么证据能够证明它真的发生变化?
如果它被解决,下一个瓶颈在哪里?
这个变化如何沿着产业链传导?
最终哪些资产真正获得了价格表达?

由此,AI产业研究就完成了一次重要升级:

从产业链地图

升级为

产业状态地图

再升级为

动态瓶颈地图

最终形成:

一个能够描述产业现实、识别产业约束、追踪瓶颈迁移、连接资产表达,并通过结果不断验证和更新的可计算产业系统。

这才是AI Factory动态瓶颈地图真正的意义。