核心命题
如果大模型公司将资本开支重心从预训练转向后训练,本质上意味着:
AI行业从"一次性巨额算力投入"模式,转向"高频、迭代、分布式算力消耗"模式。
这不是简单的"需求减少"或"需求增加",而是需求结构的根本性重组——某些硬件环节将遭遇断崖式下滑,另一些则迎来爆发式增长。
一、先量化:预训练 vs 后训练的算力需求差距
这是理解一切影响的基础数据。
DeepSeek V4的实测数据
阶段
GPU小时数
占比
典型配置
预训练(32T token)
~260万 GPU小时
96.3%
数千~数万张H800,连续运行数月
后训练(SFT+RL+OPD)
~10万 GPU小时
3.7%
数百~数千张GPU,迭代数周
比值
26 : 1
—
—
行业通用比例
模型规模
预训练算力
后训练算力
比值
7B~70B
10⁴~10⁵ GPU小时
10²~10³ GPU小时
~100:1
200B~1T(MoE)
10⁵~10⁶ GPU小时
10³~10⁴ GPU小时
~26:1
1T+(Dense)
10⁶~10⁷ GPU小时
10⁴~10⁵ GPU小时
~20:1
但有一个关键趋势:RLHF/对齐阶段的算力占比正在从5%→30%快速上升(2026年行业报告数据)。Agent时代的后训练远比传统SFT复杂。
这意味着什么?
旧模式:1次预训练($1亿+)+ 1次后训练($500万)= 总投入$1.05亿
新模式:1次预训练($5000万)+ 10轮后训练迭代($5000万)= 总投入$1亿
→ 总投入可能不变,但算力使用的时间分布、硬件类型、采购节奏完全不同
二、对AI硬件各环节的差异化影响
总览:一张"冰火两重天"的影响矩阵
硬件环节
预训练时代需求
后训练时代需求
变化方向
变化幅度
高端训练GPU(H100/B200/Rubin)
极度旺盛
需求下降
🔴 利空
-30%~-50%
推理GPU/ASIC
中等
爆发式增长
🟢 大利好
+200%~+500%
HBM(高带宽存储)
极度旺盛
需求分化
🟡 结构性变化
总量持平,结构转变
高速互联(NVLink/InfiniBand)
极度旺盛
需求下降
🔴 利空
-40%~-60%
CPU
辅助角色
重要性上升
🟢 利好
+50%~+100%
存储/SSD
高需求
需求上升
🟢 利好
+30%~+50%
液冷/电力基础设施
高需求
需求持续
🟡 持平
0%~+10%
数据中心建设
超大规模集中式
分布式、多节点
🟡 结构变化
总量持平,形态改变
1. 🔴 高端训练GPU:从"供不应求"到"产能过剩"风险
这是受冲击最大的环节。
预训练的算力特征:
需要数千~数万张GPU同时运行(all-reduce通信)
连续运行数周到数月,不能中断
对单卡FLOPS要求极高(FP8/BF16峰值算力)
对GPU间互联带宽要求极高(NVLink 900GB/s+)
后训练的算力特征:
通常数百~数千张GPU即可
运行数天到数周,可中断重启
RL rollout阶段本质是推理(生成回答),不是训练
对单卡FLOPS要求降低,对吞吐量和延迟要求提高
量化影响:
指标
预训练主导时代
后训练主导时代
单次任务GPU数量
10,000~100,000张
500~5,000张
单次任务持续时间
2~6个月
1~4周
年度GPU采购节奏
一次性大单(数万张)
分批小单(数千张×多轮)
GPU利用率
60%~70%(通信开销大)
80%~90%(推理利用率高)
2026年7月的市场信号已经出现:Yorkville分析师指出,训练端投资已进入"后段",从2027年起新增需求将更多转向推理侧。五大云厂商增量ROIC从40%腰斩至20%。
对NVIDIA的影响:
Blackwell/Rubin的训练性能卖点(3.5x提升)吸引力下降
但Rubin的推理性能卖点(Agentic AI推理吞吐10x)恰好契合新趋势
NVIDIA已在GTC 2026明确转向:"Rubin是为Agentic AI和长上下文推理设计的"
风险:如果训练需求下降速度快于推理需求增长,NVIDIA数据中心收入增速将显著放缓
2. 🟢 推理芯片/ASIC:最大赢家
后训练的核心环节——RL rollout(强化学习采样)——本质上是大规模推理:
RL训练循环:
① 模型生成回答(推理)→ 需要大量推理算力
② 奖励模型打分(推理)→ 需要推理算力
③ 策略梯度更新(训练)→ 需要少量训练算力
④ 重复 ①②③ 数万~数十万次
在一个典型的GRPO/PPO训练循环中,推理算力消耗占总后训练算力的70%~80%。
这意味着:
后训练时代,推理芯片的需求量远超训练芯片
2026年数据:推理算力已占全球AI总算力的68%(820 EFLOPS vs 380 EFLOPS)
2030年预计升至80%
受益者:
公司/产品
受益逻辑
NVIDIA推理GPU(Blackwell/Rubin推理模式)
通用推理,生态锁定
Google TPU(v6/v7)
自研ASIC,推理成本优势
AWS Trainium/Inferentia
云厂商自研,TCO最优
Groq/Cerebras等推理专用芯片
极致推理延迟和吞吐
WAIC 2026的核心共识:"TCO和每百万Token成本已取代理论算力峰值,成为衡量AI芯片的核心标尺。" 这对推理芯片是结构性利好。
3. 🟡 HBM:总量持平,但需求结构剧变
维度
预训练对HBM的需求
后训练/推理对HBM的需求
容量
极大(模型参数+优化器状态+梯度)
中等(模型参数+KV Cache)
带宽
极高(all-reduce通信)
高(自回归解码)
单卡HBM用量
80~192GB(H100/B200)
80~288GB(推理需要大KV Cache)
总需求量
由训练集群规模决定
由推理并发量决定
关键变化:
预训练时代:HBM需求 = GPU数量 × 单卡HBM → 与训练GPU强绑定
后训练/推理时代:HBM需求 = 推理并发量 × KV Cache大小 → 与用户规模强绑定
2026年HBM产能已售罄(SK海力士、三星),但需求驱动力正在从"训练集群扩建"转向"推理服务扩容"。如果训练GPU采购放缓,HBM的短期需求增速可能下降,但长期需求因推理爆发而得到支撑。
4. 🔴 高速互联:最被低估的利空
预训练对互联的需求是极端的:
数万张GPU之间的all-reduce通信
NVLink(卡间)+ InfiniBand/RoCE(机间)
单个训练集群的网络设备成本可占总成本的15%~20%
后训练对互联的需求大幅降低:
RL rollout可以分布式独立生成(embarrassingly parallel)
策略更新只需小规模梯度同步
不需要万卡级别的all-reduce
互联环节
预训练需求
后训练需求
变化
NVLink/NVSwitch
每GPU 900GB/s+
仍需,但规模小
🔴 -50%
InfiniBand 800G
万卡集群标配
千卡即可
🔴 -60%
光模块(800G/1.6T)
极大量
大幅减少
🔴 -40%
交换机
多层Fat-Tree
简单拓扑
🔴 -50%
这是最容易被市场忽视的利空。 如果训练集群不再扩建,InfiniBand交换机、800G/1.6T光模块的需求增速将显著放缓。中际旭创、新易盛等光模块公司需要警惕。
5. 🟢 CPU:从"配角"到"刚需"
这是一个反直觉的利好。
Agent后训练(尤其是DeepSeek V4的OPD范式)需要大量CPU参与:
环节
CPU的作用
环境模拟
Agent在终端/浏览器/代码编辑器中执行操作 → 需要CPU运行沙箱环境
工具调用
调用API、执行代码、操作文件系统 → CPU密集型
奖励计算
运行测试用例、验证代码正确性 → CPU密集型
数据预处理
构建训练数据、清洗、标注 → CPU+存储
多专家并行
十余个领域专家同时训练 → 需要大量CPU做调度
WAIC 2026纪要明确指出:"AI交互逻辑从直接与模型交互转变为Agent方式,驱动对高核CPU的结构性需求,CPU与GPU的配比正在从1:8向1:4甚至1:2转变。"
受益者: Intel Xeon、AMD EPYC、ARM服务器CPU(NVIDIA Vera CPU正是为此设计)
6. 🟢 存储/SSD:被忽视的受益者
后训练的迭代频率远高于预训练:
维度
预训练
后训练
数据读取模式
顺序读取,一次遍历
反复读取,多轮迭代
Checkpoint频率
每数千步保存一次
每轮RL结束保存
数据多样性
单一语料库
多领域、多格式、多轮对话
存储IOPS需求
中等
极高(随机读写)
后训练时代,高性能NVMe SSD和分布式存储系统的需求将显著上升。
三、对产业链的"二阶效应"
1. 数据中心建设:从"超级集群"到"分布式推理网络"
维度
预训练时代
后训练/推理时代
集群规模
10万卡级超级集群
千卡级分布式节点
选址逻辑
靠近廉价电力(水电/核电)
靠近用户(低延迟)
建设周期
2~3年
6~12个月
单站投资
$10亿+
$1亿~$5亿
电力需求
100MW+
10~50MW
微软CFO已明确表示:"瓶颈不是芯片,是电。" 如果训练集群不再扩建,电力瓶颈反而缓解,但推理节点的分布式部署会带来新的选址和运维挑战。
2. 云厂商资本开支:增速放缓,但结构转变
云厂商
2026年Capex
训练占比(估计)
推理占比(估计)
Microsoft
$800亿+
~50%
~50%
Google/Alphabet
$1950~2050亿
~40%
~60%
Meta
$1250~1450亿
~45%
~55%
Amazon
$1000亿+
~40%
~60%
如果后训练成为重心:
训练Capex增速放缓(从年增77%→年增20%~30%)
推理Capex加速增长(年增100%+)
总Capex增速可能放缓,但不会下降(Jevons效应)
3. 半导体设备:从"先进制程竞赛"到"成熟制程放量"
芯片类型
制程需求
设备影响
训练GPU(Rubin)
3nm/4nm(台积电)
EUV光刻机需求
推理ASIC
5nm/7nm
DUV+部分EUV
HBM4
先进封装(TSV/混合键合)
封装设备需求
CPU/存储控制器
7nm~14nm
成熟制程设备
如果训练GPU需求放缓,台积电3nm/2nm产能的紧张程度可能缓解,但HBM4和先进封装的需求仍然旺盛。
四、Jevons悖论:需求真的会减少吗?
乐观派论点:后训练 cheaper → 更多模型 → 更多推理 → 更多硬件
后训练成本降低
→ 更多公司/团队能做高质量模型
→ 模型数量从几十个→几百个→几千个
→ 每个模型都需要推理服务
→ 推理算力需求指数级增长
→ 总硬件需求不降反升
历史类比:
云计算让服务器更便宜 → 企业没有减少服务器,而是增加了10倍
GPU让深度学习更便宜 → AI研究没有减少,而是爆炸式增长
悲观派论点:训练是"一次性"的,推理是"持续性"的,但总量不同
预训练:一次性投入$1亿 → 购买10万张GPU → 用完即止
后训练:持续投入$500万/轮 → 购买5000张GPU → 但推理需要持续运营
问题:推理的GPU利用率远高于训练(80% vs 60%)
→ 同样的推理任务,需要的GPU数量更少
→ 硬件效率提升可能抵消需求增长
我的判断:总量不会减少,但增速会放缓,结构会剧变
时间段
训练硬件需求
推理硬件需求
总需求增速
2024~2026
高速增长(+80%/年)
快速增长(+60%/年)
+70%/年
2027~2028
增速放缓(+20%/年)
加速增长(+100%/年)
+50%/年
2029~2031
持平或微降
持续高增长(+80%/年)
+40%/年
高盛预测2026~2031年全球AI基础设施累计投资$7.6万亿,2031年单年$1.6万亿。这个总量不会因为"后训练替代预训练"而消失,但增量的构成会根本性改变。
五、谁赢谁输?产业链投资地图
🔴 承压环节(需求增速放缓或下降)
公司/环节
承压逻辑
严重程度
NVIDIA训练GPU业务
训练集群扩建放缓,Blackwell/Rubin训练卖点弱化
⭐⭐⭐
InfiniBand/高速网络(Mellanox、Arista)
万卡集群需求减少
⭐⭐⭐⭐
800G/1.6T光模块(中际旭创、新易盛)
训练集群互联需求下降
⭐⭐⭐
HBM短期需求(SK海力士、三星)
训练GPU采购放缓→HBM配套需求放缓
⭐⭐
超大规模数据中心建设
10万卡级超级集群需求减少
⭐⭐⭐
EUV光刻机(ASML)
3nm/2nm训练芯片需求增速放缓
⭐⭐
🟢 受益环节(需求加速增长)
公司/环节
受益逻辑
受益程度
推理GPU/ASIC(NVIDIA推理模式、Google TPU、AWS Inferentia)
推理算力需求爆发
⭐⭐⭐⭐⭐
CPU(Intel、AMD、ARM)
Agent环境模拟、工具调用
⭐⭐⭐⭐
推理专用芯片(Groq、Cerebras、国产推理芯片)
极致推理效率
⭐⭐⭐⭐
NVMe SSD/分布式存储
后训练迭代频率高,数据I/O需求大
⭐⭐⭐
液冷/电力
推理节点分布式部署,总量不减
⭐⭐⭐
先进封装(台积电CoWoS、HBM封装)
推理芯片仍需HBM,封装需求持续
⭐⭐⭐
🟡 结构性变化(总量持平,形态改变)
环节
变化方向
数据中心
从少数超大规模→大量中小型分布式
电力基础设施
从集中式大电站→分布式储能+绿电
云服务商
从卖"训练算力"→卖"推理API+Agent平台"
半导体设备
从EUV竞赛→先进封装+成熟制程放量
六、最深层的影响:AI硬件的"价值锚"迁移
旧锚:FLOPS(算力峰值)
"我的GPU有5 PFLOPS FP4算力" → 客户买单
→ 硬件竞争 = 谁的计算峰值高
→ NVIDIA垄断(CUDA生态 + 峰值算力)
新锚:$/Token(每百万Token成本)
"我的推理集群每百万Token成本$0.01" → 客户买单
→ 硬件竞争 = 谁的推理效率高
→ 多元竞争(ASIC、推理专用芯片都有机会)
WAIC 2026的核心判断:"Token经济学正在重塑芯片价值分配。"
这意味着:
NVIDIA的护城河从"算力垄断"变为"生态垄断"——如果推理不再强依赖CUDA,护城河会变浅
ASIC/专用芯片的性价比优势凸显——推理是固定工作负载,专用化收益巨大
七、总结:一张图看懂"后训练时代"的硬件需求重塑
预训练时代(2023~2026) 后训练时代(2027~2030+)
━━━━━━━━━━━━━━━━━━━ ━━━━━━━━━━━━━━━━━━━━━━
算力需求 一次性、集中式、超大规模 持续性、分布式、高频迭代
10万卡 × 6个月 5千卡 × 4周 × 10轮/年
GPU 训练GPU为王 推理GPU/ASIC为王
"谁的FLOPS高" "谁的$/Token低"
互联 InfiniBand + 800G光模块 以太网 + 400G即可
万卡all-reduce 千卡小规模同步
CPU 配角(1:8) 刚需(1:4甚至1:2)
数据加载 Agent环境模拟
HBM 与训练GPU强绑定 与推理并发量绑定
需求随训练集群波动 需求随用户规模持续增长
数据中心 少数超大规模(100MW+) 大量分布式(10~50MW)
靠近电源 靠近用户
价值锚 FLOPS(算力峰值) $/Token(推理效率)
赢家 NVIDIA、台积电、SK海力士 推理芯片、CPU、ASIC
InfiniBand、光模块 、先进封装
输家 — GPU、高速互联、光模块
八、最终判断
后训练时代的到来,不是AI硬件行业的"末日",而是一次深刻的"换挡"。
总量不会崩塌:Jevons效应 + 推理需求爆发,总Capex仍会增长
增速会放缓:从年增70%→年增40%→年增25%,"暴力增长"时代结束
结构会剧变:训练硬件→推理硬件,集中式→分布式,FLOPS→$/Token
竞争格局会重塑:NVIDIA的绝对垄断可能被打破,ASIC和国产芯片迎来窗口
最大风险:如果市场仍按"训练时代"的逻辑给硬件公司估值(高PE、高增速预期),而实际增速已换挡,估值杀将不可避免
一句话总结:AI硬件行业不会"死",但"躺着赚钱"的时代结束了。
作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。