研报学习:英伟达 Rubin 机柜深度研究

2026-09-15 20:57:595
一、一句话总结

AI 服务器正在从“堆 GPU”,变成“拼整柜”。

Rubin 机柜 BOM 成本接近翻倍,但
GPU 占比反而下降。内存、PCB、MLCC、ABF、电源、液冷等环节价值量大幅提升,利润从核心芯片向中下游扩散。同时,存储和关键材料进入较长紧缺周期。

二、Rubin 机柜价值变化1. 需求:AI 服务器持续增长

2023 年:约 120 万台

2024 年:175 万台

2025 年:217 万至 220 万台

2026 年:265 万至 270 万台

2027 年:有望突破 320 万台

2026 年同比增速预计超 20%,更新预测可达
28% 以上,占整体服务器比重约
17%。

增长动力:北美云厂商、主权云、推理负载、定制 AI ASIC。

2. 供给:存储和材料进入紧缺周期

DRAM:涨幅预期从约
150%
上调到
250%-280%。

NAND:涨幅预期从约
100%
上调到
200%-250%。

ABF 载板、CCL:同步上修。

DRAM 供需缺口预计 4.9%,或为
十五年来最严重短缺。

紧缺可能延续到 2028 年。

原因:HBM 挤占普通 DRAM 产能,云厂长约锁定供给,先进制程新产能要
2028-2029 年才逐步释放。

3. 单柜价值:GPU 占比下降,内存成第二大价值池

GPU

GB300:252 万美元

Rubin VR200:396 万美元

增幅:约 57%

占比:从近三分之二降到
约 51%

仍是最大价值池,但不是唯一主线。

内存

GB300:37.4 万美元

Rubin VR200:200.2 万美元

增幅:435%

占比:升到
26%

成为第二大价值池,也是
BOM 最大增量。

PCB

GB300:3.5 万美元

Rubin VR200:11.7 万美元

增幅:233%

增幅居全部组件之首,弹性最大。

MLCC

GB300:1530 美元

Rubin VR200:4320 美元

增幅:182%

用量和规格双升,低占比高弹性。

ABF

GB300:1.1 万美元

Rubin VR200:2 万美元

增幅:82%

载板单价和数量同步倍增。

电源

GB300:5.8 万美元

Rubin VR200:7.6 万美元

增幅:32%(按原文数据)

核心变化:800V HVDC 架构升级。

液冷

GB300:6.5 万美元

Rubin VR200:7.2 万美元

增幅:12%(按原文数据)

若计入 side-car CDU,单柜散热总价值约
12.2 万美元。

核心驱动:整柜 BOM 接近翻倍,主要来自
存储等侧规格升级和供需涨价,而不是 GPU 本身提价。

4. 细分环节通俗解释

内存为什么涨最猛

HBM4:20.7TB,价值约
40 至 50 万美元。

LPDDR5X:54TB,是 GB200 的
三倍,价值约
40 至 54 万美元。

3D NAND:Rubin 首次大规模把 NAND 放进机柜,用于模型加载和检查点,单机架价值
超 100 万美元,GB200 几乎为零。

HBM 耗片量是普通 DRAM 的数倍,持续挤占通用产能。

PCB 为什么弹性最大

新增 ConnectX 模组 PCB 和 Midplane 中板 PCB,贡献约
4.6 万美元纯增量。

计算板从
22 层 HDI 升到 26 层,CCL 从
M7 升到 M8,单价从
650 美元升到 1400 美元。

交换板从
24 层升到 32 层。

新增
44 层中板。

不是多几块板,而是
更复杂、更贵的板。

MLCC 和 ABF

MLCC:一台 AI 服务器约
3 万颗,是智能手机的
30 倍、汽车的
3 倍;单个 NVL72 机柜消耗
44 万颗。

ABF:Rubin GPU 载板单价从约
100 美元翻倍到 200 美元;NVSwitch ASIC 从
18 颗增到 36 颗;ConnectX 芯片从
36 颗增到 72 颗。

绝对金额不大,但
增速快,业绩弹性强。

电源和液冷

电源:Rubin Ultra 将用
800V HVDC,传统
54V 撑不住单机柜 200kW 以上,端到端供电效率从
87.6% 提升到 98%。

液冷:高功率密度下
全液冷成为必需,冷板通道间距从
150 微米收窄到 100 微米。

供电和散热已从配角变成高密度算力的硬约束。

三、Vera Rubin NVL72 架构通俗版1. 定位

Vera Rubin 是面向
Agentic AI 时代的新平台,核心思路是
把整座数据中心当成一台计算机。

2. 整柜规格

72 颗 Rubin GPU + 36 颗 Vera CPU。

NVLink 6 全互联。

单 GPU 带宽
3.6TB/s。

整柜横向扩展带宽
260TB/s。

训练性能较 Blackwell 最高提升
4 倍。

推理性能最高提升
10 倍。

单 Token 成本降到前代
约十分之一。

机柜架构:48U 第三代 MGX。

18 个计算托盘 + 9 个 NVLink 交换托盘。

顶部和底部共
4 个电源架,2 个管理交换机。

3. 计算托盘

每个托盘
2 个 Vera Rubin 超级芯片。

承载
4 颗 Rubin GPU + 2 颗 Vera CPU。

Rubin GPU:两颗计算裸片封装,224 个流式多处理器,第五代张量核心,288GB HBM4,NVFP4 下最高
50 PetaFLOPS
推理算力。

Vera CPU:88 核定制 Olympus,空间多线程扩展到
176 线程,单颗最高
1.5TB LPDDR5X。

NVLink-C2C 以 1.8TB/s
实现 CPU-GPU 内存一致性。

每托盘
8 个 ConnectX-9 SuperNIC,每颗 GPU 对外网络带宽
1.6Tb/s。

1 个 BlueField-4 DPU,800Gb/s,负责网络、存储、安全卸载。

4 个 E1.S NVMe
本地缓存。

无缆线化:用刚性 PCB 中板代替铜缆和液冷软管,组装时间从近
2 小时压缩到约 5 分钟,效率最高提升
20 倍。

散热:单相直接液冷。

4. 交换托盘

整柜
9 个交换托盘。

每个托盘
4 颗 NVLink 6 Switch,合计
36 颗。

NVLink 主干由
4 个模块化线缆盒构成,内含约
5000 根铜缆。

每颗 GPU 最多支持
36 条 NVLink 链路,较前代
18 条翻倍。

任意 GPU 到任意 GPU
一跳直达。

每颗交换芯片内置 SHARP 引擎,整柜合计
130 TFLOPS FP8
网内计算能力。

支持热插拔、在线升级、部分填充运行。

5. Spectrum-X 以太网

把机柜内算力扩展到
跨机柜、跨数据中心。


Spectrum-6 交换机 + ConnectX-9 SuperNIC
协同构成。

采用
共封装光学 CPO,替代可插拔光模块。

功率效率提升 5 倍,网络韧性提高 10 倍,正常运行时间延长 5 倍。

可选
Quantum-X800 InfiniBand
作为备选。

6. 热管理

100% 液冷,移除运算托盘风扇。

冷板覆盖机箱全深度发热元件。

支持入口温度
17℃ 到 45℃,出口上限
65℃,运行压力最高
72psig。

冷板微通道升级,Max-P 下单颗 GPU 处理约
2300W,Max-Q 下
1800W。

单一冷板模组可覆盖两颗 Rubin GPU、Vera CPU、SOCAMM 内存和 VRM。

采用
液态金属铟 TIM2
导热,镀金防腐蚀。

冷板装配前移到
L6 阶段,整机装配只需插接。

7. 供电架构

从低压直流走向
800V 高压直流。

传统数据中心
415/480V 三相交流,机柜内多为
54V 直流。

Rubin 推动
800V 直流,提升可扩展性和能效,降低材料用量。

引入
液冷母线,用液体冷却替代风冷。

高压化 + 液冷化,构成 Rubin 高功率密度的供电底座。

四、产业动态一句话版国内 CSP 与大模型

DeepSeek 发布 V4.1 Flash:552B MoE,性能超 V4 Pro,HBM 需求降到 1/4,SSD 需求降到 1/8。

DeepSeek 筹备科创板 IPO:或已委托筹备;新一轮融资约 500 亿元,对应估值约 5000 亿元。注意,这不是 IPO 发行估值,而是当前融资估值。

腾讯文档上线 AI 工作台:支持人机双写、修订记录、后台执行。

Kimi K2.8 全量上线:所有会员可用
1M 上下文;月之暗面
ARR 破 10 亿美元,推进港股 IPO。

海外 CSP 与大模型

GPT-6 Astra 开放:能力更强,但安全争议大。

GPT-6 Sol 内测:速度约为 Astra 的
6 倍。

OpenAI 算力预算升到 7500 亿美元,首次自建数据中心。

Meta 发布个人 Agent Muse:配独立安全虚拟机,可云端持续运行。

国产算力

华为麒麟 9050 Pro:逻辑折叠技术,端侧
300 亿参数 MoE,整机性能提升
42%。

光博会:NPO 战略地位提升,1.6T 推进中,高密度 FAU 单模组价值从
15 美元升到 200 美元。

海外算力

Arm CSS for Mobile 2:AI 模型性能最高提升
70%。

谷歌 TPU Ironwood:每美元性能最高领先 B200 达
50%,对 B300 领先接近
96%。

苹果 A20 Pro:首颗
2nm
手机芯片,CPU 最高提升
20%,GPU 最高提升
40%。

五、学习要点

AI 硬件主线:从 GPU 单点,转向整柜系统。

最大增量:内存。

最大弹性:PCB。

低占比高弹性:MLCC、ABF。

硬约束:电源、液冷。

紧缺持续:存储可能紧到 2028 年。

利润扩散:从核心芯片向中下游细分龙头扩散。




作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。

合规声明:本站发布的所有文章及观点均系个人研究共享,投资心得交流,不代表本站立场,且不构成任何形式的投资建议。投资者据此操作,风险自担,请务必保持独立审慎的决策态度。