近期产业链消息透露(未经官方确认):英伟达下一代Rubin Ultra的HBM配置可能从288GB下调至192GB,CPU侧SOCAMM容量亦可能从192GB降至96GB,更多KV Cache将通过本地SSD卸载。
核心趋势判断:
无论最终配置如何,产业方向已十分明确——AI服务器不再单纯依赖堆叠HBM提升性能,而是转向在HBM、DRAM、SSD、NAND及高速网络之间重新分配数据,正式迈入分级存储时代。
传统服务器层次清晰:CPU缓存(最热)→ DRAM(运行内存)→ SSD/硬盘(长期保存)。但AI服务器的数据类型极其复杂,包括模型参数、激活值、训练数据、向量数据库和KV Cache,它们对容量、带宽、时延和持久性的要求各不相同。

2. KV Cache的内存墙危机
KV Cache(大模型推理中保存注意力键值的数据)是最大变量。上下文越长、并发用户越多,占用内存越大;尤其在智能体多轮推理、调用工具时,内存压力会进一步剧增。若全部留在HBM,不仅挤占模型空间,更会推高单次推理成本。

三、 技术架构:AI分级存储的四层金字塔
数据按“温度”重新划分,不同介质处理不同任务:
存储层级核心介质职能定位第1层(最热)HBM存放正在参与计算的模型权重和热数据,提供极致带宽。第2层(温)CPU侧DRAM / SOCAMM承担HBM与SSD之间的过渡缓冲,访问频率稍低的数据。第3层(冷)企业级SSD承接较冷的KV Cache、模型参数和向量数据,兼顾容量与速度。第4层(归档)共享存储(硬盘/阵列)存放更大规模的训练数据和归档内容。
决定分级存储落地的关键,已从单一介质升级转向数据智能调度:
KV Cache卸载(核心枢纽)
英伟达已推出基于BlueField-4 DPU的推理上下文存储平台,通过RDMA和高速网络,将KV Cache从GPU内存转移到独立存储层,并支持多节点共享。
SOCAMM(过渡层硬件)
采用LPDDR内存,体积和功耗低于传统服务器内存条,用于扩展CPU侧容量。最终配置容量取决于SSD卸载效率、功耗和整机成本。
HBF(高带宽闪存,新兴潜力层)
利用3D NAND提供比传统SSD更高的并行带宽,保留非易失性。目前闪迪与SK海力士正推动标准化,尚处验证阶段,暂未成熟量产。
高速互联(效率命脉)
数据离开HBM后,依赖PCIe、NVMe-oF、RDMA、DPU和光互联决定搬运效率。光互联不存数据,但决定了分布式内存池能否高效运行。
五、 产业链价值重新分配过去存储价值高度集中于HBM,分级架构下,SSD、NAND、DPU、光互联和软件的重要性显著提升。
1. 上游:介质与材料HBM与DRAM颗粒:SK海力士、三星、美光。
企业级NAND及SSD:三星、铠侠、闪迪、Solidigm、美光。
配套:SSD控制器、TSV先进封装材料、光芯片、连接器、高速PCB。
2. 中游:模块、系统与软件硬件厂商:英伟达(BlueField DPU进入调度层)、戴尔、HPE、IBM、NetApp。
存储平台:DDN、VAST Data、WEKA(构建AI推理共享存储平台)。
国内力量:
介质层:长江存储(NAND)、长鑫存储(DRAM)。
系统层:华为、新华三、浪潮等。
3. 核心瓶颈环节尽管覆盖全面,但国内在高端HBM、企业级SSD主控芯片、DPU、高速互联芯片及全栈软件适配领域,仍亟待突破。

六、 市场空间与终极竞争1. 市场规模(WSTS 2026年预测)
全球半导体总规模:预计达1.511万亿美元。
存储芯片市场:迎来爆发式增长,同比增幅预计高达249.5%,规模突破8000亿美元大关。
增量不仅来自HBM,更来自DRAM、企业级SSD及未来HBF中间层的共同增长。

2. 终极竞争:有效算力
AI基础设施正从“配置更多GPU”进入“管理更多数据”的阶段。未来的核心竞争力,不再是简单比拼配置了多少HBM,而是:
每一瓦功耗、每一元成本,最终能稳定输出多少有效Token(有效算力)。
数据根据使用频率动态迁移,通过DPU、软件栈和光互联整合成有机整体,将成为新一代AI服务器的制胜关键。
作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。