AI 算力的下一场竞争,一定不只是盯着 GPU 出货量。近日,摩根士丹利的研究给出了一条更具体的线索,英伟达可能为 Rubin Ultra 分层配置高带宽内存,Google TPU 正在放量,而承载更多 GPU 的 Kyber 机柜,仍卡在 PCB 与散热工程上。这三条线共同指向一件事,AI 算力的瓶颈,正在从单颗芯片,迁移到内存、先进封装、测试与机柜系统的资源分配。一、HBM 供应紧缺,GPU 也要开始分层
大摩称,英伟达 Rubin Ultra 可能不再采用单一 HBM 配置,高端版采用 HBM4e 8Hi,其他版本则使用 HBM4 12Hi 或 8Hi。这背后有三层考虑,HBM 供给不足、成本压力,以及不同工作负载对内存容量的要求并不一样。看来,大摩和笔者还是一个思路,推出不同 HBM 配置的 Rubin Ultra 版本的确可以增强英伟达的差异化优势。第一,尽可能维持 Rubin Ultra 原有的高 HBM 配置,继续守住 GPU 近端最高带宽、最低延迟的存储优势。退一万步讲,可以推出不同 HBM 配置的 Rubin Ultra 版本。梦四维,公众号:第四维的梦想英伟达与华为,AI 算力的真正较量才刚刚开始?这不是简单的“减配”。对长上下文模型而言,降低 HBM 容量对生成阶段的影响,大于对预填充阶段的影响。换句话说,内存配置会反过来决定一颗 GPU 更适合跑什么任务、能卖给什么客户,以及系统要为此付出多少成本。笔者认为,这才是 HBM 紧缺最值得关注的地方。它不只是存储厂商的供需故事,而是在改变加速器的产品组合。GPU 仍然是 GPU,但不同内存版本的经济性和工作负载边界,可能已经不一样了。此外,大摩认为,英伟达此举也可能提高整体芯片出货量,并利好按出货量受益的供应链环节。
此前,瑞银在美光报告中也认为,英伟达降低 Rubin Ultra 的 HBM 规格,实际上将增加进入供应链的 VR300 单元数量,使 2027 年 HBM 总消耗量从 587 亿 Gb 提升至 615 亿 Gb。二、Google TPU:ASIC 扩张,同一套系统资源的竞争
如果只盯着英伟达,容易把本轮扩张误读成一家公司的出货故事,另一条线 ASIC 的叙事已经不容忽视。大摩预计,Google TPU 总出货量将从 2026 年约 370 万颗升至 2027 年约 735 万颗。按其供应链模型,2027 年 TPU v8i 对应约 33 万片 CoWoS 产能、396 万颗出货。TPU v8t 对应约 18 万片 CoWoS 产能、360 万颗出货。TPU 不等于 GPU 的简单替代品。两者承担的工作负载不同,但会共同争夺 CoWoS、HBM、测试能力和电力。ASIC 的份额提升,会进一步把需求从单一 GPU,扩展为多种加速器对同一套系统资源的竞争。大摩还提到,先进制程 AI ASIC 需要更长的老化测试与验证周期。以京元电子为例,摩根士丹利估计 TPU 相关业务可占其 2026 年收入约 7%—8%,2027 年略高于 10%。这足以说明 Google TPU 的影响已经从芯片设计,向封装与测试环节传导。三、Kyber 卡住的不是芯片,而是整柜工程
英伟达下一步的机柜形态,原本指向 Kyber 刀片式服务器。英伟达在 GTC 2025 首次披露该方案,但大摩称,PCB 与散热仍面临工程挑战,Kyber 的落地时间表尚未明确。因此,首代 Rubin Ultra 机柜可能仍使用 Oberon 的 NVL72 方案,同时通过 CPO 或 NPO 技术,支持更大规模的 NVL576 部署。芯片开始出货,并不自动等于机柜可以同步交付,具体还要看散热、供电、PCB 与互连能否同步到位。换句话说,AI 基建已经进入“系统工程决定交付”的阶段。讲到这里,大摩仍将 CPO 共封装光学视为英伟达在 scale-up性能上的关键差异化方向。四、同样做超节点,英伟达与中国 GPU 的互连选择并不相同大摩还提到,中国 AI GPU 厂商也在面向超过 2 万亿参数的大模型开发超节点架构,但跨机柜互连更多采用 NPO,而非 CPO。给出的原因是,本地 GPU 的 SerDes 速度可能因晶圆制造约束而维持在每 lane 100Gb/s 左右。互连路径不同,背后仍是同一个问题。当单颗 GPU 无法单独承载更大的模型与更高的带宽需求时,系统必须通过更大规模的节点协同来完成计算。与此同时,ASIC 也在进入同样的资源约束。大摩预计,Google TPU 2026 年出货约 370 万颗、2027 年超过 700 万颗。AI 芯片对 burn-in 与更长测试周期的需求上升,测试与可靠性不再只是后段环节,而会直接影响供给效率。五、真正的约束,是 HBM、CoWoS、晶圆与电力同时变紧大摩对 2026 至 2027 年的测算很直接,AI HBM 需求从约 299 亿 Gb 升至约 486 亿 Gb。全球 CoWoS 需求从约 139 万片晶圆升至约 269 万片。AI 晶圆收入 TAM 从约 286 亿美元升至约 588 亿美元。这些数字充分说明,下一轮 AI 基础设施扩张面对的并非单一供给缺口。电力同样如此。大摩估算,2027 年约 1900 万颗 CoWoS 隐含的加速器芯片,若按平均 2kW TDP 计算,对应约 38GW 的电力容量。六、芯片先行,机柜随后:不要把供应链缓冲误读成需求走弱大摩预计,2026 年 Blackwell 出货约 540 万颗,到下半年芯片供给将足以满足 Grace Blackwell NVL72 的需求。对于市场担心的 Blackwell“库存”,大摩的判断是这部分更像供应链缓冲库存,预计会在 2026 年被消化。Rubin 或将呈现相似节奏,芯片在 2026 年三季度开始爬坡,机柜在四季度开始出货。摩根士丹利进一步预计,2027 年 Rubin 与 Rubin Ultra 出货接近 700 万颗,Rubin NVL72 机柜出货或达约 9 万台。芯片与机柜不同步,并不自动等于需求出了问题。对于超节点系统,芯片、HBM、封装、板卡、散热与机柜本来就有不同的交付节奏。从 AI 芯片走向 AI 算力工厂,这条叙事正在越来越清晰。笔者在《AI 进入 ROI 定价时代:英伟达牵手华尔街,5000 亿美元开启算力资产化》里已明确讲到,未来定价 ROI,大概率就是看 AI 算力工厂,一切都在按部就班。笔者认为,当前市场仍处于科技板块大跌后的估值重构阶段,这一商业模式变化背后的长期价值尚未被充分定价。过去市场关注的是 AI 资本开支,现在关注的是投入之后能够产生多少回报。未来,当 AI 工厂成为可运营、可衡量的资产,ROI 也将从一个抽象指标,变成更加透明、直观的经营数据。
作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。