近算力圈一条消息,在数码和科技圈内悄悄传开:华为正在推进下一代智算数据中心的整体设计工作。很多普通网友可能觉得,数据中心不过就是一堆服务器堆在一起,看不出多大变化。但对于整个AI行业而言,新一代智算底座的规划落地,很有可能会重新改写接下来数年国内算力产业的发展格局 。

我们先把视角拉回到当下整个行业的现状。现在AI技术发展速度越来越快,大模型参数从百亿级别,快速向着万亿级别迈进,智能体Agent相关应用也在加速落地,市场对于算力的需求呈现爆发式增长。可热闹背后,行业的痛点同样非常突出。
目前国内不少已经建成的智算中心,普遍面临一个尴尬的问题:硬件规模看着很大,实际有效算力利用率并不高。有行业统计数据显示,部分智算基地整体算力平均利用率仅三成左右,一边是大量硬件资源闲置,另一边很多中小企业却拿不到性价比合适的推理算力,供需出现明显错配 。
深究原因,传统数据中心大多采用服务器堆叠的思路建设。简单把AI服务器一台台放进机柜,依靠普通网络互相连接。一旦集群规模达到万卡级别,节点之间数据传输的延迟、带宽瓶颈就会快速显现。大量算力消耗在数据搬运上,真正用来训练、推理的有效性能被严重稀释。除此之外,高密度算力带来巨大散热压力,电费、运维成本居高不下,也成为摆在很多算力运营方面前的一道难题。
正是看到当前这套架构的短板,华为下一代智算数据中心,并没有走“单纯堆硬件、扩机柜”的老路,而是从底层架构开始重新规划整套方案。从目前华为已经对外释放的技术路线不难看出,这套全新智算中心,核心围绕三大方向做突破:算力架构重构、高效散热方案、全栈资源池化 。
第一点,算力架构的革新。过去的集群,每一台服务器都是相对独立的个体。而新一代方案,会继续深化超节点SuperPoD思路,把大量NPU、CPU、内存、存储、网络深度整合,把一整个集群,虚拟成一台巨型超级计算机。依靠自研高速互联总线,大幅降低节点之间通信延迟,提升整体互联带宽,解决大规模集群下数据传输卡顿、算力空转的老问题。这样一来,当运行万亿参数大模型、大规模智能体任务的时候,整体训练收敛速度、推理响应速度都会得到明显提升,算力有效利用率也会随之上涨。
第二,散热与能效的全面升级。高密度AI集群,最大的运营成本就是电力,其中散热耗电占了不小比重。所以新一代智算中心,液冷技术大概率会成为主流方案。相比于传统风冷,液冷可以更好应对单机柜超高算力密度,有效降低整机PUE,减少散热能耗。同时结合电网互动式供电策略,优化从电网到芯片整条供电链路,实现每一度电产出更多Token,也就是行业常说的“每瓦算力最大化”,从根源上降低后期运营成本,向着绿色低碳算力中心的方向发展 。
第三,训推一体、资源池化。现在一个很明显的行业趋势:早期智算中心偏向大模型训练,而如今市场上绝大多数商业需求,集中在推理场景。训练和推理对硬件、算力调度的需求并不相同,很多旧机房硬件只能适配单一场景,很难灵活切换。而华为这套全新设计,主打算力资源解耦池化,计算、内存、存储资源可以动态调配,既能承接超大模型长时间训练任务,也能灵活拆分出大量推理算力供给中小企业使用,缓解现在行业“算力闲置、需求难满足”的矛盾,让整个数据中心的业务适配性更强 。
很多人会问,华为已经有Atlas系列服务器、CloudMatrix超节点、OceanStor存储等成熟产品,为什么还要从头设计一整套全新智算数据中心?
这里要分清一个概念:服务器、超节点,属于硬件单元;而智算数据中心,是一整套完整的算力底座。就像我们组装一台高性能电脑,好的CPU、显卡只是零件,机箱、供电、散热、布线、系统调度,共同决定整机能不能长期稳定高性能运行。单独硬件性能再强,如果整体机房架构跟不上,硬件实力也很难完全释放。
所以这次的全新设计,本质上是把服务器、互联网络、分布式存储、供电散热、算力调度软件全部打通,做一套深度协同的整体方案,而不是各类硬件简单拼接。软硬件深度协同,也是国产算力赛道非常关键的一条路线。放眼全球算力竞争,比拼早就不再是单张AI芯片的跑分,而是整套集群长期稳定运行、高效输出有效算力的综合能力 。
当然,目前这套下一代智算数据中心还处在设计阶段,最终落地版本,还会根据后续产业需求、技术迭代持续优化。正式建成之后,一方面能够给国内大模型企业、AI研发机构提供更高性能、更高能效的国产化算力底座;另一方面,整套成熟方案,也可以对外输出,给各地正在规划建设的智算基地提供一条全新的建设思路。
站在普通消费者的角度,我们平时刷AI对话工具、AI绘图、各类智能应用,背后都依赖算力中心持续输出算力。底层算力底座不断迭代升级,最终会慢慢传导到每一款面向大众的AI产品,让AI响应更快、使用成本逐步下降。算力基础设施,看似离普通人很远,实际上却是未来智能化生活的基石。
纵观最近几年华为在算力领域的布局,从昇腾芯片、Atlas服务器,到超节点集群,再到如今下一代智算中心整体方案的规划,可以清晰看出一条完整的技术路线:从单芯片,到单机柜,再到整座算力园区,一步步向上,搭建完整自主可控的算力基础设施生态。
不过也要客观看待,全新架构从图纸落地到正式运行,中间还要经过大量测试、调优、验证。一套大型智算中心,设计、建设、调试周期漫长,能否真正解决当前行业算力利用率偏低、运营成本高昂等痛点,还要等后续实物落地,接受市场的实际检验。
AI时代的竞争,表面看是大模型、各类AI应用百花齐放,底层拼的,其实就是算力底座的实力。谁能拿出效率更高、成本更低、稳定性更强的智算基础设施,谁就能在接下来的智能化浪潮里占据先机。华为这次启动下一代智算数据中心设计,无疑也是在这条主赛道上,落下重要的一步棋。
那么问题来了,在你看来,下一代智算中心,最需要优先解决的问题,是算力规模,还是运营能效?欢迎在评论区留下你的观点,一起聊聊国产算力未来的发展走向。
华为液冷:
1、英维克(002837)【华为一级核心供应商】国内AI液冷温控绝对龙头,十几年华为一级供应商,深度适配华为昇腾超节点机柜散热需求,冷板式/浸没式液冷全覆盖,批量供货华为智算中心,可大幅降低PUE、解决高密度算力散热能耗问题,是华为算力液冷最核心、最确定性标的。2、申菱环境(301018)【华为全栈液冷合作伙伴】深耕华为合作15年,华为数据中心温控核心供应商,拥有适配华为算力集群的“冷源+末端液冷机柜”全栈解决方案,联合华为落地零碳智算园区、高密度AI机房液冷项目,在手算力液冷订单充沛,适配新一代超节点能效升级需求。3、高澜股份(300499)【华为算力液冷方案落地商】与华为在数据中心液冷领域深度协同,产品适配华为昇腾服务器、超节点集群散热场景,参与多个华为合作智算中心液冷项目落地,技术成熟、项目经验丰富,充分受益华为液冷替代风冷的规模化升级趋势。4、强瑞技术(301128)【华为液冷检测独家配套】合作华为超18年,华为服务器液冷检测设备独家供应商,覆盖华为AI服务器、液冷整机检测全流程,深度绑定华为算力硬件迭代,是稀缺的华为液冷细分垄断标的。作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。