推理决定市场总容量、出货量,中科曙光即将发布推理新一代词元加速方案,国产算力狂飙

2026-08-27 12:37:3010
国产算力的推理从可用到好用和商用,上量时刻来临,而且不仅仅是刚披露的成绩不错,作为Al、教育、具身智能和自动驾驶四个细分行业排名第一的中科曙光还要继续再添一把火,发布能力更强的推理加速方案,国产算力狂飙时刻即将来临:




智谱GLM-5.3-Flash由国产芯片集群承载昨晚(8月26日),智谱发布GLM-5.3-Flash,并披露其前期大规模匿名测试流量完全由国产芯片集群承载,通过软硬件协同优化,实现了与主流英伟达GPU相当的硬件效率和单token成本。这标志着国产AI算力从“可用”的适配阶段,首次跃迁至能够大规模、经济地支撑前沿模型真实生产流量的“规模化商用”阶段,为国产算力产业链打开了需求天花板

这是一个非常时刻,很多人目前还没意识到这一点,后续注定将持续点燃市场,现在AI从训练时代到推理时代,市场交易算力行情时,训练侧决定芯片壁垒、单卡价值量;推理侧决定市场总容量、出货量,这个披露意味着国产算力要大规模上量,且好用和可商用了,属于国产算力的关键时刻, 见证国产算力的狂飙时刻来临。我把他命名为国产算力的推理上量时刻。





结论​​看点:中科曙光即将发布“面向大模型推理的词元加速方案”,把“存储侧”引入推理主链路,直指两大痛点——重复计算与数据调度。​​若该方案在真实场景显著降低首词延迟、抬升GPU利用率、压低单位Token成本,将成为超节点/超集群的系统级差异化能力,增强“算-存-网-管”一体化的商业化兑现度。​​凭证:ParaStor已在全国产十万卡超集群“曙光8000(登峰)”中工程化应用,IO500生产型双榜第一验证其高并发吞吐与元数据能力;集中式全闪在相关测试中将GPU利用率由30%-40%提升至70%-80%,为“以存代算、以存促算”提供现实参照。​

中科曙光 AI 超集群系统

1. 事件要点:存储侧切入“词元流水线”,为何重要?​​消息本体​​:公司将在数博会期间发布“新一代词元加速存储方案”,聚焦解决推理过程中的​​重复计算​​与​​数据调度​​,旨在提升词元处理效率与算力利用率;当前ParaStor已服务国内首个全国产十万卡AI超集群“曙光8000(登峰)”,提供数据吞吐与弹性扩展支撑。​​系统视角​​:在“十万卡”规模下,瓶颈往往先由数据供给侧暴露;长上下文推理中,注意力对历史序列的回看导致​​KV重复计算​​与跨域调度开销。把中间结果“就近放好、随用随取”,可减少GPU“无用功”。此次方案将存储从“数据承接”推进到“词元生成与流转”的协同执行环节。​​需求侧逻辑​​:推理增速快于训练,MoE与长上下文放大显存、带宽与跨卡通信需求,存储系统必须从“高吞吐供给”升级到“推理阶段的数据调度与复用”。产业节奏与技术焦点正从“单卡峰值”转向“系统效能与单位Token成本”。2. 现有工程凭证与可比能力​​大规模工程适配​​:曙光8000上线首周即满载运行,日均作业15万+、峰值50万+,覆盖大模型训练、高通量推理与科学计算;ParaStor为其提供高吞吐与弹性扩展的数据底座。​​IO500双料第一​​:ParaStor F9000在IO500生产型总榜与10节点挑战榜“双冠”,长稳运行超一年,面向真实高并发与元数据压力的生产环境记录,显示其为千卡至十万卡集群的高效数据供给能力。​​“以存促算”的量化参照​​:集中式全闪存储在相关测试中将​​GPU利用率由30%-40%提升至70%-80%​​,万亿参数模型Checkpoint时间从分钟缩至秒,存储读写性能直接决定集群有效算力兑现度。​​既有推理优化组件​​:ParaStor已披露​​KV Cache Offload​​与​​XDS直通​​能力,面向长上下文与高并发推理降低显存压力与数据加载延迟;在DeepSeek-R1-70B与120K场景中,曾实现​​TTFT降低97.3%​​的量级改善,指向“存储参与推理流水线”的潜在边界。后续方案若面向更广模型/引擎复用,将强化系统级优势。2

中科曙光高端全闪存存储 FlashNexus 9000



3. 为什么是现在:推理成为新拐点,系统级协同是主线​​推理侧放量​​:预测显示未来3年推理算力年复合增速将达训练的近4倍,到2028年推理算力规模将超过训练;MoE稀疏激活、长上下文、工具调用与智能体工作流的普及,将推升对​​高带宽存储​​、​​分布式调度​​与​​超节点​​的系统需求。​​供给侧迭代​​:公司在超节点领域双线推进——旗舰scaleX640(单柜640卡、20倍密度)、箱式scaleX40(40卡FP8超28PFLOPS、HBM>5TB、访存>80TB/s)面向不同规模训推场景,配套存储/网络/液冷的“算-存-网-管”协同,提供系统化抓手承接推理优化。​​资本投入与复制​​:80亿元募投聚焦先进算力集群、训推一体机、国产化先进存储,规划将Scale-Up域由640卡推进至1024卡,网络端口升级至800G/1600G;曙光8000落地后,第二套全国产十万卡系统已启动,方案一旦在标杆系统可复制,商业化弹性放大。4. 这次发布,市场应盯哪些硬指标?​​系统级KPI而非单点数值​​:GPU利用率、首词延迟(TTFT)、Token吞吐、单位Token成本的对照实验数据(有/无方案对比)。KV Cache管理与分级复用的策略细节:与主流引擎(如Prefill-Decode分离、动态调度)的适配说明与客户侧落地案例。在“曙光8000/第二套十万卡系统”的规模化部署路径与时间表,是否具备跨行业、跨模型的标准化能力输出。



5. 一图读懂:维度核心要点关键证据为什么重要事件发布“词元加速存储方案”,聚焦重复计算与数据调度数博会期间发布消息,多源媒体确认让存储参与词元生成/流转,减少GPU无效重算,系统级降本增效工程凭证ParaStor服务十万卡“曙光8000”;IO500双料第一上线首周满载;双榜全球第一证明在超大规模场景的数据供给与元数据能力,适配真实高并发负载参照效果全闪存储将GPU利用率抬升至70%-80%多研报一致披露存储对有效算力兑现的直接影响,提供可验证参照已有组件KV Offload、XDS直通、TTFT降幅显著官方/合作方披露案例为新方案“词元加速”提供技术延续与验证基础6. 这是一场“系统级”的加速赛​​核心判断​​:此次“词元加速”不是某个存储产品的功能补丁,而是​​围绕推理流水线的系统工程​​,与超节点/超集群、分布式存储、高速互联、液冷与调度平台的“紧耦合”共同指向一个目标:​​把新增GPU尽可能转化为有效Token产出​​。​​下一步​​:盯指标、看适配、抓复制。若能在“曙光8000”与“第二套十万卡系统”上标准化复制,并与训推一体机、国产化先进存储的募投节奏同频,​​事件将转化为估值与基本面的双重支撑​​。

中科曙光推出“曙光 8000”十万卡超智融合计算集群

7、延伸理解:

这个是推理能力提升吗?

是的,这是面向“推理侧”的系统级能力提升,但它与“智谱在大规模真实流量中完全用国产芯片承接推理”的范式并不相同,两者处于不同技术层:前者是基础设施层(存储/IO/调度)对推理链路的加速,后者是服务层用国产加速器承载并优化整套推理生产流量。​​换言之,​​曙光词元加速方案旨在减少重复计算、优化数据调度以提升吞吐、降低延迟与单位Token成本​​;而​​智谱披露的是在10万张国产芯片集群下,通过EPD(Encode–Prefill–Decode)解耦与专用推理引擎实现3倍端到端性能提升、单位Token成本接近主流英伟达GPU,并创造创纪录流量​​。二

scaleX640 以 640卡高密整柜实现开放架构下的单柜超节点产品化


1. 曙光“词元加速”聚焦什么,是否指向推理能力?​​聚焦目标与路径​​:相关人士称,公司将发布面向大模型推理的新一代“词元加速方案”,重点处理推理过程中的​​重复计算​​与​​数据调度​​问题;思路是在存储侧就近保存中间结果、按需复用,减少GPU“无效重算”,降低跨域调度开销,从系统层面提升推理效率。​​工程抓手与既有佐证​​:ParaStor分布式存储已应用于全国产十万卡AI超集群“曙光8000(登峰)”,表明其在大规模吞吐与弹性扩展上的工程化能力;公司在半年度报告中亦强调ParaStor F9000在IO500生产型与10节点组别同时第一,FlashNexus 9000集中式全闪可达​​2亿IOPS、0.09ms​​时延,均属于支撑推理侧高并发/低时延的数据底座能力。“存算传紧耦合/超级隧道”带来的量化改善:2U24 NVMe节点带宽由40GB/s提升至​​220GB/s(+5.5倍)​​;典型推理业务访问​​延时下降76%​​;单客户带宽提升4倍以上,直接指向推理链路IO段的瓶颈缓解与首词延迟(TTFT)改善潜力。​​结论要点​​:上述能力均指向​​推理侧系统效能提升​​(吞吐、延迟、成本),是“让新增GPU更快产出Token”的系统工程路径,但当前“词元加速方案”尚属将要发布的方案,​​尚未披露权威对照实测(如GPU利用率、TTFT、TPS、单位Token成本)​​,因此不可直接等同为“与智谱相同层级的推理能力验证”。2. 智谱披露的“全部用国产芯片承接创纪录流量”属于哪种能力证明?​​能力外显​​:GLM-5.3-Flash(原生多模态、320B总参/18B激活MoE)在匿名测试期于OpenRouter与OpenCode登顶,​​调用量达62T​​;披露称其此前全部线上真实流量由​​大规模国产芯片集群(约10万张)​​承接。​​系统优化路径​​:基于SGLang构建专用推理引擎,采用EPD(Encode–Prefill–Decode)解耦、Layer Split、混合缓存量化等优化;​​在同一硬件上的初始基线对比,端到端性能提升约3倍​​,​​单Token成本接近主流英伟达GPU​​,显示国产加速器在大规模真实生产流量下的推理经济性被初步验证。​​结论要点​​:这是​​服务/应用侧​​的“规模化商用与经济性”验证路径,强调“​​国产加速器承接真实海量流量​​且成本可比”的事实证据,与曙光的“基础设施侧(存储/互联/IO/调度)的系统加速”属于不同层级,但可在实际工程项目中叠加受益。


本质上,曙光“词元加速”=推理侧的系统工程加速;智谱“全国产芯片承接创纪录流量”=推理侧的规模化商用与成本验证​​。两者聚焦层级不同、证据形态不同,但目标一致:​​把新增算力更高效地转化为有效Token产出​​。在未来的十万卡级国产集群中,这两条路径将相互强化。



作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。

合规声明:本站发布的所有文章及观点均系个人研究共享,投资心得交流,不代表本站立场,且不构成任何形式的投资建议。投资者据此操作,风险自担,请务必保持独立审慎的决策态度。