这是一个非常时刻,很多人目前还没意识到这一点,后续注定将持续点燃市场,现在AI从训练时代到推理时代,市场交易算力行情时,训练侧决定芯片壁垒、单卡价值量;推理侧决定市场总容量、出货量,这个披露意味着国产算力要大规模上量,且好用和可商用了,属于国产算力的关键时刻, 见证国产算力的狂飙时刻来临。我把他命名为国产算力的推理上量时刻。


1. 事件要点:存储侧切入“词元流水线”,为何重要?消息本体:公司将在数博会期间发布“新一代词元加速存储方案”,聚焦解决推理过程中的重复计算与数据调度,旨在提升词元处理效率与算力利用率;当前ParaStor已服务国内首个全国产十万卡AI超集群“曙光8000(登峰)”,提供数据吞吐与弹性扩展支撑。系统视角:在“十万卡”规模下,瓶颈往往先由数据供给侧暴露;长上下文推理中,注意力对历史序列的回看导致KV重复计算与跨域调度开销。把中间结果“就近放好、随用随取”,可减少GPU“无用功”。此次方案将存储从“数据承接”推进到“词元生成与流转”的协同执行环节。需求侧逻辑:推理增速快于训练,MoE与长上下文放大显存、带宽与跨卡通信需求,存储系统必须从“高吞吐供给”升级到“推理阶段的数据调度与复用”。产业节奏与技术焦点正从“单卡峰值”转向“系统效能与单位Token成本”。2. 现有工程凭证与可比能力大规模工程适配:曙光8000上线首周即满载运行,日均作业15万+、峰值50万+,覆盖大模型训练、高通量推理与科学计算;ParaStor为其提供高吞吐与弹性扩展的数据底座。IO500双料第一:ParaStor F9000在IO500生产型总榜与10节点挑战榜“双冠”,长稳运行超一年,面向真实高并发与元数据压力的生产环境记录,显示其为千卡至十万卡集群的高效数据供给能力。“以存促算”的量化参照:集中式全闪存储在相关测试中将GPU利用率由30%-40%提升至70%-80%,万亿参数模型Checkpoint时间从分钟缩至秒,存储读写性能直接决定集群有效算力兑现度。既有推理优化组件:ParaStor已披露KV Cache Offload与XDS直通能力,面向长上下文与高并发推理降低显存压力与数据加载延迟;在DeepSeek-R1-70B与120K场景中,曾实现TTFT降低97.3%的量级改善,指向“存储参与推理流水线”的潜在边界。后续方案若面向更广模型/引擎复用,将强化系统级优势。2中科曙光高端全闪存存储 FlashNexus 9000

3. 为什么是现在:推理成为新拐点,系统级协同是主线推理侧放量:预测显示未来3年推理算力年复合增速将达训练的近4倍,到2028年推理算力规模将超过训练;MoE稀疏激活、长上下文、工具调用与智能体工作流的普及,将推升对高带宽存储、分布式调度与超节点的系统需求。供给侧迭代:公司在超节点领域双线推进——旗舰scaleX640(单柜640卡、20倍密度)、箱式scaleX40(40卡FP8超28PFLOPS、HBM>5TB、访存>80TB/s)面向不同规模训推场景,配套存储/网络/液冷的“算-存-网-管”协同,提供系统化抓手承接推理优化。资本投入与复制:80亿元募投聚焦先进算力集群、训推一体机、国产化先进存储,规划将Scale-Up域由640卡推进至1024卡,网络端口升级至800G/1600G;曙光8000落地后,第二套全国产十万卡系统已启动,方案一旦在标杆系统可复制,商业化弹性放大。4. 这次发布,市场应盯哪些硬指标?系统级KPI而非单点数值:GPU利用率、首词延迟(TTFT)、Token吞吐、单位Token成本的对照实验数据(有/无方案对比)。KV Cache管理与分级复用的策略细节:与主流引擎(如Prefill-Decode分离、动态调度)的适配说明与客户侧落地案例。在“曙光8000/第二套十万卡系统”的规模化部署路径与时间表,是否具备跨行业、跨模型的标准化能力输出。

7、延伸理解:
这个是推理能力提升吗?
是的,这是面向“推理侧”的系统级能力提升,但它与“智谱在大规模真实流量中完全用国产芯片承接推理”的范式并不相同,两者处于不同技术层:前者是基础设施层(存储/IO/调度)对推理链路的加速,后者是服务层用国产加速器承载并优化整套推理生产流量。换言之,曙光词元加速方案旨在减少重复计算、优化数据调度以提升吞吐、降低延迟与单位Token成本;而智谱披露的是在10万张国产芯片集群下,通过EPD(Encode–Prefill–Decode)解耦与专用推理引擎实现3倍端到端性能提升、单位Token成本接近主流英伟达GPU,并创造创纪录流量。二scaleX640 以 640卡高密整柜实现开放架构下的单柜超节点产品化
本质上,曙光“词元加速”=推理侧的系统工程加速;智谱“全国产芯片承接创纪录流量”=推理侧的规模化商用与成本验证。两者聚焦层级不同、证据形态不同,但目标一致:把新增算力更高效地转化为有效Token产出。在未来的十万卡级国产集群中,这两条路径将相互强化。
作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。