GLM5.3-Flash全面激活国产算力

2026-08-30 11:06:407

国联民生计算机】GLM5.3-Flash全面激活国产算力
1.本周观点1.1 国产大模型:从架构与系统层面对国产算力进行适配优化
架构层面,大模型推理中注意力计算是显存消耗与带宽压力的最大来源。在此背景下,稀疏注意力与低激活参数成为国产大模型优化的主要方向之一。观察部分头部模型厂的新一代架构,可以看到高度趋同的解法——用稀疏/线性注意力压缩注意力计算,同时大幅压低激活参数量:
智谱GLM-5.3-Flash总参数量320B(与GLM-4.5的355B基本相当),激活参数量由32B压缩至18B、层数由92层减至45层,采用线性注意力与稀疏注意力混合架构,稀疏注意力引入IndexPool索引器;DeepSeek-V4在token维度压缩上下文,结合DSA稀疏注意力,1M上下文成为全系服务标配。稀疏/线性注意力将注意力计算的显存与带宽需求大幅压缩,缓解显存消耗与带宽压力。
系统层面,智谱GLM-5.3-Flash公开服务全部由国产算力支撑,验证国产芯片的可行性边界。GLM-5.3-Flash公开服务在试用期间全部由国产算力支撑,依托国产芯片集群与自研高带宽互联网络,首次在大规模流量场景下承担前沿模型推理。最终效果是端到端服务性能较同一硬件基线提升3倍,硬件效率与单token成本达到与主流英伟达GPU相当的水平。另一个值得注意的细节:全部构建与优化工作由GLM-5.3驱动的infra agent协助完成(算子开发、瓶颈诊断、部署栈改进),模型能力开始反哺算力优化效率本身。商业化方面,GLM-5.3-Flash已全球开源,接入ZCode等编码平台,纳入GLM Coding Plan(每天限量发放10,000张体验卡)并开放API。
1.2 国产算力:适配沿多条路线快速成熟,头部公司业绩高增验证行业高景气
芯片自建软件栈:以龙头为例,积极适配国产生态。2026年8月26日,寒武纪在GLM-5.3-Flash发布当天完成适配。寒武纪Neuware软件栈原生支持PyTorch、vLLM等主流AI框架,MLA、MHC、MoE、MTP等适配基础设施开箱即用,并利用Triton的社区兼容性快速完成算子开发。
针对模型线性注意力与稀疏注意力混合架构,寒武纪对IndexPool索引器完成Token粒度到Pool粒度的地址换算、在Decode阶段对全历史Gather分块控制峰值;线性注意力以循环状态替代传统KV Cache,寒武纪在Decode路径采用批量张量化、Prefill路径采用递推结构分块并行,并自研MLU Triton内核完成核心计算,线性注意力性能获得量级提升。
向商业化进发,海光信息加速国产生态布局。海光信息在2026数博会首发“Agent to Token开放计算架构”:依托CPU与DCU双芯协同与开放互连,贯通Agent任务执行与词元生产的完整计算周期。CPU承担任务编排、实时决策及通用计算,DCU专注AI计算与词元生产加速。该架构在算力、互连、安全、软件栈四个维度开放对接,支持异构算力灵活组合、多协议互连协同、全链路安全防护及全栈软件适配。生态方面,以海光为核心的光合组织已汇聚六千余家生态伙伴,覆盖数据处理、算力供给、模型运行与智能应用全链条,为词元经济规模化落地提供体系化支撑。
开源跨芯片公共底座:FlagOS已形成“核心库—插件—领域项目—工具与服务”多层开源组件体系。国产芯片种类较多,过去每款模型需在每款芯片上重复适配。FlagOS 是一个完全开源的异构 AI 芯片系统软件栈,允许 AI 模型一次开发即可无缝移植到广泛的 AI 硬件平台,实现最小化的适配成本。
1)核心库是底座:FlagGems通用算子库及多个细分算子库提供计算支撑,FlagTree统一编译器让同一套算子代码运行在多家国产芯片上,FlagScale覆盖模型训练到部署全流程,FlagCX解决跨芯片通信。
2)插件层负责“连接”:把vLLM、SGLang等主流推理框架,以及Megatron-LM等训练、强化学习框架接入FlagOS,兼顾推理与训练全流程。
3)领域项目向具身智能和量子模拟延伸。
4)工具与服务层面,KernelGen可用自然语言自动生成算子,FlagOS Skills兼容Claude Code等主流Agent,FlagRelease自动完成模型跨芯片迁移与发布,FlagPerf负责硬件性能评测,FlagCICD打通跨芯片持续集成。
模型厂商垂直整合:智谱收购中科加禾,进一步加强国产大模型与国产算力的适配优化能力。智谱收购AI异构算力软件公司中科加禾。中科加禾技术源头为中科院计算所编译实验室,对上为AI模型提供统一标准接口,对下适配华为昇腾、寒武纪、海光等主流国产芯片,产品包括SigInfer推理引擎、SigFT微调引擎与SigTrans算子生成工具。中科加禾依托编译技术打造通用化、低成本、高性能的基础软件工具链,为用户提供AI应用跨多种CPU、GPU、NPU执行的统一软件平台。
2026年上半年,国产算力芯片龙头寒武纪海光信息均实现收入与利润的高速增长,反映出人工智能算力需求持续高景气下国产芯片的放量趋势。寒武纪实现营业收入59.96亿元,同比增长108.13%;归母净利润23.11亿元,同比增长122.61%;扣非归母净利润21.66亿元,同比增长137.30%,扣非利润增速快于收入增速,规模效应与经营杠杆持续显现。海光信息同期实现营业收入90.99亿元,同比增长66.52%;归母净利润17.98亿元,同比增长49.69%;扣非归母净利润16.31亿元,同比增长49.67%。
AI 服务器龙头浪潮信息上半年业绩大幅改善,2026Q2迎来重要拐点。公司发布 2026 年半年度报告,上半年实现归母净利润29.52亿元,同比增长269.59%;扣非归母净利润24.19亿元,同比增长260.08%。
通过梳理国产AI芯片、服务器等环节的领军企业,可以发现国产算力目前景气度正处于持续快速提升阶段,主要公司业绩均呈现大幅增长态势。 
国内头部互联网厂商持续加大AI基础设施投入,资本开支同比大幅增长,为上游算力硬件需求提供坚实支撑。腾讯2026年上半年资本开支达847.20亿元,同比增长82%,其中二季度单季资本开支527.84亿元,主要投向数据中心、服务器等AI基础设施。阿里巴巴2027财年第一季度资本开支达676.78亿元,同比增长75%,主要用于AI算力采购、CPU算力扩容及芯片组件投入。两家大厂单季资本开支均处历史高位,反映出云厂商及互联网巨头在AI算力扩容上的持续加码,算力硬件需求高景气度有望延续。
1.3 投资建议
算力网建设在"十五五"万亿级别直接投资的政策驱动下进入加速落地期,叠加国产算力公司业绩高增与大厂资本开支持续加码,国产算力景气度有望延续。同时,发展自主大模型与自主算力的紧迫性与战略意义持续凸显,国模加国芯的模算协同、全国产大模型迎来重大战略机遇。
建议关注:
1)国产大模型:智谱、MiniMax等;
2)国产算力:寒武纪海光信息云天励飞等。
3)超节点及算力网等算力服务提供商:浪潮信息软通动力紫光股份中国长城、联想集团、神州数码思特奇等。
4)算力租赁方向的宏景科技集智股份(ARM Token工厂)、协创数据利通电子、行云科技、智微智能、阿里巴巴、优刻得、金山云等标的

作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。

合规声明:本站发布的所有文章及观点均系个人研究共享,投资心得交流,不代表本站立场,且不构成任何形式的投资建议。投资者据此操作,风险自担,请务必保持独立审慎的决策态度。