论文首页 二、核心内容 1. 解决的行业痛点 传统推测解码存在两大缺陷: •
批量并行预生成大量 Token 后,大量草稿会被主模型校验驳回,产生巨额无效算力浪费;
•
高并发在线服务下,提速必然伴随整体吞吐暴跌,无法兼顾时延与吞吐量。
2. 核心技术创新 1)置信度动态调度机制不再无脑批量预生成草稿,轻量草稿模型实时输出置信度;系统只对高置信片段做多 Token 并行生成,低置信片段切换为串行生成,大幅减少被校验丢弃的无效内容。 2)半自回归(Semi-Autoregressive)混合架构并行主干网络 + 轻量级串行校验模块并行运行,解决纯并行方案在句子末尾通过率断崖式下跌的通病。 3)配套开源训练框架 DeepSpec专门用来训练 DSpark 草稿模型,统一兼容 DSpark、DFlash、Eagle3 多种推测解码算法。 3. 实测效果(部署在 DeepSeek-V4 线上生产环境) •
在保持整体吞吐量不变的前提下,用户单次对话生成速度提升60%~85%;
•
在严格交互时延约束下,不会出现吞吐大幅下滑,突破了在线推理的帕累托效率边界;
•
极大降低大模型在线服务的 GPU 算力成本。
数学推理 / 代码 / 闲聊三类离线 benchmark 上,单轮平均可接受词元长度显著超过 Eagle3、DFlash •
迁移到 Qwen3-4B/8B/14B 上,对比自回归草稿平均 ↑26.7%–30.9%,对比并行草稿 ↑16.3%–18.4%
•
关键附加值:在严格交互时延约束下避免了吞吐滑坡,把服务系统的 Pareto 前沿往外推了一档
•
三、上一篇梁文锋署名重磅论文(2026 年 1 月) 论文:《Conditional Memory via Scalable Lookup》核心:提出Engram 条件记忆模块,开辟 MoE 之外全新稀疏化维度;把静态知识存储与动态计算拆开,用哈希 N-Gram 实现 O (1) 极速知识查表,补齐 Transformer 原生检索短板,长文本、代码、数学推理能力全面超越同规模纯 MoE 模型。 一句话定位:DeepSeek 这波没卷"模型多聪明",卷的是"模型多快能交卷"——推理侧 Infra 的帕累托优化,对降低在线成本、撑高并发比再堆几个 benchmark 点更直接影响商业化。
作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。