梁文锋最新署名论文 DSpark!有那些新的观点?

2026-06-27 23:40:2323
一、最新论文基本信息(2026 年 6 月 27 日,梁文锋署名) 论文名称:DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation(DSpark:基于半自回归生成的置信度调度推测解码),DeepSeek 联合北京大学共同完成。
论文首页 二、核心内容 1. 解决的行业痛点 传统推测解码存在两大缺陷: •
批量并行预生成大量 Token 后,大量草稿会被主模型校验驳回,产生巨额无效算力浪费;

高并发在线服务下,提速必然伴随整体吞吐暴跌,无法兼顾时延与吞吐量。

2. 核心技术创新 1)置信度动态调度机制不再无脑批量预生成草稿,轻量草稿模型实时输出置信度;系统只对高置信片段做多 Token 并行生成,低置信片段切换为串行生成,大幅减少被校验丢弃的无效内容。 2)半自回归(Semi-Autoregressive)混合架构并行主干网络 + 轻量级串行校验模块并行运行,解决纯并行方案在句子末尾通过率断崖式下跌的通病。 3)配套开源训练框架 DeepSpec专门用来训练 DSpark 草稿模型,统一兼容 DSpark、DFlash、Eagle3 多种推测解码算法。 3. 实测效果(部署在 DeepSeek-V4 线上生产环境) •
在保持整体吞吐量不变的前提下,用户单次对话生成速度提升60%~85%;

在严格交互时延约束下,不会出现吞吐大幅下滑,突破了在线推理的帕累托效率边界;

极大降低大模型在线服务的 GPU 算力成本。

数学推理 / 代码 / 闲聊三类离线 benchmark 上,单轮平均可接受词元长度显著超过 Eagle3、DFlash •
迁移到 Qwen3-4B/8B/14B 上,对比自回归草稿平均 ↑26.7%–30.9%,对比并行草稿 ↑16.3%–18.4%

关键附加值:在严格交互时延约束下避免了吞吐滑坡,把服务系统的 Pareto 前沿往外推了一档


三、上一篇梁文锋署名重磅论文(2026 年 1 月) 论文:《Conditional Memory via Scalable Lookup》核心:提出Engram 条件记忆模块,开辟 MoE 之外全新稀疏化维度;把静态知识存储与动态计算拆开,用哈希 N-Gram 实现 O (1) 极速知识查表,补齐 Transformer 原生检索短板,长文本、代码、数学推理能力全面超越同规模纯 MoE 模型。 一句话定位:DeepSeek 这波没卷"模型多聪明",卷的是"模型多快能交卷"——推理侧 Infra 的帕累托优化,对降低在线成本、撑高并发比再堆几个 benchmark 点更直接影响商业化。

作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。

合规声明:本站发布的所有文章及观点均系个人研究共享,投资心得交流,不代表本站立场,且不构成任何形式的投资建议。投资者据此操作,风险自担,请务必保持独立审慎的决策态度。