#DSpark
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 技术基础设施2026-08-22 · 周六重要度 4/5深度报告 →
SGLang两篇技术帖压低推理停机和延迟
LMSYS 8月21日发布两篇SGLang技术文,分别介绍Weight Cache Daemon和Ling-3.0-flash推理优化。
- 两个更新解决的是同一条生产推理链上的不同成本:重启时的权重加载和batch-1解码时的关键路径。
- 它把优化重点从单次benchmark峰值转向可恢复、可复现的服务指标。
- 模型发布2026-08-21 · 周五重要度 3/5
Liquid发布LFM2.5-DSpark推理稿
Liquid AI在HF 8月20日发布DSpark博客和模型页,称LFM2.5系列推理速度最高提升3.18倍。
- 这条与前一日QAD量化不同,增量落在草稿模型和speculative decoding链路。
- 它说明小模型的竞争正在转向真实推理吞吐,而不是只发布权重。
- 研究论文2026-07-01 · 周三重要度 3/5
SGLang DSpark 预测解码实测数据放出:多场景预测 3 token,1K prompt 加速比 1.81x,8 卡 B200 速度 164→297 token/s
SGLang 的 DSpark 预测解码实测数据在 PR29538 放出:多场景基本能预测 3 个 token(数学 3.37 / 对话 3.0 / 代码 3.52)。1K prompt 下加速比 1.81x,8 卡 B200 速度从 164 token/s 拉到 297 token/s。TPOT 仅 2.9-5.2ms,DSpark 神经网络层延迟可忽略。超过 8 并发收益降至 1.2-1.3x(GPU 已打满)。注:PR29538 尚未合并。这是继 DeepSeek 开源 DeepSpec(含 DSpark/DFlash/Eagle3 三种草稿模型)之后,DSpark 在 SGLang 推理引擎上的第一次完整数据披露。
- DSpark 在 SGLang 上的实测数据揭示了『投机解码』的工程边界:
- 1.81x 加速比与 3 token 预测长度,比 DeepSeek 自报的 60-85% 提速口径更保守——说明 DeepSeek 自报口径与第三方实测之间存在显著差异,这正是 6-28 DSpark 深度页里就指出的 caveat。
- 研究论文2026-06-28 · 周日重要度 4/5深度报告 →
DeepSeek 联合北大发布投机解码框架 DSpark,开源全栈代码库 DeepSpec
据 X 用户 @0xLogicrw / @danielhanchen 转述(以官方技术报告为准),DeepSeek 联合北京大学发布投机采样加速框架 DSpark 技术报告,并开源全栈代码库 DeepSpec,DSpark 已部署于 DeepSeek-V4 线上业务。在输出无损前提下,转述称 Flash 版单用户生成速度提升 60%-85%、Pro 版提升 57%-78%,超过原 MTP-1 基线;另一口径(@danielhanchen)称吞吐提升 51% 到 400%——两套数字差异很大,需以官方报告与开源代码实测为准。技术上先用 DFlash 并行主干生成隐藏状态,再追加轻量马尔可夫头(查表+一次矩阵乘)串行注入相邻词关联,配合置信度预测头与异步零开销调度避免高并发下吞吐崩塌。可独立证实的部分:deepseek-ai/DeepSpec 仓库确已开源(MIT,约 1.8k stars),自述为『训练与评估投机解码算法的全栈代码库』,README 列出 DSpark / DFlash / Eagle3 三种 draft model,目标模型支持 Qwen3(4B/8B/14B)与 Gemma,并提供从下载提示词到基准评估的完整 Python 工具链。
- 研究论文2026-06-27 · 周六深度报告 →
DeepSeek 开源 DSpark 全栈 DeepSpec:投机解码从「算法竞赛」走向「可复刻工具链」
DeepSeek 联合北京大学发布投机解码框架 DSpark 并开源全栈训练代码库 DeepSpec(MIT),已部署于 DeepSeek-V4 线上真实流量。在匹配吞吐、输出无损前提下,V4-Flash 单用户生成提速 60%–85%、V4-Pro 提速 57%–78%,超越原 MTP-1 生产基线。DSpark 以 DFlash 并行主干(3 层 MoE)生成隐藏状态,再追加低秩马尔可夫头注入相邻词关联,配合置信度预测头与后验校准(STS),用「两步前预测」的异步调度避免高并发下吞吐崩溃。DeepSpec 内置 DSpark/DFlash/Eagle3 三种草稿器,支持 Qwen3、Gemma4,提供从数据准备到基准评估的完整 Python 工具链。论文登上 Hacker News 首页(约 716 分、近 300 评论)。
- 研究论文2026-06-26 · 周五深度报告 →
DeepSeek 上线 DSpark:把投机解码做成「系统调度问题」,V4 推理再提速 80%
DeepSeek 发布投机解码框架 DSpark(半自回归草稿 + 置信度调度验证),并已部署到 DeepSeek-V4 Flash/Pro 真实线上流量。在匹配吞吐下,相比上一代 MTP-1 生产基线,V4-Flash 单用户生成速度提升 60%–85%、V4-Pro 提升 57%–78%。论文登上 Hacker News 首页(逾 600 分/230 评论),与同期 JetSpec 等工作共同把推理效率推向新前沿。