#推理优化
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 技术研究2026-08-20 · 周四重要度 4/5深度报告 →
LMSYS拆解V4-Pro在H20上的服务优化
LMSYS 8月19日发布DeepSeek-V4-Pro H20服务优化报告,新增内容是推理profile、显存容量和decode吞吐的工程拆解。
- 这条是大模型在受限硬件上继续榨效率的工程样本,而非新模型发布。
- 它说明MoE服务竞争已经从单一benchmark进入profile、KV容量和speculative decode的组合优化。
- 行业动态2026-08-08 · 周六重要度 3/5
HPC-Ops披露特定配置TPOT最高降48.8%
LMSYS于北京时间8月8日发布联合技术稿,披露HPC-Ops Attention与MoE在Hy3-FP8、8×H20、batch 32测试中,使TPOT相对SGLang默认实现最高降低48.8%。五个相关PR均在7月合入。
- 当天新增是完整设计与基准披露,代码合入发生在7月。
- 48.8%属于联合后端的端到端结果
- 工程实践2026-07-30 · 周四重要度 4/5深度报告 →
OpenAI 披露 GPT-5.6 服务成本降低 20%
OpenAI 称,生产 GPU 内核及更广泛内核改进合计让端到端服务成本降低 20%;改进投机解码令 token 生成效率提高超过 15%。
两个百分比对应不同优化范围,不能相加。更重要的工程变化是模型开始参与分析流量、改写内核和设计推理实验。
- 研究论文2026-06-27 · 周六深度报告 →
DeepSeek 开源 DSpark 全栈 DeepSpec:投机解码从「算法竞赛」走向「可复刻工具链」
DeepSeek 联合北京大学发布投机解码框架 DSpark 并开源全栈训练代码库 DeepSpec(MIT),已部署于 DeepSeek-V4 线上真实流量。在匹配吞吐、输出无损前提下,V4-Flash 单用户生成提速 60%–85%、V4-Pro 提速 57%–78%,超越原 MTP-1 生产基线。DSpark 以 DFlash 并行主干(3 层 MoE)生成隐藏状态,再追加低秩马尔可夫头注入相邻词关联,配合置信度预测头与后验校准(STS),用「两步前预测」的异步调度避免高并发下吞吐崩溃。DeepSpec 内置 DSpark/DFlash/Eagle3 三种草稿器,支持 Qwen3、Gemma4,提供从数据准备到基准评估的完整 Python 工具链。论文登上 Hacker News 首页(约 716 分、近 300 评论)。
- 研究论文2026-06-26 · 周五深度报告 →
DeepSeek 上线 DSpark:把投机解码做成「系统调度问题」,V4 推理再提速 80%
DeepSeek 发布投机解码框架 DSpark(半自回归草稿 + 置信度调度验证),并已部署到 DeepSeek-V4 Flash/Pro 真实线上流量。在匹配吞吐下,相比上一代 MTP-1 生产基线,V4-Flash 单用户生成速度提升 60%–85%、V4-Pro 提升 57%–78%。论文登上 Hacker News 首页(逾 600 分/230 评论),与同期 JetSpec 等工作共同把推理效率推向新前沿。
- 研究论文2026-06-23 · 周二重要度 3/5深度报告 →
Grouped Query Experts:在注意力里做 MoE,KV cache 不变、预填充提速近 1.8×
Vishesh Tripathi 与 Abhay Kumar 的论文《Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention》(arXiv:2606.20945)把 GQA 分组内的查询头当作专家,由路由器为每个 token 选 top-k 个查询头专家,KV 头保持稠密、始终计算——从而完整保留 GQA 的 KV cache 优势,只削减激活的查询头算力。在 250M 参数 / 30B token 预算下,完整 GQE 三任务(HellaSwag/ARC-E/PIQA)平均 56.04,略高于稠密 GQA 基线 55.86;预填充在 4k–1024k token 区间提速约 1.67–1.80×。作者把这定性为「匹配而非提升」,并强调结论需在更大规模、多随机种子上复现。