Topic Timeline
#SGLang
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 技术基础设施2026-08-22 · 周六重要度 4/5深度报告 →
SGLang两篇技术帖压低推理停机和延迟
LMSYS 8月21日发布两篇SGLang技术文,分别介绍Weight Cache Daemon和Ling-3.0-flash推理优化。
- 两个更新解决的是同一条生产推理链上的不同成本:重启时的权重加载和batch-1解码时的关键路径。
- 它把优化重点从单次benchmark峰值转向可恢复、可复现的服务指标。
- 技术研究2026-08-20 · 周四重要度 4/5深度报告 →
LMSYS拆解V4-Pro在H20上的服务优化
LMSYS 8月19日发布DeepSeek-V4-Pro H20服务优化报告,新增内容是推理profile、显存容量和decode吞吐的工程拆解。
- 行业动态2026-08-08 · 周六重要度 3/5
HPC-Ops披露特定配置TPOT最高降48.8%
LMSYS于北京时间8月8日发布联合技术稿,披露HPC-Ops Attention与MoE在Hy3-FP8、8×H20、batch 32测试中,使TPOT相对SGLang默认实现最高降低48.8%。五个相关PR均在7月合入。
- 当天新增是完整设计与基准披露,代码合入发生在7月。
- 48.8%属于联合后端的端到端结果
- 工程实践2026-07-31 · 周五重要度 3/5
SGLang 接入 Google TPU,PyTorch 后端计划年内推出
RadixArk 与 Google Cloud 宣布把 SGLang 扩展到 TPU。SGL-JAX 当前已可用于最新 TPU;额外的 PyTorch 原生 SGL-torchtpu 后端计划在 2026 年稍晚推出。
- 当前可用与未来计划必须分开:JAX 后端已经上线,PyTorch 后端和 Day 0 支持仍是承诺。
- 若兑现,推理框架会降低 GPU 与 TPU 之间的迁移成本。
- 研究论文2026-07-01 · 周三重要度 3/5
SGLang DSpark 预测解码实测数据放出:多场景预测 3 token,1K prompt 加速比 1.81x,8 卡 B200 速度 164→297 token/s
SGLang 的 DSpark 预测解码实测数据在 PR29538 放出:多场景基本能预测 3 个 token(数学 3.37 / 对话 3.0 / 代码 3.52)。1K prompt 下加速比 1.81x,8 卡 B200 速度从 164 token/s 拉到 297 token/s。TPOT 仅 2.9-5.2ms,DSpark 神经网络层延迟可忽略。超过 8 并发收益降至 1.2-1.3x(GPU 已打满)。注:PR29538 尚未合并。这是继 DeepSeek 开源 DeepSpec(含 DSpark/DFlash/Eagle3 三种草稿模型)之后,DSpark 在 SGLang 推理引擎上的第一次完整数据披露。
- DSpark 在 SGLang 上的实测数据揭示了『投机解码』的工程边界:
- 1.81x 加速比与 3 token 预测长度,比 DeepSeek 自报的 60-85% 提速口径更保守——说明 DeepSeek 自报口径与第三方实测之间存在显著差异,这正是 6-28 DSpark 深度页里就指出的 caveat。