Topic Timeline
#LMSYS
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 技术基础设施2026-08-22 · 周六重要度 4/5深度报告 →
SGLang两篇技术帖压低推理停机和延迟
LMSYS 8月21日发布两篇SGLang技术文,分别介绍Weight Cache Daemon和Ling-3.0-flash推理优化。
- 两个更新解决的是同一条生产推理链上的不同成本:重启时的权重加载和batch-1解码时的关键路径。
- 它把优化重点从单次benchmark峰值转向可恢复、可复现的服务指标。
- 技术研究2026-08-20 · 周四重要度 4/5深度报告 →
LMSYS拆解V4-Pro在H20上的服务优化
LMSYS 8月19日发布DeepSeek-V4-Pro H20服务优化报告,新增内容是推理profile、显存容量和decode吞吐的工程拆解。
- 这条是大模型在受限硬件上继续榨效率的工程样本,而非新模型发布。
- 它说明MoE服务竞争已经从单一benchmark进入profile、KV容量和speculative decode的组合优化。
- 工程实践2026-07-30 · 周四重要度 3/5
LMSYS 将 MXFP8 与 NVFP4 接入强化学习
LMSYS 团队在 Miles 中实现端到端 MXFP8 与逐 token NVFP4 强化学习。8 张 B200 的 Qwen3-30B-A3B 消融显示低精度奖励曲线接近 BF16。
- 价值在于训练、rollout、权重更新和量化器共享精度合同。
- 测试仍是单一模型与固定负载,不能外推为所有强化学习任务无损。
- 融资动态2026-06-30 · 周二重要度 4/5
Arena 跑通 $100M ARR:Agent Mode 上线百万级长时多回合工具调用,评估维度从人类偏好投票扩展到任务完成率/幻觉率
Arena(原 Chatbot Arena / LMSYS 衍生项目)公布商业化里程碑:评估产品上线仅 8 个月即达到 $100M 年化收入运行率。社区规模达数千万;Agent Arena 面向长时 Agent 在真实复杂任务上的工具调用、反馈适应、错误恢复与目标达成能力进行评估,正从人类偏好投票扩展到客观指标(任务完成率、幻觉率等)。
- 8 个月做到 $100M ARR 是 SaaS 史上最快之一,比 Cursor / Linear / Notion 早期都快。
- 更重要的信号是评估范式从『人类偏好投票』转向『客观指标(任务完成率/幻觉率)』——这意味着 evaluation 正成为与训练同级的独立产业。