Topic Timeline
#推理服务
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 产品上新2026-08-23 · 周日重要度 1/5
少源|OpenCode修复推理服务降级
OpenCode官方X在8月22日称已部署修复,处理一小部分inference service请求降级的问题,用户应看到响应性改善。
- 这条更像运行状态信号,不适合拔高为产品发布。
- 它仍值得记录,因为AI编程工具竞争开始把模型可用性、服务退化和状态沟通纳入用户体验。
- 技术基础设施2026-08-22 · 周六重要度 4/5深度报告 →
SGLang两篇技术帖压低推理停机和延迟
LMSYS 8月21日发布两篇SGLang技术文,分别介绍Weight Cache Daemon和Ling-3.0-flash推理优化。
- 两个更新解决的是同一条生产推理链上的不同成本:重启时的权重加载和batch-1解码时的关键路径。
- 它把优化重点从单次benchmark峰值转向可恢复、可复现的服务指标。
- 产品上新2026-08-14 · 周五重要度 5/5深度报告 →
GPT-5.6 Sol推出Ultrafast有限预览
OpenAI在8月13日预览Ultrafast服务层,先向部分API客户开放。官方称GPT-5.6 Sol相较Standard processing最高快14倍,Cerebras称峰值可达750 tokens/s。
- 这次变化落在服务层:同一模型按延迟被重新定价和分发。
- 实时语音、事故响应和金融研究会先受益,但容量、价格和质量折损仍要等实测。