Topic Timeline
#SWE-bench
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 研究论文2026-08-22 · 周六重要度 3/5
8月21日跟进|科学代码评测升温
8月21日跟进:SWE-bench Science进入HF Papers日榜,论文含119个任务、98个仓库和20个领域。
- 这条把coding agent评测从通用软件缺陷拉到科学计算语境。
- 关键增量在于指出科学知识可能帮助也可能误导修复过程。
- 模型发布2026-06-22 · 周一重要度 4/5深度报告 →
智谱 GLM-5.2 开源压成本:753B MoE、MIT 许可,自报 SWE-bench Pro 62.1
智谱(Z.ai)开源 GLM-5.2:753B 参数 MoE(约 40B 激活)、MIT 许可、1M 上下文,模型卡自报 SWE-bench Pro 62.1(上代 58.4)、Terminal-Bench 2.1 约 81.0,官方称在多项基准上「超过 GPT-5.5 与 Opus 4.7」。API 价与本地部署门槛把「开源前沿模型」的总拥有成本又压低一档。
- 开源前沿模型『以价换量』的主线在 6 月持续:MIT 许可移除法律门槛,价格再压一个数量级,把推理成本压力直接传导给闭源厂商。
- 但要冷静看待——这些 benchmark 是厂商自报,各源对 Terminal-Bench 口径已出现分歧(81.0 vs 62/63.5),且本地跑满需 8×H100,真正的门槛从『许可』转向『算力』。