#Terminal-Bench
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 模型发布2026-08-25 · 周二重要度 5/5深度报告 →
GPT-5.6进入Kiro,成本口径指向Agent编码
OpenAI 8月24日宣布GPT-5.6模型家族已在Kiro可用,并称Terra在Kiro完成Terminal-Bench 2.1成功任务时成本约降低82%。
- 这次更新把价格性能叙事放到软件Agent工作流里验证,价值高于单个模型入口变化。
- 关键限制是数字来自OpenAI与AWS测试,外部尚未看到完整任务集和复现实验。
- 研究论文2026-07-14 · 周二重要度 4/5深度报告 →
LHTB 上榜 HF Daily:长程终端 Agent 仍吃力
Long-Horizon Terminal-Bench 7 月 13 日进入 HF Daily Papers。项目页用 46 个任务和 90 分钟预算展示 18 模型榜单,arXiv 摘要则是 15 模型实验口径。
- 它把 Agent 评测从“最后是否通过”推进到“中途走到哪里”。
- 项目页与 arXiv 摘要的模型数口径不同,深读时必须分开引用。
- 头条2026-06-28 · 周日重要度 5/5深度报告 →
OpenAI 放出 GPT-5.6 三档预览 Sol/Terra/Luna:换了命名体系,Terra 性价比翻倍,但先报备了美国政府
OpenAI 启动 GPT-5.6『有限预览』,用 Sol(旗舰)/Terra(均衡)/Luna(低价)三档能力位替代旧命名——数字代表『代数』,名字代表可独立迭代的『能力档』。定价(每百万 token):Sol 输入 $5 / 输出 $30,Terra $2.50 / $15,Luna $1 / $6;官方称 Terra 性能对标上代 GPT-5.5 但价格便宜 2 倍。Benchmark 多为 OpenAI 自报:Sol 在 Terminal-Bench 2.1 上创 SOTA,在 ExploitBench 上以约 1/3 输出 tokens 与 Mythos Preview 竞争。新增 max reasoning effort 与借助 subagents 的 ultra 模式;prompt caching 支持显式 cache breakpoints、缓存最短存活 30 分钟、写入按未缓存输入价 1.25x、读取享 90% 折扣。安全上未跨越 Preparedness Framework 的 Cyber Critical 阈值,自动化红队投入超 70 万 A100 等效 GPU 小时。最反常的一点:应美国政府要求,本次先做小范围预览、参与方已报备政府,广泛开放要『未来数周』;7 月将在 Cerebras 上线 Sol,速度最高 750 tokens/秒。