#编码 Agent
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 模型发布2026-08-25 · 周二重要度 5/5深度报告 →
GPT-5.6进入Kiro,成本口径指向Agent编码
OpenAI 8月24日宣布GPT-5.6模型家族已在Kiro可用,并称Terra在Kiro完成Terminal-Bench 2.1成功任务时成本约降低82%。
- 这次更新把价格性能叙事放到软件Agent工作流里验证,价值高于单个模型入口变化。
- 关键限制是数字来自OpenAI与AWS测试,外部尚未看到完整任务集和复现实验。
- 研究论文2026-08-22 · 周六重要度 3/5
8月21日跟进|科学代码评测升温
8月21日跟进:SWE-bench Science进入HF Papers日榜,论文含119个任务、98个仓库和20个领域。
- 这条把coding agent评测从通用软件缺陷拉到科学计算语境。
- 关键增量在于指出科学知识可能帮助也可能误导修复过程。
- 模型发布2026-07-17 · 周五重要度 5/5深度报告 →
Kimi K3 发布,开放权重承诺压到 7 月 27 前
Moonshot 在目标窗口发布 Kimi K3 官方技术说明并上线 Kimi、Kimi Work、Kimi Code 和 API。官方称模型为 2.8T 参数、100 万上下文,并承诺 7 月 27 日前开放权重。
- Kimi K3 把多模态、长上下文、代码入口和开放权重承诺放进同一发布。
- 性能数字仍主要来自发布方和社区榜单,开放权重兑现前不宜把生态影响写满。
- 开源工具2026-07-16 · 周四重要度 4/5深度报告 →
xAI 开源 Grok Build,公开 Rust Agent 运行时
xAI 7 月 15 日公开 Grok Build 的 Rust CLI、TUI 与 Agent 运行时。目标窗口内公开仓库只有 1 个首发提交,采集时递归树包含 3194 个条目,其中 2219 个路径以 .rs 结尾。
- 这次开放的价值在工程透明度,而不是模型权重。
- 外部团队可检查上下文压缩、沙箱、工具和长任务实现,但仓库仍是内部单体库的周期性镜像。
- 开源工具2026-07-15 · 周三重要度 3/5
待验证|Ditto v0.3.8 增加 Antigravity 会话挖掘
低置信记录:GitHub API 显示 Ditto v0.3.8 于 7 月 14 日发布,新增读取本地 Google Antigravity transcripts;build 校验中 GitHub API 偶发 403。
- 这条是社区工具信号,价值在方向而非项目成熟度。
- Agent 记忆开始从 prompt 文件转向本地日志挖掘,但 GitHub API 可用性和隐私过滤仍需继续核对。
- 观点观察2026-07-12 · 周日重要度 3/5深度报告 →
待验证|Systima 称 Claude Code 预提示开销约 3.3 万 tokens
Systima 7 月 12 日原文称,Claude Code 与 OpenCode 在读提示前分别消耗约 3.3 万和 7000 tokens。这是单源测试,仍需独立复现。
这组数字尚不能证明工具优劣。它值得追踪,是因为系统提示、工具说明与上下文快照已经成为用户不易看见的成本。
- 产品上新2026-06-28 · 周日重要度 2/5
待验证|OpenCode v2 发布:TUI / 桌面 / Web 多端共享同一后端,默认全部同步
据作者 @thdxr(推文 3348 赞),OpenCode v2 让 TUI、桌面端和 Web 端的所有实例共享同一个后端,默认全部同步——无论开多少个窗口,资源占用都被压到最低。
- 这是 coding agent 工具走向『多端一致』的一个务实信号:开发者越来越常在终端
- 桌面 App 和浏览器之间来回切,各端各跑一份后端既费资源又导致状态不一致。
- 产品上新2026-06-28 · 周日重要度 2/5
OpenAI Codex 本周体验更新:长线程滚动更顺、复制到 Slack 保留 Markdown
据 @OpenAIDevs / @thsottiaux,Codex 本周落地一批体验改进:超长对话线程滚动更顺滑、浏览时阅读位置不再跳动;线程切换后台开销降低、可加载更深本地历史;从 Codex 复制内容粘贴到 Slack 时完整保留 Markdown(列表/加粗/代码块/链接)、大段粘贴不再卡 UI;新增可悬停的导航栏轮次预览、设置搜索覆盖更多控件,以及一个 Pets 面板。@thsottiaux 推文 1949 赞、@OpenAIDevs 2967 赞。
- 这批更新看着琐碎,但方向值得注意:OpenAI 在抢 Slack 这个工作流入口
- 『复制到 Slack 保留 Markdown』和同周 Anthropic Claude Tag 进 Slack 是同一战场的两种打法,一个把 Agent 直接驻进频道,一个优化『从 IDE 到 Slack』的内容流转。
- 产品上新2026-06-27 · 周六
workweave/router:在 Claude/Codex/Cursor 内做智能模型路由
Show HN 项目 workweave/router 直接在 Claude、Codex、Cursor 内做智能模型路由,按任务把请求分发给最合适的模型。HN 热度 201。
- 模型路由层正从"API 网关功能"下沉到编码 agent 内部,意味着开发者不再为单一模型锁死、可按任务难度动态选型以平衡成本与质量。
- 这与 Agent Arena 的 token 效率结论、OpenRouter 的 open-weight 流水线同属"按需选模"主线
- 研究论文2026-06-24 · 周三重要度 3/5
NatureBench:让 coding agent 去复现 Nature 论文的 SOTA,90 题里只过 17.8%
Frontis.AI 提出跨学科基准 NatureBench,从同行评审的 Nature 系论文蒸馏出 90 个任务,配套 NatureGym 自动构建每题独立容器环境(解决此前『agent 做科研』基准的环境碎片化问题)。在禁联网搜索的严格协议下评测 10 个前沿 agent 配置,最强者在 g>0.1 标准下仅超越 SOTA 17.8% 的任务。
- 这篇把『agent 能不能做科研』从口号拉回到可量化的冷数据:
- 17.8% 不是失败,而是诚实地标定了当前上限。
- 行业动态2026-06-22 · 周一重要度 3/5
『Agentjacking』:伪造错误报告投毒,诱导编码 Agent 执行恶意指令(待核实规模)
据聚合媒体 buildfastwithai 6 月整理,出现一类名为 Agentjacking 的新攻击:用伪造的 Sentry 错误报告夹带 Markdown 注入,被 Claude Code、Cursor、OpenAI Codex 等编码 Agent 当作合法内容执行;文中称利用成功率 85%、影响 2388 家组织,尚无通用补丁,缓解建议是把错误追踪输出当作不可信输入并加人工复核。
- 无论具体数字是否准确,这类攻击点出了 Agent 时代的结构性新风险面:Agent 会主动读取并信任各类工具输出(错误日志、issue、网页),任何一环都可能成为提示注入入口。
- 这与当日 Five Eyes 警告、GateMem 的访问控制研究在同一逻辑链上——AI 把攻击面从『代码』扩展到了『一切被模型读取的内容』。