安全开放与推理工程成主线
- 过去24小时,Anthropic把Claude Mythos 5放进Claude Security,并宣布3500万美元开源安全额度。
- xAI把Grok 4.6送上Google Cloud Vertex AI,同时扩大Grok Bot可用计划。
早报判断是,今天的增量来自高能力模型被限制性分发给防御、云平台和生产推理链路。
本期速览
3 条01Claude强化防御入口
- Mythos 5进入Claude Security扫描。
02xAI扩大企业分发
- Grok 4.6上架Vertex Model Garden。
03推理服务转向恢复能力
- SGLang发布Weight Cache Daemon。
编辑总结
今天没有OpenAI和Anthropic列表页内的新官博条目,但发现腿补到了Anthropic在Claude新站发布的安全产品公告。它和xAI的两条分发更新共同说明,高能力模型正在通过更窄的产品入口进入企业流程。
另一条主线是推理工程。SGLang的两篇8月21日技术文把恢复时间、batch-1延迟和speculative decode拆成可复核指标,值得基础设施团队跟踪。论文和社区工具部分仍有价值,但本期把旧论文的HF日榜热度写成跟进,避免把8月20日原文包装成今天首发。
本期导航
本期重点 · 深度报告
Key Numbers
DeepSeek图片计费
DeepSeek视觉文档称单张图片缩放后最多按384 tokens计费。
来源:DeepSeek DocsSWE-bench Science
论文称任务来自98个GitHub仓库,覆盖20个科学领域。
来源:arXiv快讯 · 已核验与追踪
DeepMind借EVE Online延续游戏研究线
- Google DeepMind 8月21日发文回顾与Fenris Creations的EVE Universe合作,用持久游戏世界研究长期记忆
- 规划和多智能体互动。
要点拆解展开
长期记忆和多智能体互动是通用agent短板。持久宇宙给研究者提供比单轮benchmark更复杂的环境。
游戏工作室可能成为agent研究伙伴。研究团队需要关注评测是否能从演示玩法转为可复现实验。
- 游戏研究跨度
- 15年以上DeepMind称游戏作为AI研究测试场已有超过15年历史。Google DeepMind
- 重点能力
- 4类公告列出持续学习、深度记忆、长周期规划和多智能体互动。Google DeepMind
- 新闻钩子落在研究路线阐述:DeepMind把持久游戏世界重新摆到长期agent测试场的位置。
- 开放世界比短局游戏更接近现实任务,因为记忆、关系和经济行为会跨很长时间累积。
- DeepMind是否公开可复现的EVE Online任务和评测指标。
- 合作是否产生面向开发者的工具或只是研究原型。
8月21日跟进|EnvHarness日榜升温
8月21日跟进:EnvHarness登上HF Papers日榜并获234个upvotes,原论文发表于8月20日。
要点拆解展开
- Agent训练越来越依赖交互环境。
- 若静态benchmark追不上模型,动态环境包装会成为RL和评测的新基础设施。
- 研究者可用它思考环境生成和verifier复用。
- 产品团队仍需核对代码许可、运行脚本和数据artifact完整性。
- HF upvotes
- 234Hugging Face Papers在采集时显示的日榜热度。HF Papers
- 性能提升
- 最高9.0点论文摘要称在held-out instances上最高提升9.0 points。arXiv
- 这条的news peg是日榜讨论和社区关注,论文原文发表于8月20日。
- 它的价值在于把环境生成从重建任务转为包装任务,降低为agent持续制造失败样本的工程成本。
- 开源代码是否包含EnvRigger实现、运行脚本和跨benchmark复现实验。
- 五个benchmark的失败诊断能否被独立复现。
8月21日跟进|科学代码评测升温
8月21日跟进:SWE-bench Science进入HF Papers日榜,论文含119个任务、98个仓库和20个领域。
要点拆解展开
科学软件错误会影响实验结论。通用coding agent在这种场景下需要理解领域假设,而不是只改测试。
科研团队可把该benchmark用于agent准入测试。模型团队需要关注领域知识注入带来的锚定风险。
- 任务数
- 119论文摘要称benchmark包含119个repository-level任务。arXiv
- 仓库数
- 98论文摘要称任务来自98个GitHub仓库。arXiv
- 这条把coding agent评测从通用软件缺陷拉到科学计算语境。
- 关键增量在于指出科学知识可能帮助也可能误导修复过程。
- benchmark数据和任务定义是否完全公开。
- 科学指导在不同领域中何时帮助或误导agent。
发展中 · 待进一步核验
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
单源称OpenAI临时下调Sol价格
OpenAI官方X在8月21日称GPT-5.6 Sol的API和credit pricing未来3个月下调超过20%。
要点拆解展开
价格变化会影响开发者模型选择,但目前缺少独立公告页和细则变更说明。
API用户可重新测算Sol调用成本。订阅用户不应预期Pro、Plus和Business使用量变化。
- 降价幅度
- >20%OpenAI官方X称API与credit pricing下调超过20%。OpenAI官方X
- 促销期限
- 3个月OpenAI官方X称for the next 3 months,定价页写至少到2026-11-21。OpenAI官方X
- 这条只能按官方X单源处理,因为定价页更多是背景和价格表。
- 关键是时态:这是未来3个月的促销价格,不是永久降价,也不是Pro、Plus和Business订阅额度提高。
- OpenAI是否发布正式博客或变更日志解释降价原因。
- 定价页是否给出旧价对比和地区处理差异。
社交雷达 · X 讨论
- OpenAI 开发者关系成员称,ChatGPT 与 Codex 插件提交流程已支持草案中的 Skills over MCP 扩展。
- Scan tools 会把 MCP server 的 skills 快照随 tools 一起导入。
原帖 ↗- 中文社区转述 Anthropic 工程师 Thariq 的 ELI5 Skill 用法。
- 它让 Claude 用大图、流程图和少量文字生成 HTML 解释页,适合陌生代码库、技术权衡和事故复盘。
原帖 ↗- OpenCode 宣布 Ox Alpha 也可在 OpenCode Go 使用。
- 未来 6 天近乎无限且免费,并且不计入 Go 用量。
原帖 ↗- Wake 被介绍为跨 13 个 code agent 的会话聚合器。
- 它只读扫描 Claude Code、Codex CLI、Copilot CLI、Cursor、OpenCode、Kimi Code 等历史,并支持全文搜索和 resume。
原帖 ↗- B.AI 宣布小米 MiMo 系列模型接入其 API,社区转发关注后续是否免费。
- 核心信号是国内多模态和编程模型开始进入第三方聚合 API。
原帖 ↗- 中文 AI 日报作者梳理 OpenAI 新设 Strategic Futures 团队和 AI Futures 博客。
- 首篇文章关注高级 AI 时代普通人的权利、责任归属和反权力集中设计。
原帖 ↗更多讨论6 条
- 开发者解读智谱和清华的 SAO 论文,重点是异步训练 coding agent 不再等待最慢 rollout。
- 文中转述 Qwen3-30B-A3B 上 SWE-Bench 从 23.0 提升到 29.8。
原帖 ↗- 社区关注 modelprint 开源工具对 Ox Alpha 的模型指纹分析。
- 发帖者称 9 类基础设施探针显示其更像 GLM 家族,但这仍是社区检测结论。
原帖 ↗- Elon Musk 转推 Grok Build 1.0.8,并称 Grok Build 几乎每天都有改进。
- 更新重点集中在 subagents、workflows 和多任务体验。
原帖 ↗- Grok Bot 团队成员扩散开放信号:用户可在 24 小时内凭取消其他 AI 订阅的收据换取一个月 Pro+。
- 这配合官方帖显示 Grok Bot 正在扩大可用范围。
原帖 ↗- 开发者称已申请到 Apple Private Cloud Compute 访问,可在 App 中调用云端 Apple Foundation Models。
- 帖子把它视为移动应用低成本加入 AI 功能的信号。
原帖 ↗中文创作者实测豆包会员后的连接器和 Skill 生态,提到企业查询、金融法律、自媒体、办公学术、企微等入口,以及 82 个 Skills 和 Seedance 视频模型体验。
原帖 ↗