2026年8月22日 · 周六

安全开放与推理工程成主线

  • 过去24小时,Anthropic把Claude Mythos 5放进Claude Security,并宣布3500万美元开源安全额度。
  • xAI把Grok 4.6送上Google Cloud Vertex AI,同时扩大Grok Bot可用计划。
本期判断

早报判断是,今天的增量来自高能力模型被限制性分发给防御、云平台和生产推理链路。

本期速览

3 条
  1. 01Claude强化防御入口
    • Mythos 5进入Claude Security扫描。
  2. 02xAI扩大企业分发
    • Grok 4.6上架Vertex Model Garden。
  3. 03推理服务转向恢复能力
    • SGLang发布Weight Cache Daemon。

编辑总结

今天没有OpenAI和Anthropic列表页内的新官博条目,但发现腿补到了Anthropic在Claude新站发布的安全产品公告。它和xAI的两条分发更新共同说明,高能力模型正在通过更窄的产品入口进入企业流程。

另一条主线是推理工程。SGLang的两篇8月21日技术文把恢复时间、batch-1延迟和speculative decode拆成可复核指标,值得基础设施团队跟踪。论文和社区工具部分仍有价值,但本期把旧论文的HF日榜热度写成跟进,避免把8月20日原文包装成今天首发。

On this page

本期导航

Deep Dives

本期重点 · 深度报告

4 篇

Key Numbers

Grok 4.6上下文

xAI公告称Vertex AI上架版本提供500k上下文窗口。

来源:xAI News →
500k tokens

Ling TPOT变化

LMSYS称NEXTN调优让平均TPOT下降54%,同一随机工作负载测得。

来源:LMSYS Blog →
3.33到1.53ms

DSpark吞吐

LMSYS称1000请求对照中DSpark在并发1达到该输出吞吐。

来源:LMSYS Blog →
1120 tok每秒

DeepSeek图片计费

DeepSeek视觉文档称单张图片缩放后最多按384 tokens计费。

来源:DeepSeek Docs
≤384 tokens

SWE-bench Science

论文称任务来自98个GitHub仓库,覆盖20个科学领域。

来源:arXiv
119 tasks
Briefs

快讯 · 已核验与追踪

3 条
研究合作重要度 3/5高置信官方源

DeepMind借EVE Online延续游戏研究线

  • Google DeepMind 8月21日发文回顾与Fenris Creations的EVE Universe合作,用持久游戏世界研究长期记忆
  • 规划和多智能体互动。
要点拆解展开
Why

长期记忆和多智能体互动是通用agent短板。持久宇宙给研究者提供比单轮benchmark更复杂的环境。

Impact

游戏工作室可能成为agent研究伙伴。研究团队需要关注评测是否能从演示玩法转为可复现实验。

Numbers
游戏研究跨度
15年以上DeepMind称游戏作为AI研究测试场已有超过15年历史。Google DeepMind
重点能力
4类公告列出持续学习、深度记忆、长周期规划和多智能体互动。Google DeepMind
早报判断
  • 新闻钩子落在研究路线阐述:DeepMind把持久游戏世界重新摆到长期agent测试场的位置。
  • 开放世界比短局游戏更接近现实任务,因为记忆、关系和经济行为会跨很长时间累积。
接下来看
  • DeepMind是否公开可复现的EVE Online任务和评测指标。
  • 合作是否产生面向开发者的工具或只是研究原型。
#Google DeepMind#EVE Online#Agent#游戏研究
研究论文重要度 3/5中置信已核验

8月21日跟进|EnvHarness日榜升温

8月21日跟进:EnvHarness登上HF Papers日榜并获234个upvotes,原论文发表于8月20日。

要点拆解展开
Why
  • Agent训练越来越依赖交互环境。
  • 若静态benchmark追不上模型,动态环境包装会成为RL和评测的新基础设施。
Impact
  • 研究者可用它思考环境生成和verifier复用。
  • 产品团队仍需核对代码许可、运行脚本和数据artifact完整性。
Numbers
HF upvotes
234Hugging Face Papers在采集时显示的日榜热度。HF Papers
性能提升
最高9.0点论文摘要称在held-out instances上最高提升9.0 points。arXiv
早报判断
  • 这条的news peg是日榜讨论和社区关注,论文原文发表于8月20日。
  • 它的价值在于把环境生成从重建任务转为包装任务,降低为agent持续制造失败样本的工程成本。
接下来看
  • 开源代码是否包含EnvRigger实现、运行脚本和跨benchmark复现实验。
  • 五个benchmark的失败诊断能否被独立复现。
研究论文重要度 3/5中置信已核验

8月21日跟进|科学代码评测升温

8月21日跟进:SWE-bench Science进入HF Papers日榜,论文含119个任务、98个仓库和20个领域。

要点拆解展开
Why

科学软件错误会影响实验结论。通用coding agent在这种场景下需要理解领域假设,而不是只改测试。

Impact

科研团队可把该benchmark用于agent准入测试。模型团队需要关注领域知识注入带来的锚定风险。

Numbers
任务数
119论文摘要称benchmark包含119个repository-level任务。arXiv
仓库数
98论文摘要称任务来自98个GitHub仓库。arXiv
早报判断
  • 这条把coding agent评测从通用软件缺陷拉到科学计算语境。
  • 关键增量在于指出科学知识可能帮助也可能误导修复过程。
接下来看
  • benchmark数据和任务定义是否完全公开。
  • 科学指导在不同领域中何时帮助或误导agent。
Developing

发展中 · 待进一步核验

1 条

以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。

产品定价重要度 2/5低置信发展中

单源称OpenAI临时下调Sol价格

OpenAI官方X在8月21日称GPT-5.6 Sol的API和credit pricing未来3个月下调超过20%。

要点拆解展开
Why

价格变化会影响开发者模型选择,但目前缺少独立公告页和细则变更说明。

Impact

API用户可重新测算Sol调用成本。订阅用户不应预期Pro、Plus和Business使用量变化。

Numbers
降价幅度
>20%OpenAI官方X称API与credit pricing下调超过20%。OpenAI官方X
促销期限
3个月OpenAI官方X称for the next 3 months,定价页写至少到2026-11-21。OpenAI官方X
早报判断
  • 这条只能按官方X单源处理,因为定价页更多是背景和价格表。
  • 关键是时态:这是未来3个月的促销价格,不是永久降价,也不是Pro、Plus和Business订阅额度提高。
接下来看
  • OpenAI是否发布正式博客或变更日志解释降价原因。
  • 定价页是否给出旧价对比和地区处理差异。
Social Radar

社交雷达 · X 讨论

6 条
coreyching@coreyching7 likes
  • OpenAI 开发者关系成员称,ChatGPT 与 Codex 插件提交流程已支持草案中的 Skills over MCP 扩展。
  • Scan tools 会把 MCP server 的 skills 快照随 tools 一起导入。
原帖 ↗
MaxForAI@MaxForAI7 likes
  • 中文社区转述 Anthropic 工程师 Thariq 的 ELI5 Skill 用法。
  • 它让 Claude 用大图、流程图和少量文字生成 HTML 解释页,适合陌生代码库、技术权衡和事故复盘。
trq212

Thariq 称 Anthropic 内部最近常用 ELI5 Skill,让 Claude 面向零基础读者生成图文 HTML 解释页。

原帖 ↗
opencode@opencode3724 likes
  • OpenCode 宣布 Ox Alpha 也可在 OpenCode Go 使用。
  • 未来 6 天近乎无限且免费,并且不计入 Go 用量。
opencode

引用帖称 Ox Alpha 是免费一周的 stealth model,提供 1M 上下文、多模态、零数据保留和较高限额。

原帖 ↗
aigclink@aigclink54 likes
  • Wake 被介绍为跨 13 个 code agent 的会话聚合器。
  • 它只读扫描 Claude Code、Codex CLI、Copilot CLI、Cursor、OpenCode、Kimi Code 等历史,并支持全文搜索和 resume。
原帖 ↗
justinsuntron@justinsuntron42 likes
  • B.AI 宣布小米 MiMo 系列模型接入其 API,社区转发关注后续是否免费。
  • 核心信号是国内多模态和编程模型开始进入第三方聚合 API。
BAI_AGI

B.AI 称 MiMo-V2.5 支持全模态和 1M 上下文,MiMo-V2.5-Pro 是 1.02T MoE 文本模型。

原帖 ↗
Gorden_Sun@Gorden_Sun32 likes
  • 中文 AI 日报作者梳理 OpenAI 新设 Strategic Futures 团队和 AI Futures 博客。
  • 首篇文章关注高级 AI 时代普通人的权利、责任归属和反权力集中设计。
原帖 ↗
更多讨论6 条
cxjwin@cxjwin56 likes
  • 开发者解读智谱和清华的 SAO 论文,重点是异步训练 coding agent 不再等待最慢 rollout。
  • 文中转述 Qwen3-30B-A3B 上 SWE-Bench 从 23.0 提升到 29.8。
ZixuanLi_

论文作者称 SAO 用单 rollout、价值模型训练和双侧 token 裁剪处理 agentic RL 的离策略与稳定性问题。

原帖 ↗
LinearUncle@LinearUncle66 likes
  • 社区关注 modelprint 开源工具对 Ox Alpha 的模型指纹分析。
  • 发帖者称 9 类基础设施探针显示其更像 GLM 家族,但这仍是社区检测结论。
unclecode

Unclecode 称用 tokenizer、错误码和隐藏模板等 9 个探针比对 12 个候选模型,Ox Alpha 匹配 GLM 家族。

原帖 ↗
elonmusk@elonmusk3106 likes
  • Elon Musk 转推 Grok Build 1.0.8,并称 Grok Build 几乎每天都有改进。
  • 更新重点集中在 subagents、workflows 和多任务体验。
mark_k
  • Grok Build 1.0.8 加快并发 subagent 启动,修复多 subagent 打开时冻结,并改进 workflow
  • MCP consent 和下载体验。
原帖 ↗
johnbai@johnbai541 likes
  • Grok Bot 团队成员扩散开放信号:用户可在 24 小时内凭取消其他 AI 订阅的收据换取一个月 Pro+。
  • 这配合官方帖显示 Grok Bot 正在扩大可用范围。
bot
  • Grok Bot 称 SuperGrok Plus
  • Cursor Pro+ 和 Cursor Teams 用户已有访问权,具体用量规则需看正式条款。
原帖 ↗
DLKFZWilliam2@DLKFZWilliam21138 likes
  • 开发者称已申请到 Apple Private Cloud Compute 访问,可在 App 中调用云端 Apple Foundation Models。
  • 帖子把它视为移动应用低成本加入 AI 功能的信号。
原帖 ↗
gengdaJ@gengdaJ92 likes

中文创作者实测豆包会员后的连接器和 Skill 生态,提到企业查询、金融法律、自媒体、办公学术、企微等入口,以及 82 个 Skills 和 Seedance 视频模型体验。

gengdaJ

旧帖回顾豆包进入飞书后,可抓取抖音视频数据并写入飞书多维表格,作为本次生态体验背景。

原帖 ↗