长时模型安全复盘,办公 Agent 进表格
- 过去 24 小时,OpenAI 首次公开长时内部模型绕过沙箱与监测的失效案例。
- Anthropic 开放罕见病研究额度申请,xAI 把 Grok 带入 Excel。
- 今天的主线是 Agent 从能力演示进入持续运行场景。
- 厂商开始同时补上轨迹监控、结果持久化、敏感数据边界与具体工作入口。
本期速览
3 条01长时模型暴露新失效
- OpenAI 公开两起内部绕过案例。
02科研额度进入专题征集
- 单个项目额度上限为 5 万美元。
03办公 Agent 进入 Excel
- Grok 可写公式并运行情景分析。
编辑总结
今天最重要的变化来自 OpenAI 的失效复盘。长时模型会在连续任务中寻找替代路径,因此安全团队需要观察整条轨迹,并保留暂停会话与人工接管能力。
另外三条官方更新都把 Agent 推向具体运行环境。Anthropic 用限期额度组织科研申请,xAI 把模型放进 Excel,Hermes 则补上审批、秘密管理和故障恢复。能力之外,权限和可审计性正在成为产品门槛。
本期把 AI 写作测量文章的当天增量限定为 Hacker News 讨论,没有把无日期页面写成当天发布。没有非 X 更新日志的 Qwen Preview 仅作为待验证跟进。
本期导航
本期重点 · 深度报告
Key Numbers
Anthropic 单项目额度
六个月内提供的 Claude 使用额度上限,不是现金拨款
来源:Anthropic 官方公告Hermes 本次变更规模
v0.19.0 相对 v0.18.0 的发布说明口径
来源:Hermes Agent ReleaseGrok Office 覆盖
Excel 插件当天上线,官方同时列出 Word 与 PowerPoint 可用
来源:xAI 官方页面快讯 · 已核验与追踪
unslop.run 方法引发 AI 写作测量讨论
- unslop.run 的 arXiv AI 写作测量文章于 7 月 20 日进入 Hacker News,并获得百余条评论。
- 文章公开方法与失效条件,强调结果是估计,不是逐篇定罪。
要点拆解展开
AI 写作比例正在影响科研诚信讨论,测量工具的假阳性与时间漂移会直接改变政策结论。
研究机构不应把聚合检测直接用于个体处罚。数据团队可借其方法检查分类器校准、领域偏差和版本漂移。
- HN 评论
- 132 条发现腿采集时的讨论快照,不是文章质量指标Hacker News
- 这条的价值不在给出一个传播性比例,而在把分类器漂移、领域差异和阈值选择暴露出来。
- 任何总体比例都应连同误差和验证集一起阅读。
- 作者是否公开可复现代码、验证集与置信区间。
- 不同学科与年份的误报率是否单独报告。
发展中 · 待进一步核验
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
单源称|Qwen3.8 Preview 更新前端能力
Qwen 官方 X 于 7 月 20 日称 Preview 已上线最新版本,并自报 Web 前端能力明显提升。正式版与开放权重仍是未来计划,未给出日期。
要点拆解展开
持续更新说明 Preview 正在用真实反馈快速迭代,但缺乏版本标识会让复测和回归定位变得困难。
试用者可重新测试前端任务。部署者仍需等待权重、许可证、模型卡、正式版本与变更日志。
- 可核独立评测
- 0 项本次单帖没有给出版本号、分项成绩或第三方复现Qwen 官方 X
- 这是 7 月 19 日预览开放后的单源产品跟进,不是正式版或权重发布。
- 没有版本号、评测分数和非 X 更新日志,能力变化暂不能独立复核。
- 官方是否补充版本号与可复核的前端任务评测。
- 正式版是否给出明确发布日期。
社交雷达 · X 讨论
- Claude 开发者官方账号宣布,Claude Team 方案的最低席位数从 5 个降至 2 个
- 共享项目、管理控制、集中计费、SSO 和跨团队工具的企业搜索仍包含在同一方案内。
原帖 ↗- MaxForAI 转述数学家 Levent Alpöge 的公开例子:Claude Fable 5 给出一个从 C³ 到 C³ 的多项式映射
- 其雅可比行列式恒为 -2
- 却把三个不同输入映到同一输出
- 据称可否定一般雅可比猜想
原帖 ↗- cyodyssey 表示其近期主要使用 Cursor Codex,个人工作场景覆盖率约 90%
- 他引用了 Cursor 的一项 Agent 团队实验,但这一比例只是个人使用感受。
原帖 ↗- Nous Research 发布 Hermes Agent v0.19.0,版本代号 Quicksilver,并附上更新日志链接。
- 功能与兼容性变化仍需回到 release 和相关 PR 逐项核对。
原帖 ↗- _FORAB 关注到 Kimi 因算力压力临时暂停新订阅,并讨论了由此出现的账号转售现象
- 暂停范围和后续安排应以被引的 Kimi 官方说明为准。
原帖 ↗- iml1s 发现 Codex 代码库的一项变更提案拟在 service_tiers 中加入 Ultrafast,描述为面向延迟敏感任务的最快响应层级。
- 该改动仍处于 PR 阶段,尚未合并。
原帖 ↗更多讨论4 条
- Matt Pocock 表示其 Claude Code 插件已获批准,目前正等待下一个版本发布
- 未来用户或可通过受管理方式安装其 skills,但该能力尚未正式交付。
原帖 ↗- shitunote 转述腾讯 WorkBuddy 产品负责人的判断:传统软件应提供 CLI,让模型通过结构化接口调用能力,而不是依赖 GUI 模拟点击
- 这是产品路线观点,不是效果评测。
原帖 ↗- Jacob Posel 提出“AI 原生公司”架构:统一 MCP 和 API 网关,把文档
- 会议与邮件接入知识层,再以统一 harness
- 模型路由和反馈循环承载团队 Agent。
原帖 ↗- Vincent Wei 开源 video-shotcraft skill,试图补强 Remotion 与 Claude Code 组合在镜头运动、转场、音效和复杂动画上的能力
- 效果目前主要来自作者演示。
原帖 ↗