官方密集更新,Agent转向可控执行
- 过去24小时,OpenAI同时披露自研推理芯片实测、企业管理插件和影响行动处置。
- Anthropic把注意力放到AI陪伴与心理支持评测,Claude则把记忆打通到Cowork。
- 早报判断是,模型能力之外的控制层正在变成主战场。
- 芯片、权限、记忆和安全评测决定Agent能否进入企业与高风险场景。
本期速览
3 条01OpenAI补齐执行栈
- Jalapeño首次给出实测。
02Anthropic转向可评测安全
- 500万美元资助wellbeing评测。
03工具信号保持分层
- Apple强调本地AI算力。
编辑总结
今天的主线是几家厂商继续补齐Agent的基础条件。OpenAI给出自研推理芯片实测、企业后台管理插件和影响行动处置报告,覆盖成本、权限与安全三个层面。
Anthropic和Claude的两条更新把问题推向长期使用。wellbeing评测资助说明高风险对话需要独立、开源、可复核的测试体系;Cowork记忆打通则让上下文跨界面延续,同时要求用户和企业重新审视哪些内容可以被保存。
长尾部分保持降级处理。Apple的新芯片是端侧AI硬件信号,Apodex是研究与工具联合发布,Qwen和OpenWorker则主要来自社交与项目方线索。它们值得跟踪,但不应和官方深度发布放在同一置信层级。
本期导航
本期重点 · 深度报告
Key Numbers
IBI抽样复制文章
OpenAI称抽样审查IBI网站文章时发现多数复制自其他来源。
来源:OpenAI快讯 · 已核验与追踪
Apple发布M6与M5 Ultra加强本地AI
Apple 8月25日发布M6和M5 Ultra,称M6采用2纳米工艺并配备Dual 16-core Neural Engine,M5 Ultra最高支持512GB统一内存。
要点拆解展开
本地运行LLM和多模态模型受内存与神经网络引擎约束。Apple的新芯片直接扩大端侧AI设备选择。
开发者可评估本地推理和创作工作流。企业采购可把隐私敏感AI任务放回桌面设备测试。
- M6制程
- 2纳米Apple称M6是其首款state-of-the-art 2 nm芯片。Apple
- M6统一内存带宽
- 170GB每秒Apple发布稿给出的M6 unified memory bandwidth上限。Apple
- 这条属于端侧AI硬件更新,会影响本地AI工作负载的上限。
- Apple把AI叙事放进Mac mini和Mac Studio,核心变量是内存带宽、统一内存容量和开发者框架能否吃满硬件。
- 开发者是否公开M6和M5 Ultra的本地LLM实测。
- Apple框架是否让双Neural Engine被应用自动利用。
Apodex 1.1登HF日榜并开源Agent工作台
- Hugging Face 8月25日收录Apodex 1.1论文,项目称同时提供在线工作台
- Apodex 1.1 mini开放权重和FrontierAgent本地工作台。
要点拆解展开
- 长程Agent正在从单次回答转向可执行环境、状态保持和多Agent协作。
- Apodex把模型、工作台和开源harness一起发布。
研究者可检查论文和FrontierAgent代码。开发者应等更多第三方复现后再评估生产采用。
- arXiv编号
- 2608.23283论文页显示Submitted on 24 Aug 2026,HF paper页在8月25日更新收录。arXiv/HF
- mini模型规模
- 35BarXiv摘要写35B-parameter Apodex 1.1 Mini,HF集合指向35B-A3B基座口径。arXiv/HF
- 这条更像Agent产品和论文联合发布,亮点在异步Agent Team与可验证工作流。
- 由于关键能力仍来自项目自述,今天适合记录为研究与工具信号,不宜直接宣称达到前沿闭源模型水平。
- FrontierAgent仓库是否补齐可复现实验和运行脚本。
- Apodex 1.1 mini是否出现独立bench复测。
发展中 · 待进一步核验
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
待验证|Qwen3.8登开源图生网页榜首
Arena 8月25日称Qwen3.8-27B在Image-to-WebDev Arena列开源模型第1、总榜第7,并给出1574分和27B参数口径。
要点拆解展开
图生网页是多模态编码Agent的高频场景。小模型若能接近更大模型,会改变开源部署的成本曲线。
开发者可关注低成本网页生成模型。模型团队应等待榜单快照和任务样本再引用排名。
- Arena分数
- 1574Arena X帖给出的Image-to-WebDev Arena分数,需榜单页面进一步确认。Arena
- 参数规模
- 27BArena和Qwen帖均称Qwen3.8-27B为27B参数模型。Arena/Qwen
- 这是有用的榜单信号,但今天主要来自Arena和Qwen的X传播。
- 早报把它降级处理,原因是榜单页面可见排名有限,完整项目变动仍需官方榜单或可复现实验补强。
- Arena是否公开Image-to-WebDev榜单快照和样本。
- Qwen是否发布该排名对应的模型卡更新。
待验证|OpenWorker新增安全Agent
- 待验证:OpenWorker v0.2.0 release列出Security Coworker
- Cloud Posture Coworker和Dependency Audit Coworker
- Andrew Ng 8月25日转发说明其安全工作流。
要点拆解展开
安全团队需要可审计的本地harness。开源Agent若能跑在本地模型上,会缓解敏感代码外传顾虑。
开发者可试验本地安全扫描流程。企业采用前应审查代码、权限边界和误报处理能力。
- 内置安全Agent
- 3类GitHub v0.2.0 release列出Security、Cloud Posture和Dependency Audit三类coworkers。GitHub release
- 开源状态
- 100%开源OpenWorker项目页和发布帖均强调harness开源。OpenWorker
- 低置信边界在于缺少第三方评测和真实误报数据。
- 它已有GitHub release和项目页支撑,暂按开源Agent安全工作流信号处理。
- OpenWorker后续release是否披露安全coworkers的运行日志。
- 安全Agent是否公开扫描规则、误报率和修复PR样例。
社交雷达 · X 讨论
- ChatGPT 官方称 Work 现在可用 computer 和 browser 登录网站,且 ChatGPT 不会看到用户名或密码。
- 示例覆盖预约、保险、招聘、账务和电商补货等真实网页任务。
原帖 ↗- ChatGPT Work 的 scheduled tasks 增加事件触发。
- Plus 和 Pro 用户可让任务响应 Slack、Gmail、GitHub 变化
- Free 用户可创建最多 3 个任务。
原帖 ↗- OpenAI Developers 称 ChatGPT 浏览器扩展支持更多浏览器。
- 用户可把已打开标签页带入任务,让 Codex 基于当前浏览上下文工作。
原帖 ↗- Chromium Dev 宣传 OpenAI WebMCP Challenge。
- 卡片写明项目提交截止到 2026 年 9 月 3 日下午 5 点 PT,引用帖称奖池为 3.5 万美元。
原帖 ↗- Google Antigravity 账号称 Antigravity 已可在 Apple Xcode 内使用。
- 入口是 Xcode 27 beta 6 或更新版本的 Intelligence 设置面板。
原帖 ↗- OpenRouter 宣布 Makora 成为新的推理提供方。
- 首批模型包括 DeepSeek V4 Flash、GLM 5.2 FP8、GLM 5.2 NVFP4 和 Kimi K3。
原帖 ↗更多讨论6 条
- Anthropic 员工转述 Claude 记忆更新:Chat 与 Claude Cowork 现在使用同一份 memory。
- 用户只需让 Claude 记住一次,跨界面都可带上上下文。
原帖 ↗- Gemini App 官方称 macOS 版可用语音在任意窗口中听写、总结文件和改写文案。
- 这是桌面AI助手向系统级输入层延伸的信号。
原帖 ↗- browser_use 发布 Windows Harness,定位为持久 Python harness。
- 它覆盖 UI Automation、截图、原始输入、浏览器、文件、PowerShell 和虚拟光标。
原帖 ↗- Andrew Ng 称 OpenWorker 新版面向安全工作流,内置代码漏洞、依赖供应链和云安全配置检查。
- 它强调 harness 开源,便于审计代码与数据是否外传。
原帖 ↗- 非官方 Claude Code 变更日志称 2.1.246 包含 61 项 CLI 变化。
- 亮点包括 dedicated agents 工具、Auto mode 规则页和更长安全检查超时。
原帖 ↗- dotey 体验豆包工作后认为办公 Agent 正在变成工作入口。
- 长帖重点讨论飞书上下文、组织权限和流程改造,单一模型能力只是其中一层。
原帖 ↗