2026年8月26日 · 周三

官方密集更新,Agent转向可控执行

  • 过去24小时,OpenAI同时披露自研推理芯片实测、企业管理插件和影响行动处置。
  • Anthropic把注意力放到AI陪伴与心理支持评测,Claude则把记忆打通到Cowork。
本期判断
  • 早报判断是,模型能力之外的控制层正在变成主战场。
  • 芯片、权限、记忆和安全评测决定Agent能否进入企业与高风险场景。

本期速览

3 条
  1. 01OpenAI补齐执行栈
    • Jalapeño首次给出实测。
  2. 02Anthropic转向可评测安全
    • 500万美元资助wellbeing评测。
  3. 03工具信号保持分层
    • Apple强调本地AI算力。

编辑总结

今天的主线是几家厂商继续补齐Agent的基础条件。OpenAI给出自研推理芯片实测、企业后台管理插件和影响行动处置报告,覆盖成本、权限与安全三个层面。

Anthropic和Claude的两条更新把问题推向长期使用。wellbeing评测资助说明高风险对话需要独立、开源、可复核的测试体系;Cowork记忆打通则让上下文跨界面延续,同时要求用户和企业重新审视哪些内容可以被保存。

长尾部分保持降级处理。Apple的新芯片是端侧AI硬件信号,Apodex是研究与工具联合发布,Qwen和OpenWorker则主要来自社交与项目方线索。它们值得跟踪,但不应和官方深度发布放在同一置信层级。

On this page

本期导航

Deep Dives

本期重点 · 深度报告

5 篇

Key Numbers

Jalapeno每瓦吞吐

OpenAI称相对comparison systems,覆盖GPT-OSS 120B、DeepSeek R1和Kimi K2.5 1T。

来源:OpenAI →
1.5x-1.9x

Jalapeno端到端延迟

OpenAI自报InferenceX测试口径,比较对象为公开商用系统。

来源:OpenAI →
低1.7x-3.6x

Anthropic资助规模

面向独立AI wellbeing评测研究,含资金、模型访问和技术支持。

来源:Anthropic →
500万美元

Admin插件工单占比

OpenAI IT案例称Slack工作流在报告时处理的ticket volume比例。

来源:OpenAI →
约45%

IBI抽样复制文章

OpenAI称抽样审查IBI网站文章时发现多数复制自其他来源。

来源:OpenAI
34 of 36

M6制程

Apple称M6是其首款2纳米芯片,并用于新Mac mini。

来源:Apple →
2纳米
Briefs

快讯 · 已核验与追踪

2 条
硬件产品重要度 3/5高置信官方源

Apple发布M6与M5 Ultra加强本地AI

Apple 8月25日发布M6和M5 Ultra,称M6采用2纳米工艺并配备Dual 16-core Neural Engine,M5 Ultra最高支持512GB统一内存。

要点拆解展开
Why

本地运行LLM和多模态模型受内存与神经网络引擎约束。Apple的新芯片直接扩大端侧AI设备选择。

Impact

开发者可评估本地推理和创作工作流。企业采购可把隐私敏感AI任务放回桌面设备测试。

Numbers
M6制程
2纳米Apple称M6是其首款state-of-the-art 2 nm芯片。Apple
M6统一内存带宽
170GB每秒Apple发布稿给出的M6 unified memory bandwidth上限。Apple
早报判断
  • 这条属于端侧AI硬件更新,会影响本地AI工作负载的上限。
  • Apple把AI叙事放进Mac mini和Mac Studio,核心变量是内存带宽、统一内存容量和开发者框架能否吃满硬件。
接下来看
  • 开发者是否公开M6和M5 Ultra的本地LLM实测。
  • Apple框架是否让双Neural Engine被应用自动利用。
#Apple#M6#M5 Ultra#端侧AI
研究论文重要度 3/5中置信多源混合

Apodex 1.1登HF日榜并开源Agent工作台

  • Hugging Face 8月25日收录Apodex 1.1论文,项目称同时提供在线工作台
  • Apodex 1.1 mini开放权重和FrontierAgent本地工作台。
要点拆解展开
Why
  • 长程Agent正在从单次回答转向可执行环境、状态保持和多Agent协作。
  • Apodex把模型、工作台和开源harness一起发布。
Impact

研究者可检查论文和FrontierAgent代码。开发者应等更多第三方复现后再评估生产采用。

Numbers
arXiv编号
2608.23283论文页显示Submitted on 24 Aug 2026,HF paper页在8月25日更新收录。arXiv/HF
mini模型规模
35BarXiv摘要写35B-parameter Apodex 1.1 Mini,HF集合指向35B-A3B基座口径。arXiv/HF
早报判断
  • 这条更像Agent产品和论文联合发布,亮点在异步Agent Team与可验证工作流。
  • 由于关键能力仍来自项目自述,今天适合记录为研究与工具信号,不宜直接宣称达到前沿闭源模型水平。
接下来看
  • FrontierAgent仓库是否补齐可复现实验和运行脚本。
  • Apodex 1.1 mini是否出现独立bench复测。
Developing

发展中 · 待进一步核验

2 条

以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。

模型评测重要度 2/5低置信发展中

待验证|Qwen3.8登开源图生网页榜首

Arena 8月25日称Qwen3.8-27B在Image-to-WebDev Arena列开源模型第1、总榜第7,并给出1574分和27B参数口径。

要点拆解展开
Why

图生网页是多模态编码Agent的高频场景。小模型若能接近更大模型,会改变开源部署的成本曲线。

Impact

开发者可关注低成本网页生成模型。模型团队应等待榜单快照和任务样本再引用排名。

Numbers
Arena分数
1574Arena X帖给出的Image-to-WebDev Arena分数,需榜单页面进一步确认。Arena
参数规模
27BArena和Qwen帖均称Qwen3.8-27B为27B参数模型。Arena/Qwen
早报判断
  • 这是有用的榜单信号,但今天主要来自Arena和Qwen的X传播。
  • 早报把它降级处理,原因是榜单页面可见排名有限,完整项目变动仍需官方榜单或可复现实验补强。
接下来看
  • Arena是否公开Image-to-WebDev榜单快照和样本。
  • Qwen是否发布该排名对应的模型卡更新。
社区工具重要度 2/5低置信发展中

待验证|OpenWorker新增安全Agent

  • 待验证:OpenWorker v0.2.0 release列出Security Coworker
  • Cloud Posture Coworker和Dependency Audit Coworker
  • Andrew Ng 8月25日转发说明其安全工作流。
要点拆解展开
Why

安全团队需要可审计的本地harness。开源Agent若能跑在本地模型上,会缓解敏感代码外传顾虑。

Impact

开发者可试验本地安全扫描流程。企业采用前应审查代码、权限边界和误报处理能力。

Numbers
内置安全Agent
3类GitHub v0.2.0 release列出Security、Cloud Posture和Dependency Audit三类coworkers。GitHub release
开源状态
100%开源OpenWorker项目页和发布帖均强调harness开源。OpenWorker
早报判断
  • 低置信边界在于缺少第三方评测和真实误报数据。
  • 它已有GitHub release和项目页支撑,暂按开源Agent安全工作流信号处理。
接下来看
  • OpenWorker后续release是否披露安全coworkers的运行日志。
  • 安全Agent是否公开扫描规则、误报率和修复PR样例。
#OpenWorker#安全Agent#开源#本地执行
Social Radar

社交雷达 · X 讨论

6 条
ChatGPT@ChatGPT2630 likes
  • ChatGPT 官方称 Work 现在可用 computer 和 browser 登录网站,且 ChatGPT 不会看到用户名或密码。
  • 示例覆盖预约、保险、招聘、账务和电商补货等真实网页任务。
原帖 ↗
ChatGPT@ChatGPT1370 likes
  • ChatGPT Work 的 scheduled tasks 增加事件触发。
  • Plus 和 Pro 用户可让任务响应 Slack、Gmail、GitHub 变化
  • Free 用户可创建最多 3 个任务。
原帖 ↗
OpenAIDevs@OpenAIDevs397 likes
  • OpenAI Developers 称 ChatGPT 浏览器扩展支持更多浏览器。
  • 用户可把已打开标签页带入任务,让 Codex 基于当前浏览上下文工作。
James Sun

被引帖称扩展已支持 Edge、Brave、Opera 和 Vivaldi,并可把标签页上下文交给 ChatGPT Desktop 任务。

原帖 ↗
ChromiumDev@ChromiumDev88 likes
  • Chromium Dev 宣传 OpenAI WebMCP Challenge。
  • 卡片写明项目提交截止到 2026 年 9 月 3 日下午 5 点 PT,引用帖称奖池为 3.5 万美元。
OpenAI Developers

OpenAI Developers 称该活动与 Chromium、Cloudflare、Shopify、Vercel、Render 和 Netlify 合作,周期为 10 天。

原帖 ↗
Google Antigravity@antigravity123 likes
  • Google Antigravity 账号称 Antigravity 已可在 Apple Xcode 内使用。
  • 入口是 Xcode 27 beta 6 或更新版本的 Intelligence 设置面板。
Google Antigravity
  • 被引旧帖说明 Antigravity IDE 扩展此前已支持 VS Code
  • Visual Studio
  • Zed 和 JetBrains,作为本次 Xcode 接入背景。
原帖 ↗
OpenRouter@OpenRouter66 likes
  • OpenRouter 宣布 Makora 成为新的推理提供方。
  • 首批模型包括 DeepSeek V4 Flash、GLM 5.2 FP8、GLM 5.2 NVFP4 和 Kimi K3。
原帖 ↗
更多讨论6 条
_catwu@_catwu278 likes
  • Anthropic 员工转述 Claude 记忆更新:Chat 与 Claude Cowork 现在使用同一份 memory。
  • 用户只需让 Claude 记住一次,跨界面都可带上上下文。
Claude

Claude 官方称聊天与 Cowork 已共用一份记忆,用户可以决定记忆内容,并让 Cowork 从已有项目上下文开始执行任务。

原帖 ↗
Gemini App@GeminiApp362 likes
  • Gemini App 官方称 macOS 版可用语音在任意窗口中听写、总结文件和改写文案。
  • 这是桌面AI助手向系统级输入层延伸的信号。
原帖 ↗
browser_use@browser_use431 likes
  • browser_use 发布 Windows Harness,定位为持久 Python harness。
  • 它覆盖 UI Automation、截图、原始输入、浏览器、文件、PowerShell 和虚拟光标。
原帖 ↗
Andrew Ng@AndrewYNg1370 likes
  • Andrew Ng 称 OpenWorker 新版面向安全工作流,内置代码漏洞、依赖供应链和云安全配置检查。
  • 它强调 harness 开源,便于审计代码与数据是否外传。
原帖 ↗
ClaudeCodeLog@ClaudeCodeLog10 likes
  • 非官方 Claude Code 变更日志称 2.1.246 包含 61 项 CLI 变化。
  • 亮点包括 dedicated agents 工具、Auto mode 规则页和更长安全检查超时。
原帖 ↗
dotey@dotey84 likes
  • dotey 体验豆包工作后认为办公 Agent 正在变成工作入口。
  • 长帖重点讨论飞书上下文、组织权限和流程改造,单一模型能力只是其中一层。
原帖 ↗