2026年7月25日 · 周六
Opus 5 同价增效,AI 伸向物理世界
- 过去 24 小时,Anthropic 推出 Claude Opus 5,并把基础价格维持在 Opus 4.8 水平。
- Drone-Bench 同日把模型能力测试推进到室内无人机定位与跟飞代码。
本期判断
竞争焦点正从单次回答分数转向可持续执行:既要验证特定任务的成本优势,也要为模型进入物理世界和开放生态提前划定责任边界。
本期速览
3 条01Opus 5 主打同价增效
- 基础价格维持每百万输入 5 美元。
02重建仍卡住无人机任务链
- Drone-Bench 测量模型编写 5 项任务代码。
03开放权重进入政策联署
- 25 家企业和机构反对过早施加广泛限制。
On this page
本期导航
Deep Dives
本期重点 · 深度报告
Key Numbers
每百万 token 5 美元
Fast mode 速度
相对 Opus 5 默认模式;Claude Platform 价格为基础价两倍。
来源:Anthropic约 2.5 倍
15 个
25 家
V8.2
Briefs
快讯 · 已核验与追踪
行业动态重要度 3/5中置信官方源
Claude Code 系统提示词删减超 80%
- Anthropic 7 月 24 日披露,面向 Opus 5
- Fable 5 等新模型的 Claude Code 系统提示词删减超过 80%,其内部编码评测未见可测损失。
要点拆解展开
Why
Agent 的上下文成本、规则冲突与工具定义膨胀已经成为工程瓶颈,Anthropic 给出了一次真实生产系统的减法样本。
Impact
Agent 团队可审计重复规则并采用渐进披露。高风险约束不能因追求短提示词而删除,仍需独立验证。
Numbers
- 系统提示词删减
- 超过 80%针对 Claude Code 的新一代模型配置;不是所有上下文 token 的降幅。Claude Blog
- 官方阅读时间
- 5 分钟Claude Blog 页面给出的文章阅读时间。Claude Blog
早报判断
- Anthropic 把稳定规则留在系统层、任务知识改为按需载入,并把更多局部判断交给模型。
- 结论目前只来自 Anthropic 自有产品与内部评测。
接下来看
- 精简规则能否在多语言大型仓库中保持质量?
- claude doctor 会如何区分冗余规则与安全硬约束?
模型发布重要度 3/5中置信官方源
Midjourney 发布 V8.2 图像模型
Midjourney 7 月 24 日上线 V8.2,称更新聚焦美学、图像质量与个性化理解,并扩大创建个性化档案时的候选图池。
要点拆解展开
Why
生成图像产品的差异化越来越依赖个人审美记忆,而非单次提示词对齐。
Impact
创作者可对比新旧个性化档案。团队采购应观察稳定性、返工次数和品牌风格一致性。
Numbers
- 版本
- V8.27 月 24 日上线的 Midjourney 图像模型版本。Midjourney
早报判断
- 这次更新没有公布通用基准,而是押注主观质量和长期偏好学习。
- 它更适合通过用户盲测与返工率验证,不能只凭官方形容词判断提升幅度。
接下来看
- 新旧个性化档案在盲测中的偏好胜率是多少?
- 低质量随机样本的发生率是否显著下降?
Developing
发展中 · 待进一步核验
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
产品上新重要度 3/5低置信发展中
官方单源|Grok 插件进入 Google Workspace
- xAI 7 月 24 日宣布 Grok for Google Workspace 插件,覆盖 Sheets、Slides 与 Docs。
- 当前可核验信息主要来自 xAI 官方页面和账号。
要点拆解展开
Why
统一插件覆盖表格、演示与文档,意味着 xAI 开始争夺跨办公载体的连续任务入口。
Impact
Google Workspace 用户可关注安装资格与权限请求。企业管理员应在启用前核对数据处理和审计能力。
Numbers
- 覆盖应用
- 3 个官方列出 Sheets、Slides 与 Docs。xAI
早报判断
- xAI 正把 Grok 从独立聊天入口推入办公文档工作流,但权限范围、地区可用性与企业数据条款尚缺少充分公开细节。
- 现阶段更适合记录为产品信号。
接下来看
- 插件的地区、套餐和管理员控制范围何时公开?
- 跨应用任务是否共享上下文与审计记录?
社交雷达 · X 讨论
X 产品负责人称,平台已移除 4.2 万个用聊天机器人自动回复的账号,并把无人参与的程序化互动视为违背真实性目标。
原帖 ↗- Cursor 已接入 Claude Opus 5。
- 默认 effort 下 CursorBench 得分为 66.7,对照 Fable 5 的 66.5
- Cursor 称价格为 Fable 5 的一半,并支持零数据保留。
原帖 ↗- ARC Prize 报告 Claude Opus 5 在 ARC-AGI-3 获得 30.2%,高于此前 GPT-5.6 Sol(Max)的 7.8%。
- 该数字只适用于 ARC-AGI-3,不代表整体能力提高近四倍。
原帖 ↗- Celeris 发布扩散式语言模型 celeris-1,厂商自报 p50 延迟 157 毫秒
- MMLU-Pro 76%
- 吞吐量每秒 1280 token。
- 结果尚待独立复现。
原帖 ↗Hermes Agent 新增 Docker 沙箱凭证防火墙:真实密钥不进入沙箱,代理只在网络边界把替代 token 换成真实密钥,以限制泄露凭证的可复用范围。
原帖 ↗- GenReasoning 推出 BackSearch,让模型检索指定历史日期的网页快照。
- 首批只开放 2026 年新闻索引的一小部分,面向预测回测、强化学习环境和基准复现。
原帖 ↗更多讨论5 条
- Ollama 称开放模型云端需求激增,并为下周的大模型扩容。
- 为维持基础设施速度,Max 暂停接受新订阅
- 现有 Max 用户不受影响,Pro 仍可订阅。
原帖 ↗- Artificial Analysis 称 Opus 5(max)在 AA-Briefcase 获 1720 Elo,比 Fable 5 高 146 分
- 单任务成本 17.79 美元,低约 20%,但平均耗时 36.2 分钟。
原帖 ↗- Fly.io 宣布转向“面向智能体的计算机”,称已有 8000 家客户构建 Agent 产品,并获得 2500 万美元新融资。
- 前 Docker CEO Scott Johnston 接任 CEO。
原帖 ↗- Perplexity 发布 CLI,使编程智能体可直接使用其网页搜索。
- 官方给出的安装方式是让 Agent 读取指定链接并安装对应 skill。
原帖 ↗- 一则整理指出,Anthropic 为 Claude 5 代模型删去超过 80% 的 Claude Code 系统提示词。
- 建议把仓库说明集中在易踩坑信息,并用按需加载减少重复规则。
原帖 ↗