2026年7月25日 · 周六

Opus 5 同价增效,AI 伸向物理世界

  • 过去 24 小时,Anthropic 推出 Claude Opus 5,并把基础价格维持在 Opus 4.8 水平。
  • Drone-Bench 同日把模型能力测试推进到室内无人机定位与跟飞代码。
本期判断

竞争焦点正从单次回答分数转向可持续执行:既要验证特定任务的成本优势,也要为模型进入物理世界和开放生态提前划定责任边界。

本期速览

3 条
  1. 01Opus 5 主打同价增效
    • 基础价格维持每百万输入 5 美元。
  2. 02重建仍卡住无人机任务链
    • Drone-Bench 测量模型编写 5 项任务代码。
  3. 03开放权重进入政策联署
    • 25 家企业和机构反对过早施加广泛限制。
On this page

本期导航

Deep Dives

本期重点 · 深度报告

3 篇

Key Numbers

Opus 5 输入价格

Anthropic 公布的基础输入价,与 Opus 4.8 相同;不是再次降价。

来源:Anthropic →
每百万 token 5 美元

Fast mode 速度

相对 Opus 5 默认模式;Claude Platform 价格为基础价两倍。

来源:Anthropic
约 2.5 倍

Midjourney 新版本

7 月 24 日上线,官方称更新聚焦图像质量与个性化。

来源:Midjourney →
V8.2
Briefs

快讯 · 已核验与追踪

2 条
行业动态重要度 3/5中置信官方源

Claude Code 系统提示词删减超 80%

  • Anthropic 7 月 24 日披露,面向 Opus 5
  • Fable 5 等新模型的 Claude Code 系统提示词删减超过 80%,其内部编码评测未见可测损失。
要点拆解展开
Why

Agent 的上下文成本、规则冲突与工具定义膨胀已经成为工程瓶颈,Anthropic 给出了一次真实生产系统的减法样本。

Impact

Agent 团队可审计重复规则并采用渐进披露。高风险约束不能因追求短提示词而删除,仍需独立验证。

Numbers
系统提示词删减
超过 80%针对 Claude Code 的新一代模型配置;不是所有上下文 token 的降幅。Claude Blog
官方阅读时间
5 分钟Claude Blog 页面给出的文章阅读时间。Claude Blog
早报判断
  • Anthropic 把稳定规则留在系统层、任务知识改为按需载入,并把更多局部判断交给模型。
  • 结论目前只来自 Anthropic 自有产品与内部评测。
接下来看
  • 精简规则能否在多语言大型仓库中保持质量?
  • claude doctor 会如何区分冗余规则与安全硬约束?
模型发布重要度 3/5中置信官方源

Midjourney 发布 V8.2 图像模型

Midjourney 7 月 24 日上线 V8.2,称更新聚焦美学、图像质量与个性化理解,并扩大创建个性化档案时的候选图池。

要点拆解展开
Why

生成图像产品的差异化越来越依赖个人审美记忆,而非单次提示词对齐。

Impact

创作者可对比新旧个性化档案。团队采购应观察稳定性、返工次数和品牌风格一致性。

Numbers
版本
V8.27 月 24 日上线的 Midjourney 图像模型版本。Midjourney
早报判断
  • 这次更新没有公布通用基准,而是押注主观质量和长期偏好学习。
  • 它更适合通过用户盲测与返工率验证,不能只凭官方形容词判断提升幅度。
接下来看
  • 新旧个性化档案在盲测中的偏好胜率是多少?
  • 低质量随机样本的发生率是否显著下降?
Developing

发展中 · 待进一步核验

1 条

以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。

产品上新重要度 3/5低置信发展中

官方单源|Grok 插件进入 Google Workspace

  • xAI 7 月 24 日宣布 Grok for Google Workspace 插件,覆盖 Sheets、Slides 与 Docs。
  • 当前可核验信息主要来自 xAI 官方页面和账号。
要点拆解展开
Why

统一插件覆盖表格、演示与文档,意味着 xAI 开始争夺跨办公载体的连续任务入口。

Impact

Google Workspace 用户可关注安装资格与权限请求。企业管理员应在启用前核对数据处理和审计能力。

Numbers
覆盖应用
3 个官方列出 Sheets、Slides 与 Docs。xAI
早报判断
  • xAI 正把 Grok 从独立聊天入口推入办公文档工作流,但权限范围、地区可用性与企业数据条款尚缺少充分公开细节。
  • 现阶段更适合记录为产品信号。
接下来看
  • 插件的地区、套餐和管理员控制范围何时公开?
  • 跨应用任务是否共享上下文与审计记录?
#xAI#Grok#Google Workspace#办公 Agent
Social Radar

社交雷达 · X 讨论

6 条
Nikita Bier@nikitabier22428 likes

X 产品负责人称,平台已移除 4.2 万个用聊天机器人自动回复的账号,并把无人参与的程序化互动视为违背真实性目标。

原帖 ↗
Cursor@cursor_ai4283 likes
  • Cursor 已接入 Claude Opus 5。
  • 默认 effort 下 CursorBench 得分为 66.7,对照 Fable 5 的 66.5
  • Cursor 称价格为 Fable 5 的一半,并支持零数据保留。
原帖 ↗
ARC Prize@arcprize1980 likes
  • ARC Prize 报告 Claude Opus 5 在 ARC-AGI-3 获得 30.2%,高于此前 GPT-5.6 Sol(Max)的 7.8%。
  • 该数字只适用于 ARC-AGI-3,不代表整体能力提高近四倍。
原帖 ↗
Celeris@Celeris_ai792 likes
  • Celeris 发布扩散式语言模型 celeris-1,厂商自报 p50 延迟 157 毫秒
  • MMLU-Pro 76%
  • 吞吐量每秒 1280 token。
  • 结果尚待独立复现。
原帖 ↗
Nous Research@NousResearch658 likes

Hermes Agent 新增 Docker 沙箱凭证防火墙:真实密钥不进入沙箱,代理只在网络边界把替代 token 换成真实密钥,以限制泄露凭证的可复用范围。

原帖 ↗
GenReasoning@GenReasoning650 likes
  • GenReasoning 推出 BackSearch,让模型检索指定历史日期的网页快照。
  • 首批只开放 2026 年新闻索引的一小部分,面向预测回测、强化学习环境和基准复现。
原帖 ↗
更多讨论5 条
Ollama@ollama527 likes
  • Ollama 称开放模型云端需求激增,并为下周的大模型扩容。
  • 为维持基础设施速度,Max 暂停接受新订阅
  • 现有 Max 用户不受影响,Pro 仍可订阅。
原帖 ↗
Artificial Analysis@ArtificialAnlys167 likes
  • Artificial Analysis 称 Opus 5(max)在 AA-Briefcase 获 1720 Elo,比 Fable 5 高 146 分
  • 单任务成本 17.79 美元,低约 20%,但平均耗时 36.2 分钟。
原帖 ↗
Fly.io@flydotio132 likes
  • Fly.io 宣布转向“面向智能体的计算机”,称已有 8000 家客户构建 Agent 产品,并获得 2500 万美元新融资。
  • 前 Docker CEO Scott Johnston 接任 CEO。
Fly.io

被引用帖子只提供公司博客短链,采集未拿到更多正文;关键信息以主帖摘要为准。

原帖 ↗
Perplexity Developers@perplexitydevs92 likes
  • Perplexity 发布 CLI,使编程智能体可直接使用其网页搜索。
  • 官方给出的安装方式是让 Agent 读取指定链接并安装对应 skill。
原帖 ↗
Voxyz@Voxyz_ai40 likes
  • 一则整理指出,Anthropic 为 Claude 5 代模型删去超过 80% 的 Claude Code 系统提示词。
  • 建议把仓库说明集中在易踩坑信息,并用按需加载减少重复规则。
Thariq Shihipar
  • Anthropic 工程师称,新模型配置删去约 80% 的 Claude Code 系统提示词,并总结系统提示词
  • skills 与仓库说明的写法。
原帖 ↗