Sonnet 5 促销价(每百万 token)
- Anthropic 官方,2026-08-31 前限时
- 之后恢复 $3/$15
- 对照 Opus 4.8 的 $5/$25
过去 24 小时,前沿厂商罕见同日四发——Anthropic 把 Sonnet 5 与 Claude Science 同步推出,OpenAI 同期发布 GeneBench-Pro 基准与 Core Dump Epidemiology 工程反思,Google DeepMind 双发 Nano Banana 2 Lite 与 Gemini Omni Flash,每一条都在改写『谁有模型 ≠ 谁赢了』的格局。
Sonnet 5 用促销价强推订阅档默认模型——$2/$10 百万 token 的限时价(至 8-31)把 Free/Pro 用户一夜推到 Sonnet 5,但 Artificial Analysis 的 Intelligence Index 仅 53 分(scaling01 测算去掉促销后比 Opus 4.8 Max 还贵 1.2x、比 DeepSeek-V4-Pro 贵 57x),Anthropic 在用利润率换获客节奏;Claude Science 把科研工具栈整合为单一入口——60+ 科研连接器、本地/HPC/Modal 算力调度、reviewer agent 自校,这是 OpenAI Deep Research / Devin Fusion 的『agent harness 化』范式推进到科研垂直,reviewer agent 自校引用与计算是真正的护城河;OpenAI GeneBench-Pro 把『科学智能体』评估从答题推向研究决策——129 道合成题 + 已知因果结构绕开训练污染与作者偏好,高调对比开源模型的科学推理落后;DeepMind 双发把生成式媒体价格砍到 $0.034/图与 $0.10/秒——生成式媒体从『按次付费的稀缺品』推向『按 token 计价的基础设施』。
每一条都在指向同一个判断:前沿模型的『分数之争』让位于『工作流之争』。Sonnet 5 拼促销价与生态订阅,Claude Science 拼科研场景整合,GeneBench-Pro 拼科学推理评估话语权,DeepMind 拼生成式媒体价格带——基础模型层的同质化竞争已让位,前沿厂商正式进入『拼生态、拼场景、拼工作流嵌入』的阶段。同时 Mythos 出口管制松动信号再起(6-30 据传 Fable 5 解除管制)、吴恩达系统阐述 Loop Engineering 三 Loop 框架(工程师部分承担 PM 角色)、Nous Hermes Agent 网页抓取 60x、SGLang DSpark 预测解码 1.81x 加速、GLM 5.2 / LongCat-2.0 在设计与物理任务上击败 Opus 4.8——四条暗线在 7-01 同日加速,是 2026 H2 AI 竞争主轴从模型层转向工作流层的结构性拐点。
吴恩达用框架化语言把过去一年 Claude Code / Codex / Cursor 用户的实践总结为『Loop Engineering』,为『工程师转 PM』的现象提供了可传播的命名,是工程师群体重新理解自身角色的关键参考框架。
Hermes Agent 是当前少数提供『速度 + 成本 + 多 agent 看板』三角能力的开源 agent,且网页抓取 60x 是少见的『工具调用层』优化案例,对所有自建 agent harness 的团队有借鉴价值。
Brain2Qwerty v2 是『首个能从原始 MEG 端到端实时解码整句的非侵入式 BCI』,开源代码 + 数据集意味着可复现性,与 OpenAI 的闭源路线形成对比。
arXiv / HF 当日最高分(120)的 agent 安全论文,在 harness 化产品大爆发的当口提出『克制能力』缺口,可能成为下半年 agent 安全的核心理论文献。
这是 6-28 『开源追平闭源』叙事的第一次具体场景验证,GLM 5.2 在设计任务上击败 Opus 4.8 是『能力可比 + 价格仅 1/5』的双重背书。
GitHub Trending 是观察 agent 工程范式分化的最直接指标,本日高分候选共同揭示『agent 经济 + agent 评估 + 本地优先』三个趋势。
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
出口管制是前沿 AI 国家安全框架的核心抓手,Fable 5 据传解除是『双轨制』政策的第一个可观察松动信号,直接关系到 Anthropic 的全球商业化节奏与亚洲厂商的窗口期。
Mistral 是欧洲唯一有持续模型发布的厂商,Leanstral 1.5 是观察其『前沿 vs 性价比』定位选择的关键产品。
若属实,这是 Anthropic 在『地域合规』上第一次被公开指控使用隐蔽检测代码,直接影响中国用户对 Claude Code 的信任与代理生态走向。
社交雷达 · X 讨论
- Google 在 Gemini API 与 AI Studio 推出两款生成式媒体模型:Nano Banana 2 Lite(单图 <4 秒
- $0.034/1K image)与 Gemini Omni Flash(视频编辑 SOTA,$0.10/秒与 Veo 3.1 Fast 同价)。
原帖 ↗- Anthropic 正式发布 Claude Sonnet 5:迄今最 agentic 的 Sonnet,推理/工具/编程/知识工作全面升级,性能逼近 Opus 4.8 但价格更低。
- 限时优惠(至 8-31)输入 $2/M token、输出 $10/M token。
- Claude Code、Free/Pro 用户默认模型,已集成 GitHub Copilot、Notion、Cursor、Devin。
原帖 ↗- Claude Sonnet 5 评测:Intelligence Index 53 分(max effort),比 Sonnet 4.6 高 6 分,与 GPT-5.5(high reasoning)同分,落后 Opus 4.7/4.8,榜上排第 5。
- 提醒:去掉促销定价后 Sonnet 5 单任务成本反而高于 Opus 4.8。
原帖 ↗- 成本对比:Sonnet 5 比 Opus 4.8 Max 贵 1.2x
- 比 GPT-5.5-xhigh 贵 2x
- 比 GLM-5.2 贵 5x
- 比 Kimi-K2.6 贵 7x
原帖 ↗独立确认:Sonnet 5 在 Artificial Analysis Intelligence Index 上单任务成本『MORE than Opus 4.8』,呼应 ArtificialAnlys 的结论。
原帖 ↗- Sonnet 5 单 benchmark 全面输给 Opus 4.8,但仍推荐 Claude Code 的 Dynamic Workflows:/model Sonnet 5 + /effort Ultracode 让复杂任务跑动态工作流。
- 预判:Fable 5 解封后会成为『超级智能顾问』,Sonnet 5 充当『快速实现者』。
原帖 ↗更多讨论14 条
- 据 POLITICO:美国商务部预计今晚解除对 Anthropic 模型 Fable 的出口管制。
- 后续 ZOOMER 也转发了同一消息。
原帖 ↗GLM-5.2 成为 Z.ai 在 Hugging Face 历史上最受好评的模型。
原帖 ↗用 /design 在 Command Code 跑 SaaS、作品集、仪表盘、建筑站、宠物店、房地产等设计任务,GLM 5.2 在几乎所有类目上都击败 Opus 4.8。
原帖 ↗- LongCat 在真实物理任务(HTML5 canvas 写物理模拟:加农炮拆墙、保龄球击瓶、龙卷风卷物)上对标 Opus 4.8 和 GPT 5.5:LongCat 18,015 tokens / $0.00,Opus 4.8 18,872 / $0.48,GPT 5.5 32,588 / $0.98,GLM 5.2 31,062 / $0.09。
- LongCat 物理效果优于 Opus 4.8 和 GLM 5.2(无穿模/掉落),细节与渲染与 GPT 5.5 持平。
原帖 ↗- SGLang DSpark 预测解码实测(PR29538):多场景基本能预测 3 个 token(数学 3.37 / 对话 3.0 / 代码 3.52)。
- 1K prompt 加速比 1.81x,8 卡 B200 速度从 164 token/s 拉到 297 token/s。
- TPOT 仅 2.9-5.2ms。
原帖 ↗Qwen3.6 27B 把自家的 35B A3B 吊着打。
原帖 ↗- BREAKING 转载:Anthropic 在 Claude Code 中嵌入针对中国用户的隐蔽检测/类似间谍代码。
- 当用户使用非官方代理时,会悄悄收集时区、代理、中国 AI 实验室域名等信息,并通过修改日期格式等隐写手法把指纹写进 prompt 发回后端。
原帖 ↗- 反驳 Anthropic CEO Dario 关于『开源』的言论:Dario 认为 AI 圈『开源』多数只是开放权重,免费不成立。
- 反驳称『开放权重 ≠ 免费』判断对了一半,但忽略开放权重带来的私有部署、可控性、可审计性、生态创新这些价值
- 当模型变成基础设施,要在『能力 / 成本 / 控制权』之间重新排序。
原帖 ↗- 日常 CRUD 任务下 Claude Code、Cursor、Codex、OpenCode 已在智能和特性矩阵上『同质化收敛』,互相可换。
- 唯一严重掉队的是 Google 的 Antigravity:API 稳定性(Thinking Token 冲突导致 length 截断)和软件工程成熟度(无响应死锁
- 五子组件架构分裂)都明显脱节。
原帖 ↗- 新 Codex 工作流:1) Codex 支持一个 thread 管理其他 thread
- 2) 可创建 heartbeat 持续做某事或 check-in
- 3) 用 /goal 让 agent 跑完所有工作。
原帖 ↗用 Multi-Agent 自动跑完整个 CVE 挖掘流程:从挑项目、审代码、验证漏洞到生成可直接提交的漏洞报告。
原帖 ↗- 传言:谷歌询问美国政府是否需要保留 Gemini 3.5 Pro,得到的回答是『不需要』
- 美国政府要求谷歌不在美国发布 Gemini 3.5 Pro,只在美国以外地区发布。
原帖 ↗- 用 Claude Code 或 Codex 出的 dashboard 一眼就 AI 味,问题两类:sameness(同一套三模板轮转)
- sloppy detail(emoji 当 icon
- 按钮没 hover 状态
原帖 ↗- Gemini Omni Flash 在 Video Arena 视频编辑能力榜排第 2(1347 分),比第二名 HappyHorse 1.0(1308)高近 40 分
- 该榜只评了 7 个模型。
原帖 ↗