安全门槛上移,交付边界同步收紧
- OpenAI 因 Astra 的网络能力初评升级内部安全控制,但尚未确认模型达到 Critical 门槛。
- Seedance 2.5 API 与 Managed Deep Agents 公测把既有能力推到托管交付。
今天的共同变化不是更多能力演示,而是厂商开始公开能力进入生产前必须附带的控制面:安全隔离、区域限制、成本路由与精确基准。
本期速览
3 条01Astra触发更高安全控制
- OpenAI目前不能排除达到Critical门槛。
02视频API从预告变为上线
- Seedance 2.5 API上线火山方舟。
03成本治理拒绝合成降幅
- Databricks未宣称总支出下降70%。
编辑总结
Astra 的初步评估把安全控制提前到模型发布之前。Seedance 与 Managed Deep Agents 则展示另一面:能力进入 API 和托管运行时后,区域、权限、计费与文档边界会成为产品的一部分。
成本和性能数字同样需要带着分母阅读。Databricks 没有公布整体支出下降 70%,HPC-Ops 的 48.8% 也只属于特定硬件、模型与批量配置。
本期导航
本期重点 · 深度报告
Key Numbers
平均任务成本降幅
Databricks内部Smart Router结果,质量大致匹配工作模型集合中最昂贵模型。
来源:Databricks特定配置TPOT降幅
Hy3-FP8、8×H20、batch 32下相对SGLang默认实现。
来源:LMSYS快讯 · 已核验与追踪
HPC-Ops披露特定配置TPOT最高降48.8%
- LMSYS于北京时间8月8日发布联合技术稿,披露HPC-Ops Attention与MoE在Hy3-FP8、8×H20、batch 32测试中,使TPOT相对SGLang默认实现最高降低48.8%。
- 五个相关PR均在7月合入。
要点拆解展开
推理框架中的注意力、路由与MoE算子会直接影响服务延迟和GPU利用率,但局部最优很容易被脱离配置传播。
- 使用H20与SGLang main的团队可复测后端组合。
- 其他GPU或模型团队不应预设同等收益,并要确认稳定版是否已包含全部能力。
- 最高TPOT降幅
- 48.8%Hy3-FP8、8×H20、TP8、FP8 KV cache、8K输入/4K输出、batch 32;Attention与MoE联合启用。LMSYS
- 相关上游PR
- 5个Attention、Router GEMM与MoE相关PR均在7月合入main。SGLang GitHub
- 当天新增是完整设计与基准披露,代码合入发生在7月。
- 48.8%属于联合后端的端到端结果
- 只有固定模型、硬件、精度、序列长度、批量和默认后端基线后才有可比意义。
- 其他模型与batch下的复现结果。
- 非Hopper GPU的支持计划。
发展中 · 待进一步核验
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
官方X单源|Claude Code预告默认Auto mode
- Anthropic开发者账号称,Claude Code将从8月14日起把Auto mode设为Pro、Max与Team用户的默认权限模式。
- 官方X单源给出的危险命令识别率为89%,产品文档尚待复核。
要点拆解展开
默认权限模式会影响大量终端操作的审批路径。一次错误放行可能比一次错误拒绝更昂贵,因此误报与漏报都需要线上数据。
- Pro、Max与Team用户需要在8月14日前检查组织策略与回退方式。
- 安全团队不应仅凭识别率取消外部沙箱、最小权限与审计。
- 默认切换日期
- 8月14日官方X称从该日起面向Pro、Max与Team用户切换默认模式。ClaudeDevs官方X
- 危险命令识别率
- 89%官方测试口径;与人工审批14%的比较方法尚未见文档。ClaudeDevs官方X
- 这项变化把逐条人工审批转向分类器预审,减少交互摩擦的同时扩大了自动决策责任。
- 89%与人工审批14%来自官方自测,不能等同于真实环境的安全覆盖率。
- 产品文档是否确认默认切换范围与回退方式。
- 分类器的误报率、漏报率和测试集定义。
社交雷达 · X 讨论
- Anthropic 开发者账号宣布:从 8 月 14 日起,Claude Code 将把 Auto mode 设为 Pro
- Max 和 Team 用户的默认权限模式。
- 该模式用独立分类器审查 shell 命令与操作
- 官方测试中,它识别出 89% 的危险命令,人工审批识别出 14%。
原帖 ↗- Anthropic 社区团队成员转引 Claude Code 新功能:不同会话现在可以互发消息,用户无需在另一个会话重新解释上下文。
- 传递的是摘要,不是完整历史或文件
- 接收会话可以在任务进行中继续处理。
原帖 ↗- OpenAI 联合创始人 Greg Brockman 表示,尚未发布的下一代模型 Astra 在评估中显示出智能体编程和网络安全能力的显著提升。
- 团队仍在做安全与防护工作,目标是未来广泛提供,并让防守方获得其高级网络能力
- 这不是发布公告。
原帖 ↗- Elon Musk 宣布 Grok Build V1.0 已发布。
- 配套页面称其由 Grok 4.5 驱动,新增原生子代理视图、Plan Mode 集成、鼠标支持和全屏终端界面。
原帖 ↗- MiniMax 发布 MiniMax Code 2.0,并称产品已基于开源 Pi Agent 框架重构,重点改善日常对话
- 办公工作和长时间复杂任务的流畅性与可靠性。
原帖 ↗- Agent Arena 按真实任务统计推理与输出 token 后观察到:Opus 系列从 4.7 到 5 性能提升,但单任务 token 用量由约 8,500 增至约 21,000
- GPT-5.5 到 GPT-5.6-Sol 则由约 10,000 降至约 8,000,同时 Net Improvement 提升约 1.5 个百分点。
原帖 ↗更多讨论4 条
- ARC Prize 公布 DeepSeek V4 Flash 的已验证成绩:ARC-AGI-2 为 61.4%,每个任务成本 0.04 美元
- ARC-AGI-1 为 89.0%,每个任务成本 0.02 美元。
- 主办方据此称它刷新了成本—性能帕累托前沿。
原帖 ↗- Ollama 宣布 DeepSeek-V4-Flash-0731 已完成部署,成为其云端 deepseek-v4-flash 的新默认版本。
- 官方给出的云端速度是每秒输出 120+ token,并称美国和欧洲托管采用零数据保留
- Pro 与 Max 套餐面向长时间编码会话提供较高用量。
原帖 ↗- 小互转引 Higgsfield 官方公告:Seedance 2.5 已在 Higgsfield 面向全球上线,限时 33 天免 credit 使用。
- 官方宣称可生成最长 30 秒的视频,并强调连续性、物理真实感、CGI 与视频编辑能力
- 这是一项限时平台促销。
原帖 ↗- Vitalik Buterin 评价 MiniMax H3 是他见过的首个超越 HunyuanVideo 1.5 的开放视频模型,并把它视为视频模型重新走向开放的重要一步。
- 他称示例在自己的 AMD 笔记本上约 30 分钟生成
- 这是个人实测与判断,不是标准化基准。
原帖 ↗