2026年7月28日 · 周二

开放权重立场澄清,安全模型走向分层

  • Anthropic CEO称公司过去没有、目前也没有主张全面禁止开放权重模型。
  • Microsoft发布首款网络安全模型,官方称小模型最多处理九成任务。
本期判断
  • 今天的共同变化是风险与能力开始被拆成可执行层级。
  • 监管按能力测试,安全系统按任务路由,视觉评测按原子能力诊断。

本期速览

3 条
  1. 01Anthropic澄清开放权重立场
    • 过去没有且目前也不主张全面禁令
  2. 02微软称小模型最多处理九成任务
    • MDASH系统得分96%,高出Mythos 12点
  3. 03Kimi把视觉评测拆成十项能力
    • 3000道题覆盖10类原子感知能力

编辑总结

Anthropic把开放权重争论拉回能力门槛。Microsoft用专用小模型与任务路由回答高频安全Agent的成本问题。Kimi的新评测进一步把多模态总分拆成可定位的感知失败。

三条主线共同指向更细的治理与工程单位。具体能力是否越过风险阈值、任务是否值得调用大模型、错误发生在感知还是推理,正在成为新的决策问题。

今天的关键数字仍带边界。Microsoft的96%和50%均是自家MDASH口径;Kimi的59.7%榜首只覆盖其选取的16款模型;GPT-Live套餐扩围目前只有OpenAI官方X单源公告。

On this page

本期导航

Deep Dives

本期重点 · 深度报告

3 篇

Key Numbers

GPT-Live新增套餐范围

Edu、Business与Enterprise;OpenAI官方X称已全球开放,尚缺产品文档交叉核验

来源:OpenAI官方X →
3类
Briefs

快讯 · 已核验与追踪

1 条
观点观察重要度 2/5高置信官方源

GitHub给出Copilot Harness四阶段工作流

GitHub 7月27日发布实践文章,把Copilot开发流程拆成原型、计划、实现与审查四阶段,并称CLI、Copilot app、VS Code等入口正集中到同一Harness。

要点拆解展开
Why

官方把多个入口归到同一Harness心智模型,有助于团队建立跨工具一致的开发规范。

Impact

开发团队可将四阶段拆成审查门。工具厂商需要证明Harness如何保存上下文、计划和复核证据。

Numbers
工作流阶段
4个原型、计划、实现、审查;属于实践文章框架,不是产品性能指标GitHub Blog
早报判断
  • 这篇文章给出官方工作方法,并未发布Copilot新功能。
  • 它把Agent使用从提示词技巧推进到可重复流程,证据仍主要来自作者经验而非团队效率实验。
接下来看
  • GitHub是否发布该工作流的团队效率或缺陷率数据
  • 不同Copilot入口能否共享完整计划与审查上下文
#GitHub Copilot#Harness#开发工作流
Developing

发展中 · 待进一步核验

1 条

以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。

产品上新重要度 3/5低置信发展中

官方单源|GPT-Live扩至三类企业与教育套餐

  • OpenAI 7月27日在官方X称,ChatGPT Voice中的GPT-Live现已面向全球Edu
  • Business和Enterprise套餐开放。
  • 当前只见官方社交账号公告,产品文档尚未交叉核验。
要点拆解展开
Why

GPT-Live从消费者滚动发布扩到教育与企业套餐,说明实时语音能力开始进入组织采购和管理场景。

Impact

教育机构与企业客户获得新的语音入口。管理员仍需等待额度、数据保留和地区可用性说明。

Numbers
新增套餐范围
3类Edu、Business与Enterprise;官方称全球开放,尚缺非X产品文档核验OpenAI官方X
早报判断
  • 本次变化是可用范围扩展,模型本身并非再次发布。
  • 企业语音入口继续扩围,但具体地区、语言、额度和管理控制仍需产品文档确认。
接下来看
  • OpenAI帮助中心是否补充三类套餐的地区与语言范围
  • 企业管理员是否获得语音数据保留与审计控制
Social Radar

社交雷达 · X 讨论

6 条
cursor_ai@cursor_ai3150 likes
  • Cursor 已接入 Kimi K3。
  • 官方称它在 CursorBench 上接近前沿水平,并通过 Fireworks
  • Together 和 Baseten 提供美国境内推理,同时支持零数据保留。
原帖 ↗
a16z@a16z1263 likes
  • a16z 总结企业 AI 销售的两种打法:Lighthouse 先拿少数标杆客户建立可信度,Landgrab 则依靠经济账和速度尽可能多签客户。
  • 文章认为,当买方已理解问题且选错产品不会危及职位时,追逐大客户 Logo 反而可能分散注意力。
原帖 ↗
arena@arena565 likes
  • Arena 更新榜单:Claude Opus 5 Max reasoning 暂列 Frontend Code Arena 与开启 factuality 的 Text Arena 第一
  • 默认 high reasoning 版本分列前端第三、文本第二。
  • 官方强调 Max 分数仍属初步结果,后续还要观察收敛。
原帖 ↗
zenorocha@zenorocha528 likes
  • Resend 创始人披露,面向智能体提供机器可读 Markdown 定价信息的端点,过去 14 天收到 129,159 次请求。
  • 他将这一增量概括为“智能体喜欢 Markdown”,为网站提供内容协商和纯文本入口补了一组实际使用数据。
Zeno Rocha

今年 3 月发布时,他解释网页里的 JavaScript 滑块会让智能体难以解析定价,因此增加了机器可读页面和 Accept: text/markdown 内容协商。

原帖 ↗
shengkun_ye@shengkun_ye461 likes
  • OctenAI 与 monid.ai 发布面向智能体的搜索引擎。
  • 团队自报 P50 延迟为 62 毫秒,对照 Exa 的 372 毫秒,因而宣称快约 6 倍
  • 这是发布方给出的基准,仍需独立复测。
原帖 ↗
RampLabs@RampLabs263 likes
  • Ramp Labs 开源 PorTAL,用共享任务表征支持跨模型 LoRA 适配。
  • 团队称当前覆盖范围已从混合注意力模型扩展到多模态系统,包括 Gemma 4 E2B
  • Mistral 7B 与 Thinky Machines 的 Inkling,并同步放出代码和 Hugging Face 模型。
原帖 ↗
更多讨论5 条
totheagi@totheagi225 likes
  • 一支部署团队称已让完整 Kimi K3 在 80 张 RTX 5090 上运行:首日未调优的单流速度为每秒 20 token,使用官方 MXFP4 权重
  • GDDR7 显存
  • 普通以太网且不依赖 HBM。
原帖 ↗
rauchg@rauchg199 likes
  • Vercel CEO 引用最新 DeepsecBench 称:Grok 4.5 在该网络安全漏洞发现基准的前十模型中性价比最佳
  • 成本分别约为 Sol、Opus 5、Kimi K3 的十分之一、5.7 分之一和 2.2 分之一
  • 性能接近 Kimi
Vercel
  • Vercel 发布 DeepsecBench,用准确率、成本和速度衡量模型发现代码安全漏洞的能力
  • 首批结果中 GPT-5.6 Sol 得分最高,Kimi K3 以五分之一成本取得约一半最高分,Grok 4.5 在前十名中得分成本比最佳。
原帖 ↗
calcsam@calcsam188 likes
  • Mastra 联合创始人发布 Mastra Factory,把软件开发组织成多层智能体循环,目标是让智能体从 issue 一路推进到生产环境
  • 项目可通过 npm create factory 启动。
原帖 ↗
arena@arena113 likes
  • Arena 将 GPT-5.6 Terra 与 Luna 的 xHigh 版本加入 Agent Arena,当前分别排第 15 和第 17。
  • 官方称两者从 Low 提升到 Medium reasoning 时增益最大
  • Luna xHigh 净提升 3.3%,略高于 Terra Medium 的 3.1%,显示较便宜模型增加推理预算可能超过更贵模型的低档配置。
原帖 ↗
xiaohu@xiaohu29 likes
  • 小互转述 SSI 官方公告:SSI 与 NVIDIA 建立长期战略合作,NVIDIA 将作出“数额可观”的投资
  • SSI 表示,这笔投入将使其未来 12 个月的计算能力扩大到 10 倍。
  • 公告未披露具体金额。
Safe Superintelligence Inc.
  • SSI 宣布与 NVIDIA 建立长期战略合作。
  • NVIDIA 的数额可观投资将使 SSI 在未来 12 个月把计算能力扩大到 10 倍
原帖 ↗