2026年7月28日 · 周二
开放权重立场澄清,安全模型走向分层
- Anthropic CEO称公司过去没有、目前也没有主张全面禁止开放权重模型。
- Microsoft发布首款网络安全模型,官方称小模型最多处理九成任务。
本期判断
- 今天的共同变化是风险与能力开始被拆成可执行层级。
- 监管按能力测试,安全系统按任务路由,视觉评测按原子能力诊断。
本期速览
3 条01Anthropic澄清开放权重立场
- 过去没有且目前也不主张全面禁令
02微软称小模型最多处理九成任务
- MDASH系统得分96%,高出Mythos 12点
03Kimi把视觉评测拆成十项能力
- 3000道题覆盖10类原子感知能力
编辑总结
Anthropic把开放权重争论拉回能力门槛。Microsoft用专用小模型与任务路由回答高频安全Agent的成本问题。Kimi的新评测进一步把多模态总分拆成可定位的感知失败。
三条主线共同指向更细的治理与工程单位。具体能力是否越过风险阈值、任务是否值得调用大模型、错误发生在感知还是推理,正在成为新的决策问题。
今天的关键数字仍带边界。Microsoft的96%和50%均是自家MDASH口径;Kimi的59.7%榜首只覆盖其选取的16款模型;GPT-Live套餐扩围目前只有OpenAI官方X单源公告。
On this page
本期导航
Deep Dives
本期重点 · 深度报告
Key Numbers
3项
最多90%
96%
3000道
3类
Briefs
快讯 · 已核验与追踪
观点观察重要度 2/5高置信官方源
GitHub给出Copilot Harness四阶段工作流
GitHub 7月27日发布实践文章,把Copilot开发流程拆成原型、计划、实现与审查四阶段,并称CLI、Copilot app、VS Code等入口正集中到同一Harness。
要点拆解展开
Why
官方把多个入口归到同一Harness心智模型,有助于团队建立跨工具一致的开发规范。
Impact
开发团队可将四阶段拆成审查门。工具厂商需要证明Harness如何保存上下文、计划和复核证据。
Numbers
- 工作流阶段
- 4个原型、计划、实现、审查;属于实践文章框架,不是产品性能指标GitHub Blog
早报判断
- 这篇文章给出官方工作方法,并未发布Copilot新功能。
- 它把Agent使用从提示词技巧推进到可重复流程,证据仍主要来自作者经验而非团队效率实验。
接下来看
- GitHub是否发布该工作流的团队效率或缺陷率数据
- 不同Copilot入口能否共享完整计划与审查上下文
Developing
发展中 · 待进一步核验
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
产品上新重要度 3/5低置信发展中
官方单源|GPT-Live扩至三类企业与教育套餐
- OpenAI 7月27日在官方X称,ChatGPT Voice中的GPT-Live现已面向全球Edu
- Business和Enterprise套餐开放。
- 当前只见官方社交账号公告,产品文档尚未交叉核验。
要点拆解展开
Why
GPT-Live从消费者滚动发布扩到教育与企业套餐,说明实时语音能力开始进入组织采购和管理场景。
Impact
教育机构与企业客户获得新的语音入口。管理员仍需等待额度、数据保留和地区可用性说明。
Numbers
- 新增套餐范围
- 3类Edu、Business与Enterprise;官方称全球开放,尚缺非X产品文档核验OpenAI官方X
早报判断
- 本次变化是可用范围扩展,模型本身并非再次发布。
- 企业语音入口继续扩围,但具体地区、语言、额度和管理控制仍需产品文档确认。
接下来看
- OpenAI帮助中心是否补充三类套餐的地区与语言范围
- 企业管理员是否获得语音数据保留与审计控制
社交雷达 · X 讨论
- Cursor 已接入 Kimi K3。
- 官方称它在 CursorBench 上接近前沿水平,并通过 Fireworks
- Together 和 Baseten 提供美国境内推理,同时支持零数据保留。
原帖 ↗- a16z 总结企业 AI 销售的两种打法:Lighthouse 先拿少数标杆客户建立可信度,Landgrab 则依靠经济账和速度尽可能多签客户。
- 文章认为,当买方已理解问题且选错产品不会危及职位时,追逐大客户 Logo 反而可能分散注意力。
原帖 ↗- Arena 更新榜单:Claude Opus 5 Max reasoning 暂列 Frontend Code Arena 与开启 factuality 的 Text Arena 第一
- 默认 high reasoning 版本分列前端第三、文本第二。
- 官方强调 Max 分数仍属初步结果,后续还要观察收敛。
原帖 ↗- Resend 创始人披露,面向智能体提供机器可读 Markdown 定价信息的端点,过去 14 天收到 129,159 次请求。
- 他将这一增量概括为“智能体喜欢 Markdown”,为网站提供内容协商和纯文本入口补了一组实际使用数据。
原帖 ↗- OctenAI 与 monid.ai 发布面向智能体的搜索引擎。
- 团队自报 P50 延迟为 62 毫秒,对照 Exa 的 372 毫秒,因而宣称快约 6 倍
- 这是发布方给出的基准,仍需独立复测。
原帖 ↗- Ramp Labs 开源 PorTAL,用共享任务表征支持跨模型 LoRA 适配。
- 团队称当前覆盖范围已从混合注意力模型扩展到多模态系统,包括 Gemma 4 E2B
- Mistral 7B 与 Thinky Machines 的 Inkling,并同步放出代码和 Hugging Face 模型。
原帖 ↗更多讨论5 条
- 一支部署团队称已让完整 Kimi K3 在 80 张 RTX 5090 上运行:首日未调优的单流速度为每秒 20 token,使用官方 MXFP4 权重
- GDDR7 显存
- 普通以太网且不依赖 HBM。
原帖 ↗- Vercel CEO 引用最新 DeepsecBench 称:Grok 4.5 在该网络安全漏洞发现基准的前十模型中性价比最佳
- 成本分别约为 Sol、Opus 5、Kimi K3 的十分之一、5.7 分之一和 2.2 分之一
- 性能接近 Kimi
原帖 ↗- Mastra 联合创始人发布 Mastra Factory,把软件开发组织成多层智能体循环,目标是让智能体从 issue 一路推进到生产环境
- 项目可通过 npm create factory 启动。
原帖 ↗- Arena 将 GPT-5.6 Terra 与 Luna 的 xHigh 版本加入 Agent Arena,当前分别排第 15 和第 17。
- 官方称两者从 Low 提升到 Medium reasoning 时增益最大
- Luna xHigh 净提升 3.3%,略高于 Terra Medium 的 3.1%,显示较便宜模型增加推理预算可能超过更贵模型的低档配置。
原帖 ↗- 小互转述 SSI 官方公告:SSI 与 NVIDIA 建立长期战略合作,NVIDIA 将作出“数额可观”的投资
- SSI 表示,这笔投入将使其未来 12 个月的计算能力扩大到 10 倍。
- 公告未披露具体金额。
原帖 ↗