GPT-5.6-Cyber完成率
- OpenAI内部Advanced Cybersecurity Completion Rate
- GPT-5.6 Sol为1.5%,尚无独立复现
95.0%
本期核心变化集中在三条线上:高风险专用模型采用分级访问,AI 辅助科研开始提交可核验的形式化结果,开放权重智能体则继续压低本地部署门槛。
值得持续观察的不是单次发布声量,而是访问治理、第三方复核和消费硬件实测能否形成稳定证据。
Blue面向一般防御工作,Red面向获授权的漏洞研究、利用验证与安全测试
来源:OpenAI 8月10日公告极小模型若能可靠完成工具路由,可让手机、穿戴设备与低功耗硬件在离线状态处理基础智能体动作。
端侧开发者可测试本地工具调用与云端升级路由。产品团队仍需为低置信输出设置阈值、回退和权限限制。
以下内容仅作为追踪线索,不与已核验新闻等量呈现;正式文件、项目材料或独立复核出现后再升级。
社交雷达 · X 讨论
OpenAI发布GPT-5.6-Cyber,并扩展Daybreak计划,将前沿网络安全能力优先提供给受信任的防御者。
原帖 ↗Anthropic称未发布的Claude研究版未能证明黎曼猜想,但把满足猜想的黎曼ζ函数零点比例下界从41.6%提高到67.2%。
原帖 ↗Meta发布Muse Glimmer:一款面向本地常驻智能体工作流的30B开放权重模型,可在Mac或配备高性能GPU的PC运行,采用Apache 2.0许可。
原帖 ↗- Anthropic宣布Claude Sonnet 5的首发价格转为长期价格:每百万输入token 2美元
- 每百万输出token 10美元,8月31日后不再上调。
原帖 ↗- Kavak称每天最多唤醒20万个AI智能体,96%的交互和95%的交易由智能体处理
- 团队投入在评测上的工程时间、token和资金与构建智能体大致相当。
原帖 ↗Qwen发布Qwen-MM-Plugins,把图像、视频、文档、视频编辑与3D/CAD能力接入智能体框架,目标是让现有agent harness具备原生多模态能力。
原帖 ↗更多讨论4 条
Chromium开发者展示如何把浏览器内置Prompt API接入Vercel AI SDK,在客户端模型上构建AI Web应用。
原帖 ↗MiniMax称Redis作者antirez为Mac编写了H3的Metal推理引擎,并将开源权重带来的第三方硬件适配视为开放生态价值。
原帖 ↗OpenAI开发者团队展示Build Week成果:来自各地的参与者使用Codex把想法做成可运行项目,内容聚焦真实构建案例。
原帖 ↗- 集邦咨询预测,2026年中国国产芯片将占国内高端AI芯片市场近90%,英伟达与AMD等约占10%
- 该市场总出货量预计增长超过83%。
原帖 ↗