#模型发布
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 模型发布2026-08-14 · 周五重要度 5/5深度报告 →
Google发布Gemini 3.7 Flash工作模型
Google在8月13日发布Gemini 3.7 Flash,定位为面向编码、知识工作、网页开发和智能体的工作模型;API引导价只持续到2026年底。
- Flash线的定位正在从便宜快模型转向日常代理工作模型。
- 半价促销结束后,编码、网页生成和企业流程里的单位成功任务成本会决定留存。
- 模型发布2026-08-13 · 周四重要度 3/5深度报告 →
DeepSeek V4 Pro API切至0813,变更日志缺席
DeepSeek官方API别名已映射到DeepSeek-V4-Pro-0813,价格页显示当前规格与单价;0813专属能力变更日志与官方新benchmark仍未发布。
- 此条价值在于版本映射与价格可见性,而非已证实的能力升级。
- 调用方应记录版本并回归测试
- 模型发布2026-08-13 · 周四重要度 5/5深度报告 →
Qwen首次开放Max级权重,2.4T模型进入可下载阶段
Qwen于8月12日开放Qwen3.8-2.4T-A95B权重与配置。模型卡列出2.4T总参数、95B激活参数和262,144 token原生上下文;仓库制品达4.89 TB。
- 开放Max级权重把前沿能力的可审计性和部署主权向研究机构与大型算力持有者推进了一步。
- 2.4T规模意味着许可和集群成本决定实际开放程度。
- 模型发布2026-08-13 · 周四重要度 5/5深度报告 →
xAI发布Grok 4.6,主攻长时智能体任务
xAI于8月12日发布Grok 4.6,重点从单轮能力推进到多步骤研究、代码库操作和视觉制品。第三方Artificial Analysis给出61分,与GPT-5.6 Sol同分;同分只限其九项综合指数。
- xAI把升级重点从单轮回答移到持续执行和可交付制品。
- 第三方指数提供了横向参照,但厂商与评测机构的结果仍需要真实长程任务复现。
- 模型发布2026-08-11 · 周二重要度 5/5深度报告 →
OpenAI推出GPT-5.6-Cyber,Daybreak分为两级
OpenAI于8月10日推出GPT-5.6-Cyber,并将Daybreak设为Blue与Red两级。官方内部评测称Red模型完成95.0%的高级网络安全请求,但这衡量的是是否响应,不是漏洞利用成功率。
- 能力提升与访问治理被绑定在同一产品结构中。
- Red通过身份验证、监控和法律声明放宽拒答
- 模型发布2026-07-25 · 周六重要度 3/5
Midjourney 发布 V8.2 图像模型
Midjourney 7 月 24 日上线 V8.2,称更新聚焦美学、图像质量与个性化理解,并扩大创建个性化档案时的候选图池。
- 这次更新没有公布通用基准,而是押注主观质量和长期偏好学习。
- 它更适合通过用户盲测与返工率验证,不能只凭官方形容词判断提升幅度。
- 模型发布2026-07-25 · 周六重要度 5/5深度报告 →
Anthropic 推出 Opus 5,维持 Opus 4.8 价格
Anthropic 7 月 24 日推出 Claude Opus 5,覆盖所有平台。基础价格为每百万输入 5 美元、输出 25 美元,与 Opus 4.8 相同。
- Opus 5 用既有 Opus 价位逼近更高档模型,把竞争推进到任务效率。
- 官方评测仍需第三方复现,尤其要把分数、每任务成本与耗时放在一起看。
- 模型发布2026-07-24 · 周五重要度 3/5
单源称|Grok 4.5 已覆盖网页、X 与移动端
Grok 官方账号于 7 月 23 日称 Grok 4.5 已在 grok.com、X、iOS 与 Android 应用可用,并称其为当前能力最强版本。xAI News 页面未提供对应公告。
- 跨端可用是明确增量,但官方推文没有模型卡、基准、价格或 API 状态。
- 现阶段只能确认消费端发布口径,不能外推出性能领先。
- 头条2026-06-28 · 周日重要度 5/5深度报告 →
OpenAI 放出 GPT-5.6 三档预览 Sol/Terra/Luna:换了命名体系,Terra 性价比翻倍,但先报备了美国政府
OpenAI 启动 GPT-5.6『有限预览』,用 Sol(旗舰)/Terra(均衡)/Luna(低价)三档能力位替代旧命名——数字代表『代数』,名字代表可独立迭代的『能力档』。定价(每百万 token):Sol 输入 $5 / 输出 $30,Terra $2.50 / $15,Luna $1 / $6;官方称 Terra 性能对标上代 GPT-5.5 但价格便宜 2 倍。Benchmark 多为 OpenAI 自报:Sol 在 Terminal-Bench 2.1 上创 SOTA,在 ExploitBench 上以约 1/3 输出 tokens 与 Mythos Preview 竞争。新增 max reasoning effort 与借助 subagents 的 ultra 模式;prompt caching 支持显式 cache breakpoints、缓存最短存活 30 分钟、写入按未缓存输入价 1.25x、读取享 90% 折扣。安全上未跨越 Preparedness Framework 的 Cyber Critical 阈值,自动化红队投入超 70 万 A100 等效 GPU 小时。最反常的一点:应美国政府要求,本次先做小范围预览、参与方已报备政府,广泛开放要『未来数周』;7 月将在 Cerebras 上线 Sol,速度最高 750 tokens/秒。
- 头条2026-06-27 · 周六深度报告 →
OpenAI 发布 GPT-5.6 三档模型 Sol/Terra/Luna:史上最强却先过政府这一关
OpenAI 推出 GPT-5.6 系列,新命名体系把『代际』(5.6) 与『能力档位』(Sol/Terra/Luna) 拆开,三档可各自迭代。旗舰 Sol 在 Terminal-Bench 2.1 拿到 88.8%(ultra 91.9%),超过 Claude Mythos 5 的 88% 与 Fable 5 的 84.3%;ExploitBench 上以约 1/3 的输出 token 追平 Mythos Preview,被称『迄今最强网络安全模型』但未越过 Preparedness 的 Cyber Critical 阈值。本次发布应美国政府要求限量预览、逐客审批——OpenAI 公开称此流程『不该长期化』。定价 Sol $5/$30、Terra $2.50/$15、Luna $1/$6(每百万 token),Luna 为 OpenAI 史上最低价;7 月 Sol 将在 Cerebras 上以最高 750 tokens/秒推出。
- 头条2026-06-26 · 周五深度报告 →
OpenAI 预览 GPT-5.6:Sol/Terra/Luna 三档齐发,主攻网络安全
OpenAI 启动 GPT-5.6 限量预览,三款新模型构成新命名体系——数字 5.6 代表代际,Sol/Terra/Luna 代表智能/速度/成本三档能力。旗舰 Sol 主打长程网络安全,均衡款 Terra 性能对标 GPT-5.5 但价格便宜一半,低价款 Luna 以最低成本提供强能力。新增 max reasoning effort 与调用子智能体的 ultra mode;Sol 在 Terminal-Bench 2.1 刷新 SOTA、在 GeneBench/ExploitGym 超越或逼近 5.5,被定位为"迄今最强网络安全模型",但称未跨越 Preparedness 的 Cyber Critical 阈值。定价(每百万 token)Sol $5/$30、Terra $2.5/$15、Luna $1/$6,自动化红队投入超 70 万 A100 等效 GPU 小时,7 月将在 Cerebras 上线、最高 750 tok/s。