本文要点
- 3.6 Flash 从未开放变为当天可从 Gemini API 开始构建。
- 3.5 Flash-Lite 从未开放变为当天可用,并在部分消费产品分批推出。
- Flash 产品线从单一通用档扩展为质量效率档与高吞吐低成本档。
阅读辅助
先看数字、证据和来源,再读正文。
3.6 Flash 与 3.5 Flash-Lite 已进入当前推出状态,开发者现在可从官方 API 入口使用。
背景(早于 2026-07-21) · Google 先前介绍 CodeMender;该旧页面只说明安全 Agent 背景,不证明 Cyber 已开放。
这次发布最值得记住的不是“三款 Gemini 同时上线”,而是 Google 把三个名字放进一篇公告,却给了它们不同的可用状态:Gemini 3.6 Flash 与 3.5 Flash-Lite 已进入推出阶段,开发者当天即可从 Gemini API 入口开始构建;Gemini 3.5 Flash Cyber 则仍是未来时,只承诺“很快”通过 CodeMender 进入限量试点。
已经确认的事实是,Google 在 7 月 21 日 15:00 UTC 发布公告。官方同时写明,两款通用 Flash “available starting today”,开发入口包括 Google AI Studio 与 Android Studio;各自的 Gemini API 模型页也给出稳定模型代码。消费端的表述仍是 rolling out,意味着 Gemini App 以及 Flash-Lite 所在的 Google Search 可能分批到达,不能推断所有用户已同步看到。
不确定部分集中在 Cyber。原文是 will be exclusively available ... soon as part of a limited-access pilot program:will be 表示尚未发生,exclusively 限定唯一渠道,soon 没有具体日期,limited-access pilot 也不是正式普遍发布。公告还把对象限定为政府与可信合作伙伴。因此,现阶段不能写“Cyber 已上线”,也不能把它描述为开发者可直接调用的公开 API。
对开发者和企业买方,直接变化是可以开始测试两款通用模型的路由分工。3.6 Flash 面向更复杂的编程、知识工作和多模态任务;3.5 Flash-Lite 面向高吞吐、低延迟与低成本任务。安全团队则还没有可直接采购或普遍接入的 Cyber 产品,当前应等待试点资格、漏洞范围、修复验证与滥用控制细节。
三个名字对应三种状态
公告首段把 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 并列介绍,很容易让读者把 introducing 统一理解成“全部已经发布”。但后文给出的部署动词并不相同,必须拆开读。
| 模型 | 7 月 21 日官方状态 | 当前开发入口 | 适用对象与产品面 | 不能扩大成 |
|---|---|---|---|---|
| Gemini 3.6 Flash | available starting today;消费端正在推出 | Gemini API、Google AI Studio、Android Studio;另进入 Antigravity | 开发者、企业平台与 Gemini App 用户 | 所有地区、账号和企业租户已同步覆盖 |
| Gemini 3.5 Flash-Lite | available starting today;部分产品正在推出 | Gemini API、Google AI Studio、Android Studio | 开发者与 Gemini App 用户;另在 Google Search 分批推出 | Search 全量上线或所有调用档位容量相同 |
| Gemini 3.5 Flash Cyber | will be exclusively available soon | 尚无公开通用 API;计划经 CodeMender 提供 | 仅政府与可信合作伙伴的限量试点 | 已上线、公众可用、正式商用或试点日期已确定 |
官方 X 的补充说明与博客一致:两款通用模型 are rolling out now,开发者 can start building;Cyber 则 will be exclusively available ... soon。这组时态差异不是措辞细节,而是产品状态本身。前两款可以进入当日的开发与采购评估,第三款只能进入关注清单。
Gemini API 文档又提供了一层交叉验证。3.6 Flash 的模型代码是 gemini-3.6-flash,3.5 Flash-Lite 的模型代码是 gemini-3.5-flash-lite,两页都标为 Stable。这能支持“开发入口当前可用”,但不能替代各个消费产品自己的 rollout 进度,也不能为 Cyber 推导出一个不存在的公开模型代码。
价格变化不能缩成“同成本”
3.6 Flash 的成本叙事由两个变量组成:每个输出 token 的单价下降,以及完成部分任务时输出 token 用量下降。Google 公告给出的标准付费 API 价格是每百万输入 token 1.50 美元、每百万输出 token 7.50 美元;当前价格页显示,3.5 Flash 对应为 1.50 美元与 9.00 美元。因此,准确说法是输入单价保持相同,输出单价约低 16.7%,而不是所有价格完全相同。
| 付费标准档口径 | 3.6 Flash | 3.5 Flash | 3.5 Flash-Lite | 比较边界 |
|---|---|---|---|---|
| 输入价,每百万 token | $1.50 | $1.50 | $0.30 | 只比较标准档输入单价 |
| 输出价,每百万 token | $7.50 | $9.00 | $2.50 | 含 thinking token |
| 输入 token 上限 | 1,048,576 | 本文不据旧页展开 | 1,048,576 | 是模型文档上限,不是免费额度 |
| 输出 token 上限 | 65,536 | 本文不据旧页展开 | 65,536 | 是单次输出上限,不代表常见输出长度 |
Google 引述 Artificial Analysis Index 称,3.6 Flash 相对 3.5 Flash 使用的输出 token 少 17%。这里的比较基线是“3.5 Flash 的输出 token 用量”,不是输入 token、端到端延迟或账单总额。公告还称,在 DeepSWE 等部分 benchmark 中观察到最高 65% 的输出 token 降幅;“最高”与“部分 benchmark”都必须保留,不能改写为所有任务固定节省 65%。
任务总成本仍取决于输入输出比例、thinking token、工具调用次数、缓存策略、失败重试与任务是否真正缩短。即使输出单价下降 16.7%,也不能直接断言任意 Agent 账单同比下降相同比例。反过来,如果官方所称的输出 token 降幅在具体任务中成立,单价与用量会共同作用,任务级成本才可能比只看价目表下降更多。
Flash-Lite 的标准价是每百万输入 token 0.30 美元、每百万输出 token 2.50 美元。Google 引述 Artificial Analysis 称其生成速度达到 350 个输出 token/秒。这是一项测量结果,不是针对所有地区、并发、上下文长度与 thinking 档位的服务等级承诺。高吞吐应用需要用自己的提示长度、并发模式与质量阈值复测,不能只把 350 乘以任务数当容量规划。
官方评测支持分层,但仍是厂商证据
3.6 Flash 的定位不是单纯“更快”,而是用 Flash 级价格承接更复杂的 Agent 工作。DeepMind 模型页列出的官方结果显示,它在多个项目上高于 3.5 Flash;这些数字适合说明 Google 为何把它放在质量效率档,却不能替代独立生产评测。
| 官方评测 | 3.6 Flash | 3.5 Flash | 比较对象与口径 |
|---|---|---|---|
| SWE-Bench Pro Public | 58.7% | 55.1% | 多样化智能体编程任务 |
| DeepSWE v1.1 | 49% | 37% | 长时软件工程任务 |
| OSWorld-Verified | 83.0% | 78.4% | 智能体电脑操作 |
| GDM-MRCR v2,128k 平均 | 91.8% | 77.3% | 8-needle 长上下文评测 |
| GDM-MRCR v2,1M pointwise | 54.0% | 26.6% | 百万 token 长上下文点值 |
这些表格来自 Google DeepMind 自己的模型页面。即便 benchmark 名称是公开的,分数仍会受 harness、工具权限、提示模板、采样参数与模型版本影响。它们证明“Google 报告了怎样的比较结果”,不等于第三方已经在相同条件下复现,更不能从单项领先外推到所有编码或知识工作。
3.5 Flash-Lite 的基线也不能混用。Google 公告将它与 3.1 Flash-Lite 比较时,列出 Terminal-Bench 2.1 54% 对 31%、GDM-MRCR v2 72.2% 对 60.1%、GDPval-AA v2 1140 对 642。随后又将它与 Gemini 3 Flash 比较,列出 SWE-Bench Pro 54.2% 对 49.6%、OSWorld-Verified 74.0% 对 65.1%。前一组基线是旧 Flash-Lite,后一组基线是 3 Flash;把两组百分比拼成同一条“全面提升”会破坏比较口径。
这种结果更适合指导候选路由,而不是直接宣布替换。高频工单分类、文档抽取、翻译和子 Agent 扇出可以优先测 Flash-Lite;需要更强编程、长上下文、多模态理解或主 Agent 规划时,可以测试 3.6 Flash。真正的选择变量应是达到业务质量阈值后的每次成功任务成本,而不是单独追求每 token 最低价或单项 benchmark 最高分。
Cyber 是“模型加编排”的受控预告
Google 对 3.5 Flash Cyber 的描述有两层。模型层面,它建立在 3.5 Flash 之上,针对发现和修复网络安全漏洞做了专门微调。系统层面,CodeMender 会让多个 Flash Cyber Agent 协作,最终生成一份合并报告。Google 称这套组合在 CyberGym 上达到有竞争力的前沿表现,但当天公告没有在正文中给出足以复算的完整分数、样本构成、误报率或修复通过率。
这意味着不能把 CodeMender 的系统结果全部归因给单模型。多 Agent 分工、验证流程、补丁生成、测试执行和报告合并都可能贡献结果。若未来只开放 CodeMender 试点而不开放裸模型 API,使用者实际评估的也将是一套安全 Agent 系统,不只是一个模型权重。
部署限制同样是产品的一部分。Google 明确以双重用途风险解释受控方式:模型将只向政府与可信合作伙伴提供,并且只经 CodeMender,以限量试点形式开始。公告没有定义“可信合作伙伴”的审核标准,没有公布席位、国家范围、开始日、价格、漏洞类型、代码托管要求或数据保留方式。任何超出这些边界的开放描述都缺乏证据。
旧的 CodeMender 介绍页只能用来解释项目背景。它说明 Google 已经在探索自动发现与修复软件漏洞,但不能为 7 月 21 日的 Cyber 可用状态提供日期锚点,更不能把旧项目存在改写成新模型已经交付。当天的新信息是 Google 首次把 Flash Cyber、CodeMender 与未来限量试点绑定在一起,而不是旧页面突然变成公开 API。
Google 这次真正推出的是一套模型路由逻辑。3.6 Flash负责在 Flash 价格带里提高复杂任务质量,3.5 Flash-Lite 负责把高吞吐任务成本压低,Cyber 则把高风险能力锁进受控系统与限定对象。竞争单位由“一个通用模型覆盖所有任务”进一步转向“按质量、吞吐和风险选择不同执行层”。
最有现实价值的变化是 3.6 Flash 同时触碰单价和 token 用量。Agent 成本并不只由价目表决定;模型若能减少冗长输出、推理步骤和工具调用,才会降低一次成功任务的真实成本。不过 17% 是特定指数上的输出 token 比较,最高 65% 又只适用于部分 benchmark。企业应把它们当作待复现假设,而不是预算承诺。
Cyber 的克制开放值得单独看待。Google 没有把安全专用模型直接推向通用 API,而是计划通过 CodeMender 的多 Agent 编排向限定伙伴试点。这有助于控制双重用途风险,也让外界更难分辨单模型能力与系统编排贡献。没有试点方法、分母和独立验证之前,最稳妥的结论只是“方向已公布,产品尚未普遍上线”。
开发者现在应如何验证
第一步是把状态验证和性能验证分开。先确认目标地区与项目中能否调用 gemini-3.6-flash 和 gemini-3.5-flash-lite,记录配额、延迟、错误率与各服务档位的实际容量。Gemini App 或 Search 端暂未出现,不代表 API 不可用;反过来,消费端看见模型,也不代表企业账户已经获得相同容量。
第二步是用成对任务验证 token 口径。对 3.6 Flash 与 3.5 Flash 使用相同输入、工具、thinking 设置、终止条件与重试策略,分别记录输入 token、输出 token、thinking token、工具调用次数、成功率和总账单。只有在任务质量相当时,才能判断 17% 的输出 token 降幅是否转化为单位成功任务成本下降。
第三步是为 Flash-Lite 设置质量下限。速度与低价适合批量抽取、分类、翻译和子 Agent 扇出,但失败重试可能吃掉单价优势。测试应同时统计结构化输出通过率、事实错误、长文档遗漏、工具调用成功率和尾延迟,再决定哪些请求可以从 3.6 Flash 下沉。
第四步是把 Cyber 留在单独的安全评估队列。后续最关键的信息不是又一个宣传分数,而是试点何时开始、谁能加入、覆盖哪些漏洞类别、补丁如何验证、误报与漏报是多少、模型和 CodeMender 编排分别贡献多少,以及发现高危漏洞后的披露流程。答案出现之前,Cyber 不应进入当前可采购模型清单。