本文要点
- Flash线从低成本通用模型进一步转向编码和智能体工作负载。
- API半价被明确限定到2026年底,长期成本需要按2027价格重算。
- Antigravity Agent把3.7 Flash放进托管沙箱和工具循环。
阅读辅助
先看数字、证据和来源,再读正文。
Google已在8月13日发布Gemini 3.7 Flash。
2026-04-21 · Android Studio背景文档说明Gemini是Android开发的AI编码伴侣。
Google这次把Gemini 3.7 Flash放在实用位置:面向编码、知识工作、网页开发和智能体执行的工作模型。8月13日的官方发布文、Gemini API模型页、价格页和Antigravity Agent文档同步出现,说明这个模型名已经进入Google开发者工具链的生产入口。
可确认的事实有四类。第一,模型代码是gemini-3.7-flash,API模型页列为Stable。第二,模型页列出输入上限为1,048,576 token,输出上限为65,536 token。第三,Google自报它相对3.6 Flash在调试、issue解决、网页应用生成、复杂文档和业务工作流上有提升。第四,API半价是限时引导价:每百万输入token $0.75、每百万输出token $3.75只持续到2026年12月31日,2027年1月1日起分别变为$1.50和$7.50。
需要降噪的部分也很清楚。Google给出的benchmark数字来自官方发布和模型卡体系,目前还缺独立机构复现;“workhorse model”是产品定位,不等于它在所有任务上都优于竞品旗舰模型;Antigravity Agent由3.7 Flash驱动,但智能体任务的实际成败还取决于工具权限、沙箱环境、任务拆解和重试策略。
对读者最直接的影响在成本核算。开发者今天可以把3.7 Flash放进AI Studio、Gemini API和Antigravity链路试跑,但如果要把它当作未来几个月的默认模型,不能只按引导价估算长期账单。企业买方还要把模型单价、任务成功率、人工复核次数和产品入口权限放在同一张表里比较。
这次发布新增了什么
Google官方发布文的标题是“Introducing Gemini 3.7 Flash”,副标题把它称为“our most intelligent workhorse model yet for coding and agents”。这句话有两个关键信号:一是Flash线仍承担成本和吞吐角色;二是Google正在把它从“便宜快模型”推向“智能体执行层”的默认候选。
发布文说,3.7 Flash建立在Gemini 3.6 Flash的进展之上,直接来自开发者反馈和算法创新。它覆盖的软件工程、知识工作和网页开发不是泛泛而谈:编码侧包括调试和issue resolution,网页侧包括更少prompt生成更功能完整的布局和应用,知识工作侧包括金融、法律和生物科学这类文档密集领域。
更关键的是分发。Google写明开发者可以在Antigravity中试用,在Google AI Studio和Android Studio中通过API访问;Google AI Pro和Ultra订阅用户则可在Gemini App里的Gemini Spark使用3.7 Flash。Antigravity Agent文档进一步说明,它是Gemini API上的通用托管智能体,一次API调用就能让agent在Google托管的安全Linux沙箱中推理、执行代码、管理文件和浏览网页,并且文档明确写着“powered by Gemini 3.7 Flash”。
这让3.7 Flash的新闻点扩展到“模型、API价格、智能体运行时、IDE入口、订阅产品”的组合。Google想让开发者先在日常任务里试出习惯,再讨论是否把它换成生产默认。
数字怎么读
| 口径 | Gemini 3.7 Flash | 对比基线 | 来源和边界 |
|---|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 3.6 Flash 34.4% | Google发布文;编码生产质量评测,需第三方复测 |
| DeepSWE v1.1 | 65.3% | 3.6 Flash 49.0% | Google发布文;软件工程任务评测,官方口径 |
| WebDev Arena Elo | 1588 | 3.6 Flash 1538 | Google引用Arena.ai;网页开发场景 |
| GDP.pdf | 34.0% | 3.6 Flash 22.0% | Google发布文;复杂PDF文档理解 |
| AutomationBench | 30.4% | 3.6 Flash 17.0% | Google发布文;真实业务工作流自动化 |
| API输入价 | $0.75到2026年底 | 2027年起$1.50 | 每百万输入token;不是永久价 |
| API输出价 | $3.75到2026年底 | 2027年起$7.50 | 每百万输出token,含thinking tokens |
| API输入上限 | 1,048,576 token | 不适用 | Gemini API模型页;产品入口可能另有限制 |
| API输出上限 | 65,536 token | 不适用 | Gemini API模型页;不代表实际任务输出 |
这组数字里,最容易被误读的是价格。Google原文说的是“available through the end of the year at an introductory price”,并在页面底部补充:“Introductory pricing expires on December 31, 2026. Starting January 1, 2027, $1.50/1M input tokens and $7.50/1M output tokens will apply.” 因此中文表达应写成“年底前引导价”或“限时半价”,不能写成“永久降价”。
另一组容易被过度外推的是benchmark。FrontierCode、DeepSWE、WebDev Arena、GDP.pdf和AutomationBench都能说明Google正在把3.7 Flash的叙事集中到编码、网页应用、复杂文档和业务流程,但这些仍是官方发布口径。它们还不能回答“同一个真实仓库里,3.7 Flash能少跑几轮、少花多少token、少要多少人工兜底”。
分发入口比模型名更重要
这次Google的动作像是一次工作流铺货。模型页确认gemini-3.7-flash是Stable代码,价格页给出付费层按百万token计价,Antigravity Agent文档则把模型放进托管沙箱、文件系统和浏览器工具循环里。对智能体开发而言,模型能力只是第一层,工具执行和环境可控性才决定它能不能完成端到端任务。
Antigravity Agent文档的描述很具体:它可以推理、执行代码、管理文件和浏览网页;每次调用可以配置远程Linux sandbox,并启动“plan、act、observe、repeat”的工具使用循环。这个入口让3.7 Flash承担的不只是聊天或补全,而是多步任务执行。Google在模型发布文里强调“less manual oversight and fewer retries”,对应的正是智能体工作里最昂贵的隐性成本:失败后人工介入、重跑、回滚和检查。
Android Studio的背景文档则说明另一个路径:Google早已把Gemini作为Android开发者的AI编码伴侣。虽然该背景页不是3.7 Flash当天新增能力的证据,但它解释了为什么Google要把Flash线做成“工作模型”。如果一个模型要进入IDE和企业开发流程,它不能只在一次性prompt里表现好,还要在上下文、工具调用、文件修改和权限边界中稳定工作。
安全和模型卡留下的边界
Google DeepMind模型卡给了这次发布的另一个边界。模型卡写明,Gemini 3.7 Flash基于Gemini 3.6 Flash,并针对推理基础做了算法改进;它适用于用户、开发者和企业,场景包括智能体工作流、编码任务和企业知识工作。已知限制仍包括基础模型常见的幻觉、偶发迟缓或超时。
安全侧,模型卡提到Google按Frontier Safety Framework评估了3.7 Flash,并列出CBRN、Cybersecurity、Harmful Manipulation、ML R&D and Misalignment等域的结果。发布文也写明3.7 Flash随附针对CBRN和cyber offense误用的更新防护。不过模型卡同时写到,Gemini 3.7 Frontier Safety Framework Report will be published shortly。也就是说,当前可以确认“Google披露了模型卡和高层安全结论”,但完整报告仍需要后续跟进。
这对企业买方很实际。若只是用3.7 Flash做前端小工具或内部文档问答,模型卡已经足以提供初步风险参考;若要把它接入自动代码修改、生产系统操作或敏感行业流程,仍需要等待更完整的安全报告、审计日志和权限隔离方案。
口径核对
| 原文措辞 | 中文应写 | 不能写成 |
|---|---|---|
| “introductory price” | 年底前引导价、限时半价 | 永久降价、正式价减半 |
| “expires on December 31, 2026” | 2026年12月31日到期 | 长期有效、暂无截止时间 |
| “Starting January 1, 2027” | 2027年1月1日起适用标准价 | 价格以后可能变化但无日期 |
| “strong gains over 3.6 Flash” | 相对3.6 Flash有官方自报提升 | 相对所有竞品全面领先 |
| “workhorse model for coding and agents” | 面向编码和智能体的工作模型 | 面向所有任务的旗舰模型 |
这个核对表直接影响成本和选型判断。若把引导价写成永久价,开发者会低估2027年的单位任务成本;若把“相对3.6 Flash”写成“行业领先”,读者会误以为这些数字已经经过跨厂商同口径复测;若把“Antigravity里可试用”写成“所有Google开发入口已全面默认”,则会混淆发布、文档可用和账号实际开放之间的差别。
早报判断是,Gemini 3.7 Flash最值得看的信号是Google对Flash线角色的重新定义。过去Flash更多像“快且便宜”的吞吐模型;这次发布把它放进编码、网页生成、知识工作和托管智能体执行层,等于把竞争变量从单次回答质量推向单位成功任务成本。
这对Google有利,因为它拥有AI Studio、Android Studio、Gemini Spark和Antigravity这样的分发入口。模型如果只在API里出现,开发者还要自己搭工具链;模型如果直接进入托管agent、IDE和订阅产品,迁移成本会低很多。3.7 Flash的引导价也服务于这个目标:先让开发者把它放进真实工作流,年底之后再用标准价检验留存。
硬问题仍在成本核算。智能体模型的账不能只看每百万token价格,更要看一次任务需要多少轮、失败后重试几次、代码修改是否可合并、人工复核是否减少。Google现在给出的数字能证明3.7 Flash值得试,但还不能证明它在生产任务里的总成本必然更低。
接下来看什么
后续最先要看价格。2026年底前的引导价足够有吸引力,但2027年起输入和输出标准价都会翻倍。若3.7 Flash在真实智能体任务里能显著减少重试,它仍可能更便宜;如果只是单次调用便宜,长期成本优势就会收窄。
第二个观察点是第三方复测。FrontierCode、DeepSWE、WebDev Arena、GDP.pdf和AutomationBench给出了方向,但生产代码库、UI生成和企业流程自动化都高度依赖任务分布。更有价值的复测应记录同一任务的成功率、token消耗、工具调用次数、执行时间和人工干预。
第三个观察点是Antigravity Agent。文档中的Linux沙箱、文件系统工具、代码执行、浏览器和搜索能力使它比普通聊天API更接近“可交付工作”的形态。若3.7 Flash能在这个环境里稳定完成多步任务,Google会拥有一个比单纯API更强的开发者入口;若失败主要出在工具循环和环境边界,模型本身的提升也会被运行时吞掉。
最后要等安全材料补齐。模型卡已经写出CBRN、网络攻击和前沿安全评估的高层结论,也说明完整Frontier Safety Framework报告将随后发布。对普通开发者这不是今天试用的阻碍;对要把agent接进敏感系统的企业,它会决定能否进入采购、风控和合规流程。