模型发布

Google发布Gemini 3.7 Flash工作模型

Google把Flash线推向智能体工作负载,但半价只是年底前引导价。

2026年8月14日 · 周五深度报告高置信重要度 5/5

本文要点

  • Flash线从低成本通用模型进一步转向编码和智能体工作负载。
  • API半价被明确限定到2026年底,长期成本需要按2027价格重算。
  • Antigravity Agent把3.7 Flash放进托管沙箱和工具循环。

阅读辅助

先看数字、证据和来源,再读正文。

2026-08-13官方发布时间
gemini-3.7-flash模型代码
6 条 Claim Audit

Google已在8月13日发布Gemini 3.7 Flash。

6 个时间点

2026-04-21 · Android Studio背景文档说明Gemini是Android开发的AI编码伴侣。

9 个来源7 个非 X 来源

Google这次把Gemini 3.7 Flash放在实用位置:面向编码、知识工作、网页开发和智能体执行的工作模型。8月13日的官方发布文、Gemini API模型页、价格页和Antigravity Agent文档同步出现,说明这个模型名已经进入Google开发者工具链的生产入口。

可确认的事实有四类。第一,模型代码是gemini-3.7-flash,API模型页列为Stable。第二,模型页列出输入上限为1,048,576 token,输出上限为65,536 token。第三,Google自报它相对3.6 Flash在调试、issue解决、网页应用生成、复杂文档和业务工作流上有提升。第四,API半价是限时引导价:每百万输入token $0.75、每百万输出token $3.75只持续到2026年12月31日,2027年1月1日起分别变为$1.50$7.50。

需要降噪的部分也很清楚。Google给出的benchmark数字来自官方发布和模型卡体系,目前还缺独立机构复现;“workhorse model”是产品定位,不等于它在所有任务上都优于竞品旗舰模型;Antigravity Agent由3.7 Flash驱动,但智能体任务的实际成败还取决于工具权限、沙箱环境、任务拆解和重试策略。

对读者最直接的影响在成本核算。开发者今天可以把3.7 Flash放进AI Studio、Gemini API和Antigravity链路试跑,但如果要把它当作未来几个月的默认模型,不能只按引导价估算长期账单。企业买方还要把模型单价、任务成功率、人工复核次数和产品入口权限放在同一张表里比较。

这次发布新增了什么

Google官方发布文的标题是“Introducing Gemini 3.7 Flash”,副标题把它称为“our most intelligent workhorse model yet for coding and agents”。这句话有两个关键信号:一是Flash线仍承担成本和吞吐角色;二是Google正在把它从“便宜快模型”推向“智能体执行层”的默认候选。

发布文说,3.7 Flash建立在Gemini 3.6 Flash的进展之上,直接来自开发者反馈和算法创新。它覆盖的软件工程、知识工作和网页开发不是泛泛而谈:编码侧包括调试和issue resolution,网页侧包括更少prompt生成更功能完整的布局和应用,知识工作侧包括金融、法律和生物科学这类文档密集领域。

更关键的是分发。Google写明开发者可以在Antigravity中试用,在Google AI Studio和Android Studio中通过API访问;Google AI Pro和Ultra订阅用户则可在Gemini App里的Gemini Spark使用3.7 Flash。Antigravity Agent文档进一步说明,它是Gemini API上的通用托管智能体,一次API调用就能让agent在Google托管的安全Linux沙箱中推理、执行代码、管理文件和浏览网页,并且文档明确写着“powered by Gemini 3.7 Flash”。

这让3.7 Flash的新闻点扩展到“模型、API价格、智能体运行时、IDE入口、订阅产品”的组合。Google想让开发者先在日常任务里试出习惯,再讨论是否把它换成生产默认。

数字怎么读

口径Gemini 3.7 Flash对比基线来源和边界
FrontierCode 1.1 Main43.6%3.6 Flash 34.4%Google发布文;编码生产质量评测,需第三方复测
DeepSWE v1.165.3%3.6 Flash 49.0%Google发布文;软件工程任务评测,官方口径
WebDev Arena Elo15883.6 Flash 1538Google引用Arena.ai;网页开发场景
GDP.pdf34.0%3.6 Flash 22.0%Google发布文;复杂PDF文档理解
AutomationBench30.4%3.6 Flash 17.0%Google发布文;真实业务工作流自动化
API输入价$0.75到2026年底2027年起$1.50每百万输入token;不是永久价
API输出价$3.75到2026年底2027年起$7.50每百万输出token,含thinking tokens
API输入上限1,048,576 token不适用Gemini API模型页;产品入口可能另有限制
API输出上限65,536 token不适用Gemini API模型页;不代表实际任务输出

这组数字里,最容易被误读的是价格。Google原文说的是“available through the end of the year at an introductory price”,并在页面底部补充:“Introductory pricing expires on December 31, 2026. Starting January 1, 2027, $1.50/1M input tokens and $7.50/1M output tokens will apply.” 因此中文表达应写成“年底前引导价”或“限时半价”,不能写成“永久降价”。

另一组容易被过度外推的是benchmark。FrontierCode、DeepSWE、WebDev Arena、GDP.pdf和AutomationBench都能说明Google正在把3.7 Flash的叙事集中到编码、网页应用、复杂文档和业务流程,但这些仍是官方发布口径。它们还不能回答“同一个真实仓库里,3.7 Flash能少跑几轮、少花多少token、少要多少人工兜底”。

分发入口比模型名更重要

这次Google的动作像是一次工作流铺货。模型页确认gemini-3.7-flash是Stable代码,价格页给出付费层按百万token计价,Antigravity Agent文档则把模型放进托管沙箱、文件系统和浏览器工具循环里。对智能体开发而言,模型能力只是第一层,工具执行和环境可控性才决定它能不能完成端到端任务。

Antigravity Agent文档的描述很具体:它可以推理、执行代码、管理文件和浏览网页;每次调用可以配置远程Linux sandbox,并启动“plan、act、observe、repeat”的工具使用循环。这个入口让3.7 Flash承担的不只是聊天或补全,而是多步任务执行。Google在模型发布文里强调“less manual oversight and fewer retries”,对应的正是智能体工作里最昂贵的隐性成本:失败后人工介入、重跑、回滚和检查。

Android Studio的背景文档则说明另一个路径:Google早已把Gemini作为Android开发者的AI编码伴侣。虽然该背景页不是3.7 Flash当天新增能力的证据,但它解释了为什么Google要把Flash线做成“工作模型”。如果一个模型要进入IDE和企业开发流程,它不能只在一次性prompt里表现好,还要在上下文、工具调用、文件修改和权限边界中稳定工作。

安全和模型卡留下的边界

Google DeepMind模型卡给了这次发布的另一个边界。模型卡写明,Gemini 3.7 Flash基于Gemini 3.6 Flash,并针对推理基础做了算法改进;它适用于用户、开发者和企业,场景包括智能体工作流、编码任务和企业知识工作。已知限制仍包括基础模型常见的幻觉、偶发迟缓或超时。

安全侧,模型卡提到Google按Frontier Safety Framework评估了3.7 Flash,并列出CBRN、Cybersecurity、Harmful Manipulation、ML R&D and Misalignment等域的结果。发布文也写明3.7 Flash随附针对CBRN和cyber offense误用的更新防护。不过模型卡同时写到,Gemini 3.7 Frontier Safety Framework Report will be published shortly。也就是说,当前可以确认“Google披露了模型卡和高层安全结论”,但完整报告仍需要后续跟进。

这对企业买方很实际。若只是用3.7 Flash做前端小工具或内部文档问答,模型卡已经足以提供初步风险参考;若要把它接入自动代码修改、生产系统操作或敏感行业流程,仍需要等待更完整的安全报告、审计日志和权限隔离方案。

口径核对

原文措辞中文应写不能写成
“introductory price”年底前引导价、限时半价永久降价、正式价减半
“expires on December 31, 2026”2026年12月31日到期长期有效、暂无截止时间
“Starting January 1, 2027”2027年1月1日起适用标准价价格以后可能变化但无日期
“strong gains over 3.6 Flash”相对3.6 Flash有官方自报提升相对所有竞品全面领先
“workhorse model for coding and agents”面向编码和智能体的工作模型面向所有任务的旗舰模型

这个核对表直接影响成本和选型判断。若把引导价写成永久价,开发者会低估2027年的单位任务成本;若把“相对3.6 Flash”写成“行业领先”,读者会误以为这些数字已经经过跨厂商同口径复测;若把“Antigravity里可试用”写成“所有Google开发入口已全面默认”,则会混淆发布、文档可用和账号实际开放之间的差别。

早报观点

早报判断是,Gemini 3.7 Flash最值得看的信号是Google对Flash线角色的重新定义。过去Flash更多像“快且便宜”的吞吐模型;这次发布把它放进编码、网页生成、知识工作和托管智能体执行层,等于把竞争变量从单次回答质量推向单位成功任务成本。

这对Google有利,因为它拥有AI Studio、Android Studio、Gemini Spark和Antigravity这样的分发入口。模型如果只在API里出现,开发者还要自己搭工具链;模型如果直接进入托管agent、IDE和订阅产品,迁移成本会低很多。3.7 Flash的引导价也服务于这个目标:先让开发者把它放进真实工作流,年底之后再用标准价检验留存。

硬问题仍在成本核算。智能体模型的账不能只看每百万token价格,更要看一次任务需要多少轮、失败后重试几次、代码修改是否可合并、人工复核是否减少。Google现在给出的数字能证明3.7 Flash值得试,但还不能证明它在生产任务里的总成本必然更低。

接下来看什么

后续最先要看价格。2026年底前的引导价足够有吸引力,但2027年起输入和输出标准价都会翻倍。若3.7 Flash在真实智能体任务里能显著减少重试,它仍可能更便宜;如果只是单次调用便宜,长期成本优势就会收窄。

第二个观察点是第三方复测。FrontierCode、DeepSWE、WebDev Arena、GDP.pdf和AutomationBench给出了方向,但生产代码库、UI生成和企业流程自动化都高度依赖任务分布。更有价值的复测应记录同一任务的成功率、token消耗、工具调用次数、执行时间和人工干预。

第三个观察点是Antigravity Agent。文档中的Linux沙箱、文件系统工具、代码执行、浏览器和搜索能力使它比普通聊天API更接近“可交付工作”的形态。若3.7 Flash能在这个环境里稳定完成多步任务,Google会拥有一个比单纯API更强的开发者入口;若失败主要出在工具循环和环境边界,模型本身的提升也会被运行时吞掉。

最后要等安全材料补齐。模型卡已经写出CBRN、网络攻击和前沿安全评估的高层结论,也说明完整Frontier Safety Framework报告将随后发布。对普通开发者这不是今天试用的阻碍;对要把agent接进敏感系统的企业,它会决定能否进入采购、风控和合规流程。