发布三周后,Google 替换了 Gemini 3.6 Flash,并在年底前下调价格
Tulsee Doshi 的团队提高了代码和工作流程得分,尽管 Google 的完整评估表显示这些提升并不均衡。
By RuntimeWire Staff · Published
Primary source: Ars Technica
Why it matters
Google is turning frontier-model releases into rapid production iterations. The temporary discount makes testing cheap, while developers must judge 3.7 Flash at its higher January price.

Google DeepMind, the AI lab led by co-founder Demis Hassabis, released Gemini 3.7 Flash on August 13th, replacing a workhorse model that had been in production for 23 days and putting a temporary price cut behind its push into coding agents.
这段加速的发布周期归功于 Tulsee Doshi,她是 Google 的高级总监兼 Gemini 模型的产品负责人。Doshi 在描述 3.7 Flash 时表示,这一版本是开发者反馈和算法改进的产物,Google 预计这些改进会被带入后续模型。 Ars Technica 报道 表示,此次推出时开发者仍在等待 Gemini 3.5 Pro,Google 先前称该版本正在与合作伙伴进行测试。
Doshi 多年来一直处在将模型研究转化为产品决策的前沿。在负责 Gemini 路线图之前,她曾负责 Google 的 Responsible AI 产品工作五年。她在 Stanford 学习 Symbolic Systems 和计算机科学,这条学术路径将 AI 系统的技术开发与人们如何与其交互的问题结合起来。
她的最新发布把前沿模型更像是不断修订的生产软件,而非偶尔的研究里程碑。Google 在7月21日推出了 Gemini 3.6 Flash,称其为 3.5 Flash 的更便宜、更高效的替代品。RuntimeWire 当时报道 指出,Google 在将 3.5 Pro 保持在合作伙伴测试的同时,已经开始了 Gemini 4 的预训练工作。
三周后,3.7 Flash 接替了主力角色。
围绕代理失败构建的模型更新
Google 表示,当代理遇到阻碍时,Gemini 3.7 Flash 更善于适应、能更有效地请求澄清,并能以更少的重试次数执行多步骤指令。这些改进针对的是编码代理中的一个代价高昂的弱点:模型每个 token 成本可能很低,但在循环、编辑错误文件或需要反复人工纠正时仍会变得昂贵。
开发者指南 列出了一百万令牌的上下文窗口、最大输出 64,000 令牌,以及可调的低/中/高思考级别。Gemini 3.7 Flash 使用与 3.6 Flash 相同的内置工具,减少了已使用旧版模型的开发者的迁移工作量。
根据 Google 的模型卡,新版本直接基于 3.6 Flash。Google 将这些变化描述为对模型核心推理基础的算法改进,而不是新架构或从头训练的全新基模型。这有助于解释 Doshi 的团队如何在 23 天内从一个编号发布迭代到下一个。
Google 报告的编码能力提升在多项测试中幅度可观。Gemini 3.7 Flash 在 FrontierCode 1.1 Main 上得分 43.6%,高于 3.6 Flash 的 34.4%。其 DeepSWE v1.1 得分从模型卡中的 48.6% 上升到 65.3%,而 WebDev Arena Elo 得分从 1,538 提高到 1,588。
企业工作流的结果进一步提升。Google 报告称在 AutomationBench 上得分 30.4%,而 3.6 Flash 为 17%;在 GDP.pdf 文档理解测试上的得分为 34%,高于此前的 22%。
这些仍然是 Google 报告的评估结果。发布材料并未说明这些分数将如何转化为生产代理系统中的延迟、可靠性或总任务成本。更高的完成率可以减少重试次数,但开发者需要在自己的代码库、工具和审批流程中验证这一效果。
Google 的完整表格比发布宣称的要复杂
详细评估表显示 3.7 Flash 并未在每一项衡量能力上都有提升。其无工具 CharXiv 分数(测试对复杂图表的推理)从 85.2% 下降到 84.5%。使用工具时得分为 88.7%,而 3.6 Flash 为 89.4%。
其他提升幅度较小。长视频 LVBench 的结果从 84.2% 上升到 85.4%,而 Agent's Last Exam 的通过率从 24.2% 提升到 26.3%。Google 最有力的证据集中在编码、终端操作、文档处理和业务自动化上,这些正是 Doshi 团队明确针对的工作负载。
模型卡还列出了幻觉、偶发的响应缓慢和超时作为模型的已知限制。它给出 Gemini 3.7 Flash 的知识截止日期为 2026 年 3 月,部分领域的信息可能仅截至 2025 年 1 月。依赖实时信息的应用仍需搜索、检索或其他实时数据来源。
降价优惠将到期
截至 12 月 31 日,Gemini 3.7 Flash 的价格为每百万输入令牌 0.75 美元、每百万输出令牌 3.75 美元。Google 对 3.6 Flash 也适用相同的促销费率,将两款模型的价格降至 3.6 Flash 原始发布价的一半。
2027 年 1 月 1 日,费率将上调至输入 1.50 美元、输出 7.50 美元。因此,选择 3.7 Flash 以利用其发布期经济性的开发者面临一个直接的计划问题:生产工作负载需要能够在 1 月的价格下运行,除非 Google 延长促销或再次调整费率。
这一临时折扣为 Doshi 的团队提供了四个半月的时间,将开发者迁移到该模型、收集生产反馈,并证明更少的代理失败循环可以抵消最终的价格上涨。它也让 Google 在不永久重置其主要 Flash 等级标价的情况下,降低测试 3.7 的即时成本。
Gemini 3.7 Flash 已通过 Gemini API、Google AI Studio、Android Studio、Google 的 Antigravity 开发平台和 Gemini Enterprise 提供。根据 Ars,在消费端应用中,Google 最初在支持国家将其用于为 AI Pro 和 Ultra 订阅用户提供 Gemini Spark 的动力。标准的 Gemini 聊天机器人仍在使用 3.6 Flash。
这一分发选择将模型首先放在那些重复调用工具和长时间运行工作流可能产生可观使用量的场景中。Gemini Spark 可以整合文件、起草电子邮件并在 Google Workspace 中更新状态文档,为 Google 提供一个受控环境,以衡量 3.7 的基准提升是否能产生需要更少监督的代理。
Hassabis 围绕着理解并重建智能的长期努力建立了 DeepMind。Doshi 当前的任务周期更短且更具操作性:将那项研究转化为在入门价消失后开发者仍会继续运行的模型。在 3.6 之后三周交付 3.7 Flash 展示了 Google 快速修订产品的能力。是否加快的发布节奏能为开发者节省相同的时间,将由生产结果决定。