# Gemini 3.7 Flash 半价优惠仅剩半年，明年起价格翻倍

**Summary:** Google 报告其新智能体模型在编码方面有显著提升，但入门级 Token 费率将于 2027 年 1 月 1 日翻倍。建议现在就测试，但按永久费率做生产预算。

- Canonical: https://markhuang.ai/zh/news/gemini-3-7-flash-price-doubles
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-08-13
- Section: News
- Tags: Gemini, AI 模型, 智能体成本
- Source: [Google Blog](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一个多面体处理核心从冷色调的蓝色 Token 通道移向智能体网络中更密集的琥珀色区域](https://cdn.markhuang.ai/news/gemini-3-7-flash-price-doubles/hero.webp)

*Gemini 3.7 Flash 以入门价上线生产。同样的流量，过了定价门槛就是另一张账单。*

[Google 发布了 Gemini 3.7 Flash](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/)，距 3.6 Flash 上线仅三周，定位是面向编码和智能体场景的正式可用模型。首发价格为每百万输入 Token 0.75 美元、每百万输出 Token 3.75 美元，但有个关键脚注：这个价格只到 2026 年 12 月 31 日，次年 1 月 1 日起直接翻倍——输入 1.50 美元，输出 7.50 美元。

我想试试 3.7 Flash，但绝不会把商业论证押在首发价上。试点跑通了，等价格翻倍时正好是工作流最难迁移的阶段，所以我会从第一天起就按 1 月的费率做预算。

## 为什么值得测试这次升级

Google 把 3.7 Flash 定位为 3.6 Flash 的升级版，重点改进了处理障碍、意图澄清、多步规划和工具调用的能力。其[模型卡](https://deepmind.google/models/model-cards/gemini-3-7-flash/)显示，它基于 3.6 Flash 构建，支持可调节的思考配置，最多支持 100 万输入 Token 和 64,000 输出 Token。

编码方面的提升足够亮眼，值得我关注。Google 的对比数据显示，3.7 Flash 在 FrontierCode 1.1 上达到 43.6%，比 3.6 Flash 的 34.4% 高出不少。DeepSWE v1.1 上则是 65.3% 对 48.6%。表格里还列了 Artificial Analysis Intelligence Index 得分：56 分，高于 3.6 Flash 的 52 分和 Claude Sonnet 5 的 55 分。

这些分数足以让 3.7 Flash 进入我的候选名单，但还不够一锤定音。同一张表里，它在 Terminal-bench 2.1 上输给 GPT-5.6 Terra，在 Agent's Last Exam 上输给 Claude Sonnet 5，CharXiv（不管用不用工具）还略逊于 3.6 Flash。编码是最明显的强项，其他智能体任务则互有胜负。

早期 [Reddit 上的讨论](https://www.reddit.com/r/GeminiAI/comments/1vngq0i/gemini_37_flash_benchmarks/)也是两极分化。有人冲着价格和编码跑分去的，也有人觉得得看实际工作负载，甚至质疑 benchmark 跟日常使用到底有多大关系。一条评论说得更实在：工具链拉胯的话，模型再强也白搭——模型升级救不了这个。

## 费率表上有两个日期

定价脚注让我重新思考怎么设计试用。假设一个示例工作负载：每月消耗 1 亿输入 Token 和 2000 万输出 Token。按首发价算，模型费用是 150 美元；按 1 月费率算，同样的用量变成 300 美元。这还没算平台费和人工审核成本。

> **Info:**
>
> 我的原则很简单：只有当每百万输入 1.50 美元、输出 7.50 美元的费率下仍然算得过账，才会批准 3.7 Flash 的试点。

但光算 Token 单价还不够，还得看实际干活的过程。一个轮次少的模型，即使单价高，总账也可能更便宜。反过来，计划拉得长、工具反复调用、出了错来回修，费率优势就全被吃掉了。我在[Token 价格不等于账单](https://markhuang.ai/news/token-price-is-not-the-bill)里说过同样的话：我关心的是每个被采纳结果的成本。

Google 说 3.7 Flash 在规划和工具调用上花了更多心思。这可能正是它在长任务上表现更好的原因，但也意味着 Token 消耗本身就成了评估的一部分。可调节的思考设置又多了一个变量。我会记录每次运行的总输入、缓存输入、推理输出和可见输出，而不是想当然地以为标价就是最终成本。

## 正式发布不等于没有风险

这不是什么模糊的预览版。Google 把 3.7 Flash 列为 GA（正式发布），在 Gemini API、AI Studio、Antigravity 和企业产品里都能用，拿来上生产是合理的。但 GA 标签不保证输出稳定。

Google 自己的模型卡就承认有幻觉、偶尔卡顿和超时的问题。知识截止日期在某些领域是 2026 年 3 月，其他领域可能只到 2025 年 1 月。对能搜索或调用工具的智能体来说，内部知识过时不是致命问题，前提是工作流要求用最新证据，并在执行前做检查。

Benchmark 分数高也可能给人虚假的信心。长期软件测试拿到 65.3%，意味着还有 34.7% 的失败。我的生产风险取决于这些失败会造成什么后果。重新生成一份坏草稿成本很低，但从一次糟糕的部署或不可逆的工具操作里恢复，完全是另一回事。

## 我会测两轮

第一轮，在真实的智能体框架里，用同一套冻结的任务集跑 3.6 和 3.7 Flash。统计采纳结果数、重试次数、工具报错、耗时、Token 用量和人工干预次数。测试必须多跑几轮——一次打磨过的 demo 说明不了长尾失败的情况。

第二轮，用 1 月的费率重新算账。如果 3.7 能把重试次数压到足够低，总成本仍然更低，那升级就站得住脚。如果它只在首发折扣期内才划算，我会把它当临时路由，而不是新的默认选项。

公开跑分决定哪些模型值得我花时间测试。本地测试中的失败情况决定哪个模型能拿到生产凭证。我之前在[智能体指数](https://markhuang.ai/news/agentic-index-needs-your-failure-test)那篇文章里解释过，为什么我会把框架、权限和恢复路径都纳入这个决策。

Gemini 3.7 Flash 可能是目前性价比最高的干活模型之一。Google 也已经把涨价时间告诉我们了。我会利用剩下的折扣期，搞清楚这个模型到底能省多少重试和审核时间，看看全价之后还值不值得用。
