# Gemini 3.8 Flash 定价不变，但更高努力级别仍会推高实际开销

**Summary:** Google 为 Gemini 3.8 Flash 保留了 3.7 的 Token 费率和上下文限制，同时警告更高努力级别可能消耗更多 Token。在将其视为免费升级前，我建议先测试每个有效任务的实际成本。

- Canonical: https://markhuang.ai/zh/news/gemini-3-8-flash-same-price-effort-meter
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-02
- Section: News
- Tags: Gemini 3.8 Flash, Gemini API, AI 智能体
- Source: [Google DeepMind](https://deepmind.google/models/model-cards/gemini-3-8-flash/)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![两颗晶莹的处理器核心，明亮的数据流穿过分支状的生产测试设备](https://cdn.markhuang.ai/news/gemini-3-8-flash-same-price-effort-meter/hero.webp)

*Gemini 3.8 Flash 走上了快车道，但生产环境升级仍需经过成本、可靠性和安全性检查。*

[Google DeepMind 于 2026 年 9 月 2 日发布了 Gemini 3.8 Flash 模型卡](https://deepmind.google/models/model-cards/gemini-3-8-flash/)。新模型基于 Gemini 3.7 Flash，上下文窗口没变：最多 100 万输入 Token、64,000 输出 Token。Google 说这次升级主要针对软件工程和智能体知识工作。

价格也没动。按 [Google Gemini API 的资费表](https://ai.google.dev/gemini-api/docs/pricing)，2026 年 12 月 31 日之前，标准档每百万输入 Token 0.75 美元、每百万输出 Token 3.75 美元；2027 年 1 月 1 日起两项费率翻倍。数字和日期跟 3.7 Flash 一模一样。

我的看法很简单：3.8 看起来可以直接替换，但还不到闭着眼迁移的时候。Token 单价没涨，不代表任务成本就稳了——尤其 Google 自己的模型卡都写了，更高努力级别可能吃更多 Token。我会把 3.7 和 3.8 跑在同一组任务上，只有当新模型在某个场景里确实能降低单个有效结果的成本，才把它推上去。

## 升级未附带新资费表

这其实挺省事。Gemini 应用、Gemini API、Google AI Studio、AI Mode、Antigravity，还有 Google 的企业智能体产品线，全都同步上了 3.8 Flash。开发者想试新模型，不用再跟管预算的人解释为什么 Token 单价涨了。

价格不变也帮对比省了一个干扰变量。我用同样的任务跑 3.7 和 3.8，账单上的差异就只可能来自 Token 用量、工具调用、重试、缓存、推理档位，而不是标准费率本身变了。这让本地评估干净不少。

但干净不等于结论清楚。Google 允许用户选 effort 级别，在质量、成本和延迟之间做取舍。模型卡也提到偶尔会变慢甚至超时，还明确说 effort 越高，模型可能消耗更多 Token 去争取更好表现。一个多跑几步推理才给出的更强答案，算下来可能还是划算的；可如果一个智能体光规划就花了半天、同一工具调了两遍、还去修本不该出的错，那点表面省下的钱就悄悄没了。

> **Info:**
>
> 第一轮对比时我会把 effort 锁死。等 3.8 跑出来的结果确实因为多花了 Token 而变得更好，再动这个参数。

## 基准测试问题实则是路由问题

Google 在编码、知识工作、多模态、长上下文、计算机操作、科学推理这些方向上都测了 3.8。这种广度能告诉我这模型值不值得花时间测，但没法告诉我产品里哪些请求该交给它。

社区反应就把这个缺口暴露出来了。某个 [Reddit 基准测试讨论帖](https://www.reddit.com/r/singularity/comments/1w5d1pz/gemini_38_flash_benchmarks/)里，有人盯着速度和性价比，有人关心 Token 效率，还有人指出在更新、更难的 terminal benchmark 上表现一般。另一个 [讨论帖](https://www.reddit.com/r/accelerate/comments/1w5d07w/gemini_38_flash_benchmarks/)里，一开始有人为旧版 terminal 测试的高分欢呼，后来注意到新版测试的成绩，又开始重新评估。

我觉得这种怀疑挺有价值。模型要操作 terminal、要改代码库，benchmark 版本就不是无关紧要的脚注。在一个已经饱和的测试上拿高分、在更难的新版测试上拿低分，两种结果可能都对，但都预测不了我的系统里真正会出问题的地方。

所以我会按任务类型来路由，而不是按版本号。常规转换、边界清楚的代码修改、文档抽取，这些可能吃速度；但工具调用密集、跑得很长的任务得单独拎出来，因为每一步出错的恢复成本都在涨。评估集里要有智能体能跑完的任务、需要它主动问问题的任务，还要有它应该直接停下来的任务。

## 一项安全指标值得深究

模型卡说整体安全性和语气跟 3.7 Flash 差不多，无理拒绝率也低。但它自带的自动化测评表里，非英语安全性有一点退步：多语言安全得分比 3.7 高了 5.4 个百分点，Google 标注了越低越好。

Google 说人工复核下来，这些退步大多是误报，或者算不上严重问题。这个背景确实重要，但不能拿来当无视这个数字的借口。自动化安全测试本来就有噪声，你产品实际跑的语言组合也未必跟 Google 的测试集一样。

如果你的产品不只服务英语用户，就把实际用到的语言加进迁移测试里。用同样的 prompt 跑两个版本，比一比不安全补全、多余拒绝、语气、以及升级行为。全局平均分是有用的参考，但替不了你面前真实用户所用的语言和真实风险。

## 我会衡量工作本身，而非版本号

每个重复任务我都记：通过的结果、输入输出 Token 数、耗时、重试次数、工具调用、超时、人工修正。trace 旁边也把模型版本和 effort 级别标上。这样“3.8 感觉更快”就不再是感觉，而是能审计的数据。

明年一月的涨价也得放进同一张表里。我在 [Gemini 3.7 Flash 发布时就说过](https://markhuang.ai/news/gemini-3-7-flash-price-doubles)：折扣试点阶段跑得通，不等于永久费率下还算得过账。Gemini 3.8 没有把这个倒计时归零。

Google 已经把试用的门槛降得很低：API 公开、标准费率和 3.7 一样、模型卡把取舍摆在台面上而不是藏着。这足够让 3.8 Flash 进我的测试框架跑一轮了。至于生产流量，等新模型证明自己干活快、意外开销少，再切不迟。
