# Gemini 4 Argon 拿下 53 分，但普通用户还进不去

**Summary:** Gemini 4 Argon 在独立评测中得分 53，但尚未开放公共 API。我会现在就设计好工作负载测试，等付费 API 开放后再决定是否迁移。

- Canonical: https://markhuang.ai/zh/news/gemini-4-argon-score-before-api-opens
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-30
- Section: News
- Tags: Gemini 4 Argon, 谷歌 DeepMind, AI 基准测试
- Source: [Artificial Analysis](https://artificialanalysis.ai/models/gemini-4-argon)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![昏暗的评测实验室里，一块发光的晶体计算核心隔着玻璃和紧闭的安全门](https://cdn.markhuang.ai/news/gemini-4-argon-score-before-api-opens/hero.webp)

*Gemini 4 Argon 已登上评分榜，但大多数买家仍在门外。*

[Artificial Analysis 对 Gemini 4 Argon 进行了评测](https://artificialanalysis.ai/models/gemini-4-argon)，首批独立数据相当亮眼。其高推理配置在 Intelligence Index 上得分 53，而该页面同类模型的中位数仅为 26。不过，谷歌此次发布并未开放公共 API，而是优先提供给可信的网络安全防御方。

这种错位改变了我对这次发布的看法。Argon 已经走出了传闻阶段，也不再只是谷歌自家的基准测试表。但我仍无法对其进行采购测试。它今天值得列入我的候选清单，但在客户能实际购买并测试这项服务之前，我会保持现有工作负载和预算不变。

当前公布的价格表和能力声明已经足以进行横向对比。但买家仍需了解实际可用容量、稳定限制、真实任务成本，以及生产环境中的故障表现。

## 成绩单先于商店开张

Artificial Analysis 的评测不只是照搬谷歌的发布图表。他们表示，Intelligence Index v4.3.2 综合了十项评测，涵盖知识工作、自动化、编程、科学和长上下文任务。Argon 跑完整个指数共产生 1.1 亿输出 Token，高于页面上 8200 万的中位数。加权平均每个任务成本 1.99 美元。

这个分数值得花时间测一测 Argon。总输出量也让我好奇它是怎么跑出来的——1.1 亿覆盖的是整个评测集，没法直接换算成单个任务的成本。但它至少给了我一个理由：在关注任务成功率的同时，也要看看输出有多啰嗦、延迟多高、人工审查要花多少功夫。

谷歌自家的基准测试表令人印象深刻但表现不一。[Gemini 4 Argon 模型页面](https://deepmind.google/models/gemini/)显示，其在 DeepSWE v1.1 上得分为 77.9%，领先于所列竞争对手；但在 FrontierSWE v2 上落后于 GPT-6 Astra 和 Claude Opus 5.5。在 Terminal-bench 4.0 上也落后于 Opus 5.5。这更像是一个底子扎实、在特定方向上特别强的模型，而不是编程领域的全能冠军。

## 价格表有两块表在走

[谷歌表示 Argon 将以](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/)每百万输入 Token 2 美元、每百万输出 Token 10 美元的促销价推出。促销期结束后，价格将涨至 4 美元和 20 美元。在我查看的公告页面上，谷歌并未注明促销期的截止日期。

开放时间表是另一码事。Argon 最初通过谷歌的 Fairwind 计划，只向一批可信的网络安全防御方开放。谷歌说接下来会轮到开发者、企业和消费者，先开放付费 API 和 Google AI Ultra 订阅，但公告里没给公共 API 的具体日期。

公布的价格够具体，能填进电子表格算一算，但离真正的采购报价还差得远。Token 单价我可以建模，可服务没开放之前，我的工作负载到底吃多少 Token、返工率多高、容量够不够，全都测不了。我在[分析 Token 标价陷阱](https://markhuang.ai/news/token-sticker-price-is-a-trap)时也说过同样的话：真正有用的计价单位，是能通过审查的最终结果。

> **Info:**
>
> 我会按公布的永久价格（每百万输入 Token 4 美元，每百万输出 Token 20 美元）为 Argon 试点做预算。如果试点只有靠促销价才算得过来，那这笔账本身就经不起考验。

## 百万输出 Token 是容量，不是证明

谷歌还把 Argon 的最大输出从 6.4 万 Token 直接拉到一百万。对长程编程或研究任务来说，这个空间大得离谱——但真正需要一口气吃完的任务其实很少。

输出上限高，大型迁移或长期调研就能一气呵成，不用中途切断重来。但反过来，跑出来的代码更多、要审的也更多，每个结论都得自己核实。跑偏的长任务会烧钱。Artificial Analysis 发现 Argon 的总输出量高于中位数，这本身不算浪费，但足以提醒我：试点时要把效率当回事。

社区讨论一直在围绕这个差距打转。[Gemini 社区帖子](https://www.reddit.com/r/GeminiAI/comments/1wufgo3/gemini_4_argon_our_next_era_of_frontier/)里，有人夸基准测试漂亮，有人问什么时候能上手测，还有人担心这些分数到了真实场景还能不能站住脚。Axios 也[报道说，初期只开放给一小批网络安全合作伙伴](https://www.axios.com/2026/09/30/google-gemini-4)。基准测试还是有参考价值的，只是现在还不足以拍板采购。

## 这次发布够格进候选名单

团队做迁移或调研本来就需要提前准备。一个独立评分 53、企业级测试结果不错、输出上限拉到百万 Token 的模型，可能改变你规划复杂迁移或研究工作流的方式——等到全面开放再想测试的事，这段窗口期就白白浪费了。

我会现在就开始准备测试，但先不动生产环境。第一步，挑几个有明确验收标准的代表性任务，跑一遍当前模型的基线，定好哪些情况必须人工介入。等 Argon 的付费 API 一开放，我就测任务通过率、总 Token 消耗、端到端耗时、重试次数和修正时间。涉及网络安全或工具调用的场景，权限控制和回退路径必须提前定好。

这也是我在[Artificial Analysis Agentic Index](https://markhuang.ai/news/agentic-index-needs-your-failure-test)上一直坚持的判断：排行榜能告诉我该把评估精力花在哪里，但只有本地故障测试才能决定一个模型能不能上生产。

Gemini 4 Argon 已经做到了足够多的事，成了一个值得认真对待的候选者。独立评分、价格表、百万级输出上限——这些都在公共产品上线之前就摊开了。信息够设计一个好的试点，但要不要切换，答案只能从实际运行里来。
