# Grok 4.6 只用 53 轮就完事了？Claude Opus 5 却要 103 轮

**Summary:** Grok 4.6 最值得关注的并非与对手持平的综合得分，而是其宣称的效率优势；在设为默认模型前，我建议先针对重复性工作负载进行测试。

- Canonical: https://markhuang.ai/zh/news/grok-4-6-53-turns-vs-103
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-08-12
- Section: News
- Tags: AI, Grok, 模型评估, AI 智能体, AI 成本
- Source: [Artificial Analysis](https://artificialanalysis.ai/articles/grok-4-6-benchmarks-and-analysis)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一台紧凑的 AI 引擎将工作产物沿着漫长的评测赛道送往最终检验关卡](https://cdn.markhuang.ai/news/grok-4-6-53-turns-vs-103/hero.webp)

*Grok 4.6 在严苛的基准测试中显得高效。但我仍想看看终点那道检验关卡的结果。*

[Artificial Analysis 报告称](https://artificialanalysis.ai/articles/grok-4-6-benchmarks-and-analysis)，Grok 4.6 在其 Intelligence Index 上得分为 61，与最高档位的 GPT-5.6 Sol 持平。行吧。真正让我停下来的是每项任务 0.84 美元这个数字。

同一份分析指出，在 AA-Briefcase 基准测试中，Grok 4.6 平均约需 53 轮和 5 亿输入 Token，而 Claude Opus 5 在全力运行时则约为 103 轮和 20 亿输入 Token。xAI 同时维持了标准 API 定价，即每百万输入 Token 2 美元，每百万输出 Token 6 美元。在我看来，Grok 4.6 已经值得认真跑一轮工作负载测试，但还不足以直接全面迁移。

xAI 把这个模型定位在长周期智能体和高难度技术任务上。如果它用更少的轮次、处理更少的 Token 就能交出合格结果，团队就能把更多流程自动化。但如果结果还是要返工，或者时不时出些不可预测的错误，那省下来的钱只是转进了审核队列。

## 效率才是真正的看点

排行榜名次更新很快，成本结构却能改变一个产品怎么做。

Artificial Analysis 表示，Grok 4.6 在 Grok 4.5 发布刚过一个月后就提升了 5 分。它在 GDPval-AA v2 上的 Elo 评分为 1753，在工具调用银行基准 τ³-Banking 上得分为 50.7%，在 Terminal-Bench v2.1 上得分为 88.4%。这几项成绩放在一起，说明 Grok 4.6 在多种智能体类任务上都逼近头部，而不是只在某一项编程能力上冒了个头。

[xAI 的发布帖](https://x.ai/news/grok-4-6)则更直接地阐述了产品定位。该公司表示，Grok 4.6 已上线 Cursor、Grok Build、Grok Bot 及其 API。训练流程方面，他们先用筛选过的模型自生成推理数据和工程数据做补充训练，再针对知识工作和编程任务（包括 Web 开发和计算机辅助设计）做监督微调和强化学习。

我没法独立验证这套训练方案，xAI 在帖子里披露的信息也不够别人复现。不过外部基准测试的成绩跟它声称的目标对得上：这次发布瞄准的就是那种必须一步步持续推进的智能体任务。

> **Info:**
>
> 如果是我，现在就会把 Grok 4.6 放进受控路由测试。我盯的指标是每美元能交付多少合格任务，而不是因为它碰巧有两个综合分跟别人打平就给它转正。

## 五十三轮可能意味着两种情况

AA-Briefcase 的对比之所以引人注目，是因为长周期智能体循环会叠加成本。更多轮次意味着要携带更多上下文、进行更多工具调用，也意味着更多偏离正轨的机会。如果能用大约一半的轮次跑到终点，听起来正是智能体产品需要的改进。

但轮次数量不等于质量。跑得短可能是果断高效，也可能是提前收工。跑得久可能是浪费资源，也可能是中途纠正了自己的错误。Artificial Analysis 给 Grok 4.6 的 AA-Briefcase Elo 评分是 1577，排在 Claude Opus 5 系列之后，所以不能把效率对比理解成"用四分之一的输入换来了同等交付物"。

AA-Briefcase 本身也是一个私有基准测试。其[公开描述](https://artificialanalysis.ai/articles/aa-briefcase/)很有用：模型需处理包含数千个源文件的真实、长周期项目，并产出电子表格、演示文稿、备忘录等产物。私有任务降低了模型死记硬背测试内容的可能性，但也阻止了买家重放确切的工作负载并检查每一次失败。

所以我把每项任务 0.84 美元看作一个值得试试的理由，不是最终结论。这个模型可能正好卡在成本-能力曲线上一个很划算的位置，但我还是不知道它碰上我的代码库、工具权限和验收标准会怎样。

## 基准测试衡量的是合同，而非我的产品

Artificial Analysis 将其[Intelligence Index 方法论](https://artificialanalysis.ai/methodology/intelligence-benchmarking)描述为智能体、编程、科学和通用能力等多方面评测的综合。这种广度有参考价值，但综合分一聚合，具体工作负载的差异就被抹平了。两个模型总分都是 61，可能一个擅长终端操作，另一个却在我关心的文档流程上差一截。我在[《AI 基准测试究竟测了什么》](/blog/what-ai-benchmarks-actually-measure)一文中更深入地探讨了这一测量问题。

基准测试成绩和生产可靠性之间还有第二层差距。[ReliabilityBench](https://arxiv.org/abs/2601.06112) 指出，单次跑通说明不了太多——重复执行是否稳定、换个说法 prompt 结果是否一致、工具或 API 挂了能不能撑住，这些才是关键。[IBM 对生产环境智能体的研究](https://research.ibm.com/publications/measuring-agents-in-production)也得出了类似结论：持续稳定地做对事情仍然是最大的开发难题，而且通常得靠模型外围的系统设计来解决。

这些观点没有否定 Grok 的成绩，反而告诉了我下一步该怎么做。我会把每个代表性任务跑多遍，换换措辞，故意注入工具故障，就算最后产物看起来挺漂亮，只要中间出了静默损坏也算失败。

早期社区反应也值得看。在一个 [Cursor 讨论帖](https://www.reddit.com/r/cursor/comments/1vmibtf/grok_46_amazing/)里，有人对效率提升表示期待，也有人反问：凭什么基准测试图表就能主导模型讨论？Grok 4.5 跑分也不差，用起来跟头部模型差距明显。这帖子是轶事，也还太早，下不了定论。但它点到了一个关键问题：图表能帮你挑出候选人，真正决定候选人留不留的是反复跑出来的结果。

## 我会如何进行试用

我不会一上来就大范围换模型。我会从一个成本高的工作流里挑 20 到 50 个任务，包括那些平时经常需要人工介入的情况。每个任务给同样的工具、上下文、时间限制和验收标准，每个任务跑多遍。

账本上要记的有：输入输出总成本、实际耗时、轮次、重试次数、工具报错、人工审核花了多少分钟、最终通过了多少。严重故障单独列出来。一个写坏的文件、一次信心十足但方向跑偏的操作，可能比好几次便宜的成功更扎眼。

Artificial Analysis 说 Grok 4.6 有 50 万 Token 的上下文窗口，但我不会因为塞满了这个窗口而给它加分。我要奖励的是它只用完成任务所需的上下文就把活干完。53 轮的结果之所以有吸引力，是因为它暗示更少的反复折腾。但到底省不省，还得靠本地评估在 AA-Briefcase 之外验证。

定价还得算完整路径。xAI 说快速版本的价格是标准版的两倍，Artificial Analysis 还提到缓存命中涨到了每百万 Token 0.50 美元，比 Grok 4.5 的 0.30 美元贵了一截。考虑到延迟需求和缓存命中率的差异，团队实际收到的账单可能跟宣传的 2/6 美元差不少。

## 什么情况下我会切换

什么时候我会把工作流切过去？当 Grok 4.6 每美元能交出更多合格结果，同时严重故障和人工审核时间没有上升的时候。它不需要每个 prompt 都赢。它只需要守住一条稳定的赛道，让便宜的运行在算上验证成本之后仍然便宜。

这个标准比"综合分 61"严格多了，但也正好给 Grok 4.6 一个机会去证明它看起来不错的那个效率优势。公平的试用应该让它的效率在真实任务里一笔一笔累积出来，然后每一次重试和修复都得从它的账上扣。

眼下，我会把 Grok 4.6 放进候选名单，但不会直接把它设成默认选项。基准测试已经完成了它的使命：帮我们筛出了一个值得花时间评估的候选人。接下来打分的，是买家自己。
