# Grok 4.7 定价陷阱：每通过一个补丁的真实成本是多少？

**Summary:** Grok 4.7 维持了 Grok 4.6 的每百万输入 token 2 美元和输出 token 6 美元的费率，同时提升了公布的编码分数。我会在测量每个被接受补丁的成本（包含重试）后再决定是否将其用于生产工作。

- Canonical: https://markhuang.ai/zh/news/grok-4-7-price-needs-accepted-patch
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-21
- Section: News
- Tags: Grok 4.7, AI 编程, 编码代理, 模型评估, AI 定价
- Source: [SpaceXAI](https://x.ai/news/grok-4-7)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![软件工厂将发光模块送入测试室，不合格的模块被退回重做](https://cdn.markhuang.ai/news/grok-4-7-price-needs-accepted-patch/hero.webp)

*入口门槛低只是第一步，真正的成本要算到测试、重试和最终验收之后。*

[SpaceXAI 发布了 Grok 4.7](https://x.ai/news/grok-4-7)，定价每百万输入 token 2 美元、每百万输出 token 6 美元，和 Grok 4.6 持平。跑分方面，CursorBench 4.0 从 40.4% 涨到 46.3%，Terminal-Bench 4.0 从 20.3% 涨到 38.0%。

如果是跑长任务，这个价格确实有吸引力。但发布里没有给出我真正用来做生产调度的数字——每通过一个补丁要花多少钱，包括失败尝试、修复回合、测试和 review 消耗的全部 token。token 单价再低，也得模型真能把 token 变成我能收的活儿才有意义。

Grok 4.7 让这个问题更突出。SpaceXAI 说这个模型专门用更难、更耗时的任务做过训练。任务一长，重试率和输出冗余上的小差距就会被放大；能一口气跑完、不用人插手的模型，优势也更明显。

## 在 SpaceXAI 自己的评测框架里，进步是真的

发布介绍提到：更大的基础模型、更长的强化学习训练、更好的自我验证和长上下文处理。SpaceXAI 还说 Grok 4.7 专门训练过原生理解自家的 Grok Bot harness。换句话说，这个模型是为在 agent 循环里持续干活而设计的，不是给一段简短代码就收工。

除了两项编码跑分，SpaceXAI 还报告 Grok 4.7 在办公、法律、临床推理和电气工程方面都比 Grok 4.6 有提升。模型已经上线 Cursor、Grok Build、Grok API、第三方编码 harness、路由器和云平台。另外还有一个快速版本，输出速度和价格都翻倍。

但我还是会把这些结果归为厂商自报数据。对比表里 Grok 4.7 用的是 `xhigh` effort，Grok 4.6 用的是 `high`，版本和推理预算同时变了。改进本身不假，只是单纯模型层面的提升到底有多少，更难拆开来看。

## 价目表只算到了便宜的部分

输入 2 美元、输出 6 美元，Grok 4.7 在 SpaceXAI 自己的对比表里是最便宜的。但 token 单价回答不了"改一个 repo 到底谁更便宜"这个问题。模型可能吃掉更多推理 token、输出更长、调更多工具、测试挂了再来一轮——也可能一次就做对了，省掉这些开销。价目表分不清这两种情况。

早期独立数据也在提醒我们要算完整任务。[Artificial Analysis 测得 Grok 4.7 high 在其智能指数上拿到 46 分](https://artificialanalysis.ai/models/grok-4-7-high)，页面显示这次跑出了 2 亿输出 token，对比模型的中位数是 9200 万。我查看时，[发布页面](https://artificialanalysis.ai/models/releases/grok-4-7)的输出速度和单任务成本还是空的。这只是早期数据，不是定论，但足以说明输出量必须算进成本。

社区早期的讨论也围着这个缺失展开。[r/cursor 的帖子](https://www.reddit.com/r/cursor/comments/1wmgn3m/introducing_grok_47/)里，有人质疑 effort 设置不一致，也有人问模型在 Cursor 里实际表现怎么样。[另一个跑分讨论帖](https://www.reddit.com/r/singularity/comments/1wmh9rg/grok_47_benchmarks/)里，看好的人主要讲价格，反对的人则指出不谈 token 效率光谈价格没什么意义。这些都是第一天的反应，我当成问题看待，不当质量证据。

> **Info:**
>
> 如果是编码 agent，我会记录总输入输出 token、耗时、工具调用次数、测试通过数、修复回合和人工 review 时间。分母是最终被接受的变更数，不是模型调用次数。

## 公平的测试要跑完整个 agent 循环

如果我来测，会把 Grok 4.7、Grok 4.6 和另一个当前方案放在同一批冻结的真实 repo 任务上跑。每个任务要有明确的验收标准：测试通过、要求的功能到位、无关行为没被破坏、reviewer 接受这个改动。每个任务还得跑好几轮，因为一次侥幸通过掩盖不了流程不稳。

harness 也得固定。SpaceXAI 让 Grok 4.7 专门训练去理解 Grok Bot，而 Cursor 用自己的 prompt、工具、上下文筛选和执行循环来包裹模型。一个模型看起来更好，可能是因为它的 harness 喂了更好的上下文，或者帮它从错误里恢复过来。这当然是有价值的产品表现，但不能直接等同于模型本身的能力。

这和我之前在[《token 价格不是账单》](https://markhuang.ai/news/token-price-is-not-the-bill)里分析的采购误区是一回事。token 单价只是预算的一个输入项，不是最终账单。Grok 4.7 让这个区别更尖锐——它宣传的卖点正好是低单价加上更长的自主运行。

## 安全数据也需要自己的验收标准

SpaceXAI 说 Grok 4.7 换了一套新的安全防护体系。公告提到 LatchBio 生物安全基准得分 62.4%，在 HackerBench v0.3 上放行了 3.3% 的高风险双重用途 prompt，同时很少误拒合法的安全工作。数字很具体，但公告没有给出足够的方法论细节，我没法直接拿它来定部署策略。

不管跑分多好看，安全敏感的编码任务我还是会守住基本防线：最小权限凭证、隔离执行、危险改动必须 review、日志要能还原 agent 的每一步操作。更好的拒绝率能降低风险，但替代不了模型外围的那道边界。

## 什么才能让这个价格站住脚

Grok 4.7 不需要每个跑分都赢才有用。如果在同样的 2/6 美元单价下，它比 Grok 4.6 交出更多被接受的改动，那经济性就是实打实地变好了——哪怕别的模型 headline 跑分更高。Terminal-Bench 的涨幅够大，值得做一次受控试验。

我会从一批可回滚、测试充分的 issue 开始，同时设好花费上限和修复次数。跑够量之后，真正要比的东西其实很朴素：每美元通过多少任务、从提交到验收要多久、人工救场的频率有多高。如果 Grok 4.7 在这几项上赢了，那它的价格就是真正的产品优势。眼下，2/6 美元的单价拿到了一次试跑的机会，但还不足以直接写进生产路由。
