# Claude Sonnet 5.5 开启“最大努力”模式，为何反而拉低了基准分数？

**Summary:** Claude Sonnet 5.5 承诺降低任务成本并提速 30%，但 Anthropic 自家的 FrontierCode 脚注显示，“最大努力”模式增加了代理调用，反而损害了得分。我建议按任务路由 effort 设置，而非全局设为最高。

- Canonical: https://markhuang.ai/zh/news/claude-sonnet-5-5-max-effort-benchmark-worse
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-28
- Section: News
- Tags: Claude Sonnet 5.5, Claude Code, 编码代理, 模型评估, AI 成本
- Source: [Anthropic](https://www.anthropic.com/claude-sonnet-5-5)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一条机械任务流水线将简单卡片送入快速通道，而另一条通道则循环通过额外的检查臂](https://cdn.markhuang.ai/news/claude-sonnet-5-5-max-effort-benchmark-worse/hero.webp)

*更多努力能换来更多检查，但也可能增加任务本不需要的复杂机制。*

Anthropic 于 2026 年 9 月 28 日[发布了 Claude Sonnet 5.5](https://www.anthropic.com/claude-sonnet-5-5)，主打一个异常务实的卖点：输出速度比 Sonnet 5 快 30% 以上，单任务成本最高可降低 30%。不过要注意，token 费率并未变动，仍为每百万输入 token 2 美元、每百万输出 token 10 美元。

在我看来，这款模型与其说是一次全面升级，不如说提供了一个新的路由选择。Anthropic 表示，Sonnet 5.5 最适合处理范围明确的日常任务，而 Opus 5.5 仍是需要持续判断力的开放式工作的首选。当我调高 effort 设置时，新 Sonnet 确实能缩小两者差距，但官方发布的数据恰恰说明了为何我不该始终把 effort 设为最大值。

## 更便宜的通道取决于 effort 设置

Anthropic 报告称，Sonnet 5.5 在 Terminal-Bench 4.0 上得分为 70.6%，而 Sonnet 5 仅为 10.3%。但这是厂商自测数据，不能直接等同于你在实际开发中的表现。对我来说，成本曲线更有参考价值。在 Anthropic 的多项测试中，Sonnet 5.5 在 Low 或 Medium effort 下的表现优于 Sonnet 5 的最佳成绩，而单任务成本仅约为后者的十分之一。在更高 effort 下，其性能和成本均可接近 Opus 5.5。

基准测试页面里藏着一个产品决策：Claude 应用和 Claude Code 默认走 Medium effort，Claude Platform 默认走 High。同一个模型名，入口和配置不同，延迟、token 用量、检查力度全都不一样。

这个问题很现实：Sonnet 5.5 接替的 Sonnet 5 本身就有性价比短板。今年 7 月一项[针对 Sonnet 5 的独立分析](https://fronset.ai/benchmark/journal/claude-sonnet-5-benchmark-analysis/)说它又快又能打，但在 52 项任务的基准测试中（仅部分模型参与），没有拿到任何“最便宜且够用”的胜出。Anthropic 这次用更少的步骤、更少的 token 来正面回应这个质疑。不过，效果如何我还得在自己的工作上验证。

## 最佳证据藏在脚注里

在 FrontierCode 测试中，Sonnet 5.5 在 Max effort 下的得分反而低于 Xhigh。Anthropic 的解释是，Max effort 让模型更频繁地调用 Claude Code 的代码审查功能，而这个功能会把审查拆分给多个子 agent。Cognition 检查的两个案例里，多出来的工作要么超时，要么改了任务范围之外的东西，分数反而掉了。

我觉得这个细节比头条上的百分比更有意思。模型不是简单地“多想一会儿”——更高的 effort 改变了整个工作流，多了几个 agent 参与，也就多了几种出错的方式。听起来更稳妥的配置，反而可能多跑一轮审查，或者直接跑超时。

这和我之前写[“更强的编码代理为何可能需要更少工具”](https://markhuang.ai/news/stronger-coding-agents-fewer-tools)时看到的规律一样：真正该评估的是模型、框架、工具、任务这四者的组合，effort 设置本身就是这个系统的一部分，不是我随手往右拧的质量旋钮。

> **Info:**
>
> 日常修 bug 从 Medium 起步，只有明确需要多跑一轮时才上 High，Xhigh 和 Max 必须有数据支撑才开。我看的指标是每次最终被接受的结果花了多少钱，重试和人工审查都算在内。

## API 迁移也有账单

[Sonnet 5.5 迁移指南](https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide)说得很清楚，换模型 ID 只是开头。现在请求里不写 `thinking` 字段也会自动跑自适应思考。思考 token 按输出 token 计费，而且如果你的代码假设第一个响应块就是文本，可能会挂——因为思考块可能先到。

如果你完全不想要前置思考，得用 `between_tools` 替代原来的 disabled 设置，而且这个模式只到 High effort 为止。Xhigh 和 Max 强制开启自适应思考，参数组合不对直接返回 400。Anthropic 的自查清单也建议团队重新跑一遍 effort 梯度测试，重新定成本基线。

这个建议很实在，因为宣传的省下来的钱是 Anthropic 测试里的平均值。你自己的工具循环一长、输出预算一大、审查功能一分发给多个 agent，省下来的钱分分钟花回去。我会拿接近生产环境的任务跑一遍，记录每次被接受的结果花了多少 token、实际耗时多久、有没有超时、有没有超范围修改。

## 回退机制让模型名称不再绝对

Sonnet 5.5 也是第一个加上 Anthropic 强化网络安全防护的 Sonnet。常规软件开发不受影响，但公司说高风险的网络安全请求会明显回退到 Sonnet 5。[系统卡](https://www.anthropic.com/claude-sonnet-5-5-system-card)里有这次发布的安全评估细节，Anthropic 说他们的自动化行为审计跑了大约 1,850 个场景。

回退可能是正确的安全选择，但它改变了生产环境评估到底在测什么。如果一个请求从 Sonnet 5.5 开始、在 Sonnet 5 上完成，日志里必须记下这件事。不然团队可能会把延迟、拒绝行为或任务质量的问题归错模型。

第一个[公开发布帖](https://www.reddit.com/r/ClaudeAI/comments/1wslxzs/introducing_claude_sonnet_55_the_second_model_in/)大多太早、太零散，还看不出质量。不过里面确实有人立刻担心网络回退的问题，也有人对基准测试的差距很兴奋。我会把这两种反应都当成测试思路，而不是证明模型要么废了要么神了的证据。

## 我会购买效率，然后设限

Sonnet 5.5 想解决的是一个很具体的问题：Sonnet 5 跑得快，但不一定是最便宜的"够用"选项。Anthropic 这次说，同样的 token 单价，更少的工具调用、更少的 token、更短的等待，结果还更好。

我会先在 Anthropic 说的那些场景里试：边界清楚的编码任务、文档处理、对速度敏感的重复活。难点在于“这活儿到底该做成什么样”的工作，我继续交给 Opus。Max 不会当全局默认。Anthropic 自己的基准测试已经把翻车模式摆出来了：模型更卖力，叫了更多帮手，分数反而更低。
