# Agentic Index 排出 24 个模型，但我仍缺一个失败测试

**Summary:** Artificial Analysis 将智能体评分与成本、速度并列展示。我看到了一份有用的候选名单，但它的两项基准测试无法为我选出生产环境模型。

- Canonical: https://markhuang.ai/zh/news/agentic-index-needs-your-failure-test
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-08-06
- Section: News
- Tags: AI, AI 智能体, 模型评估, 基准测试, 开发者工具
- Source: [Artificial Analysis](https://artificialanalysis.ai/?intelligence=agentic-index)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![Mark 研究两条测试赛道，将众多 AI 机器引向单一领奖台](https://cdn.markhuang.ai/news/agentic-index-needs-your-failure-test/hero.webp)

*排行榜可以缩小候选范围，但测试内容决定了冠军的真正含义。*

[Artificial Analysis 现在为智能体性能设立了独立排行榜](https://artificialanalysis.ai/?intelligence=agentic-index)。我看的时候，页面上只公布了 24 个模型的 Agentic Index 成绩——总共列了 176 个模型。两种 Claude Opus 5 配置以 55 分领先，紧随其后的是满血 GPT-5.6 Sol，54 分。

我喜欢这个变化。工具使用、规划和多步骤任务比又一套简答题更能说明问题。不过，我不会直接让最高分替我选生产模型。指数基于两项有用的测试，给了我一份有依据的候选名单，但它看不到我的工作流、权限、失败代价和恢复路径。

## 快速解答

| 问题     | 我的看法                              |
| ------ | --------------------------------- |
| 指数测什么？ | 把智能体知识工作和工具型客服合在一起打分。             |
| 有用在哪？  | 仪表盘把能力、每任务成本、耗时和输出 Token 数摆在一起看。  |
| 局限在哪？  | 两类基准没法复现每个智能体框架、权限模型、数据源或高代价失败场景。 |
| 我会怎么用？ | 先筛出候选名单，再拿自己的任务反复跑，重点评估那些我赔不起的失败。 |

## 两项测试支撑全部评分

Artificial Analysis 把指数定义为等权重平均。一半来自[GDPval-AA v2](https://artificialanalysis.ai/methodology/intelligence-benchmarking)，评估 44 个职业、九大行业里有经济价值的工作。另一半来自[τ³-Banking](https://artificialanalysis.ai/evaluations/tau3-banking)，一个客服测试——智能体要查政策、跟用户对话、再通过工具完成正确变更。

这些不是那种勾选 ABCD 的选择题。GDPval-AA v2 单条轨迹可以跑到 250 轮对话，Elo 基准锚定在人类专家表现，满分 1000。底层的[τ-Banking 环境](https://taubench.com/blog/tau-knowledge.html)横跨 21 个产品类别、698 份文档，大约 195,000 Token，平均每个任务要调 9.5 次工具。这是在认真测一件事：当答案散落在多份文档和多步操作里，模型还能不能把活干完。

覆盖面够广，但方向也很具体。一个擅长写知识工作交付物、处理模拟银行请求的模型，拿去搞代码审查、浏览器自动化、采购流程，或者需要严格人工审批的工作流，可能就不合适。等权重只是定义智能体能力的一种方式，不是自然法则。

![Mark 比较通过文档和工具运作的办公型智能体与客服型智能体](https://cdn.markhuang.ai/news/agentic-index-needs-your-failure-test/two-tests.webp)

*这两部分都很重要，但它们描述的是两类工作，而非智能体可能部署的所有场景。*

## 有用的部分在评分旁边

我更关注排名旁边的面板。Artificial Analysis 还展示了每任务成本、总指数成本、加权每任务耗时和每任务输出 Token 数。这些数字让页面从奖杯陈列柜变成了采购决策的起点。

一分的优势，如果代价是成本大幅上升、排队等太久，或者 Token 产出太多导致审核成了瓶颈，那这一分根本无所谓。反过来也一样——模型便宜，但失败一次就要退款、人工善后甚至触发合规事件，那就不便宜了。仪表盘给了我算这笔账的部分数据，但后果定价还得我自己来。

我还想把模型和智能体分开看。MIT 的[2025 AI Agent Index](https://aiagentindex.mit.edu/)把这一点说得很清楚：智能体的表现取决于下游工具和自主程度，光评模型本身不够。同一个模型，换个脚手架、少一个搜索工具、权限放宽一点、或者重试机制鼓励坚持而不是谨慎，行为就可能完全不一样。

> **Info:**
>
> 我会用 Agentic Index 决定把测试预算花在谁身上，而不是把生产权限发给谁。

## 基准测试维护也是结果的一部分

智能体基准老得很快——模型在进步，测试本身也在被反复审查。Sierra Research 说，他们在准备 τ³-Bench 时修了 50 多个航空和零售任务，改掉了模糊的指令、不可能满足的约束和错误的预期操作。这让基准更准确，但也意味着分数必须标注基准版本和日期。

斯坦福[2026 AI Index](https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance)报告提到，高难度评估几个月就可能饱和，被审查的基准里无效题目比例从 2% 到 42% 不等。我不觉得这是不看排行榜的理由，但确实是提醒：比新旧分数之前，先搞清楚中间改了什么。

Artificial Analysis 之前改过一次版本，[Reddit 上吵了一轮](https://www.reddit.com/r/singularity/comments/1q8b3pp/big_change_in_artificialanalysisai_benchmarks/)。有人觉得旧测试饱和了就该上更难的；也有人担心分数大起大落，长期对比就不可信了。旧任务饱和后加新难题是必须的，但版本历史得让人看得明白。

![Mark 将获奖 AI 机器从简单基准测试移入带有闸门和恢复路径的复杂生产工作流](https://cdn.markhuang.ai/news/agentic-index-needs-your-failure-test/workflow-risk.webp)

*分数再干净，到了自家工作流就得重新算。权限、重试、成本、出了问题能不能兜回来——这些才决定模型能不能上线。*

## 我仍需要一个失败测试

我的下一步会很小、很具体。先从指数排名里挑几个延迟和成本都合身的候选模型，然后在自己的真实环境里给它们同一批代表性任务。每个任务都要跑多轮，记录人工介入次数，并且把可恢复的小错和会对外产生承诺的严重失败分开算。

最后这一步区分，对我来说比谁站上领奖台更重要。草稿写歪了可以重来；但一笔未经授权的交易、一条违反政策的账户变更、一条发给客户的自信回复——这些是另一类失败。评估方法如果不把这层差异点名说清楚，平均成功率只会把它糊弄过去。

Agentic Index 有用，是因为它让模型做真活，而不是光答题。两部分都够难、文档也扎实，对很多选型的人来说值得一看。它帮我更聪明地花评估时间——但最后一道测试，还是得在模型真正要跑的工作流里做。
