跳转到主要内容

Agentic Index 排出 24 个模型,但我仍缺一个失败测试

Artificial Analysis 将智能体评分与成本、速度并列展示。我看到了一份有用的候选名单,但它的两项基准测试无法为我选出生产环境模型。

Artificial Analysis5 分钟阅读
分享:
AI 驱动

AI 驱动 · 每小时限 20 次请求

Mark 研究两条测试赛道,将众多 AI 机器引向单一领奖台
排行榜可以缩小候选范围,但测试内容决定了冠军的真正含义。

Artificial Analysis 现在为智能体性能设立了独立排行榜。我看的时候,页面上只公布了 24 个模型的 Agentic Index 成绩——总共列了 176 个模型。两种 Claude Opus 5 配置以 55 分领先,紧随其后的是满血 GPT-5.6 Sol,54 分。

我喜欢这个变化。工具使用、规划和多步骤任务比又一套简答题更能说明问题。不过,我不会直接让最高分替我选生产模型。指数基于两项有用的测试,给了我一份有依据的候选名单,但它看不到我的工作流、权限、失败代价和恢复路径。

快速解答

问题我的看法
指数测什么?把智能体知识工作和工具型客服合在一起打分。
有用在哪?仪表盘把能力、每任务成本、耗时和输出 Token 数摆在一起看。
局限在哪?两类基准没法复现每个智能体框架、权限模型、数据源或高代价失败场景。
我会怎么用?先筛出候选名单,再拿自己的任务反复跑,重点评估那些我赔不起的失败。

两项测试支撑全部评分

Artificial Analysis 把指数定义为等权重平均。一半来自GDPval-AA v2,评估 44 个职业、九大行业里有经济价值的工作。另一半来自τ³-Banking,一个客服测试——智能体要查政策、跟用户对话、再通过工具完成正确变更。

这些不是那种勾选 ABCD 的选择题。GDPval-AA v2 单条轨迹可以跑到 250 轮对话,Elo 基准锚定在人类专家表现,满分 1000。底层的τ-Banking 环境横跨 21 个产品类别、698 份文档,大约 195,000 Token,平均每个任务要调 9.5 次工具。这是在认真测一件事:当答案散落在多份文档和多步操作里,模型还能不能把活干完。

覆盖面够广,但方向也很具体。一个擅长写知识工作交付物、处理模拟银行请求的模型,拿去搞代码审查、浏览器自动化、采购流程,或者需要严格人工审批的工作流,可能就不合适。等权重只是定义智能体能力的一种方式,不是自然法则。

Mark 比较通过文档和工具运作的办公型智能体与客服型智能体
这两部分都很重要,但它们描述的是两类工作,而非智能体可能部署的所有场景。

有用的部分在评分旁边

我更关注排名旁边的面板。Artificial Analysis 还展示了每任务成本、总指数成本、加权每任务耗时和每任务输出 Token 数。这些数字让页面从奖杯陈列柜变成了采购决策的起点。

一分的优势,如果代价是成本大幅上升、排队等太久,或者 Token 产出太多导致审核成了瓶颈,那这一分根本无所谓。反过来也一样——模型便宜,但失败一次就要退款、人工善后甚至触发合规事件,那就不便宜了。仪表盘给了我算这笔账的部分数据,但后果定价还得我自己来。

我还想把模型和智能体分开看。MIT 的2025 AI Agent Index把这一点说得很清楚:智能体的表现取决于下游工具和自主程度,光评模型本身不够。同一个模型,换个脚手架、少一个搜索工具、权限放宽一点、或者重试机制鼓励坚持而不是谨慎,行为就可能完全不一样。

基准测试维护也是结果的一部分

智能体基准老得很快——模型在进步,测试本身也在被反复审查。Sierra Research 说,他们在准备 τ³-Bench 时修了 50 多个航空和零售任务,改掉了模糊的指令、不可能满足的约束和错误的预期操作。这让基准更准确,但也意味着分数必须标注基准版本和日期。

斯坦福2026 AI Index报告提到,高难度评估几个月就可能饱和,被审查的基准里无效题目比例从 2% 到 42% 不等。我不觉得这是不看排行榜的理由,但确实是提醒:比新旧分数之前,先搞清楚中间改了什么。

Artificial Analysis 之前改过一次版本,Reddit 上吵了一轮。有人觉得旧测试饱和了就该上更难的;也有人担心分数大起大落,长期对比就不可信了。旧任务饱和后加新难题是必须的,但版本历史得让人看得明白。

Mark 将获奖 AI 机器从简单基准测试移入带有闸门和恢复路径的复杂生产工作流
分数再干净,到了自家工作流就得重新算。权限、重试、成本、出了问题能不能兜回来——这些才决定模型能不能上线。

我仍需要一个失败测试

我的下一步会很小、很具体。先从指数排名里挑几个延迟和成本都合身的候选模型,然后在自己的真实环境里给它们同一批代表性任务。每个任务都要跑多轮,记录人工介入次数,并且把可恢复的小错和会对外产生承诺的严重失败分开算。

最后这一步区分,对我来说比谁站上领奖台更重要。草稿写歪了可以重来;但一笔未经授权的交易、一条违反政策的账户变更、一条发给客户的自信回复——这些是另一类失败。评估方法如果不把这层差异点名说清楚,平均成功率只会把它糊弄过去。

Agentic Index 有用,是因为它让模型做真活,而不是光答题。两部分都够难、文档也扎实,对很多选型的人来说值得一看。它帮我更聪明地花评估时间——但最后一道测试,还是得在模型真正要跑的工作流里做。

许可

新闻文本 © 2026 Mark Huang。 新闻文本可在非商业场景下分享或翻译,但需署名并链接到 https://markhuang.ai/zh/news/agentic-index-needs-your-failure-test.

建议署名: 基于「Agentic Index 排出 24 个模型,但我仍缺一个失败测试」(作者:Mark Huang),原文发布于 https://markhuang.ai/zh/news/agentic-index-needs-your-failure-test。