# 换套接口，Astera 的 ARC 分数暴涨 45.1 分

**Summary:** 高强度推理下，GPT-6 Astera 在 ARC Prize 标准接口得分为 54.8%，而在 Provider Adapter 下高达 99.9%。选智能体前，我需要看到这两个数字，因为它的记忆机制本身就是结果的一部分。

- Canonical: https://markhuang.ai/zh/news/astra-arc-score-45-1-point-harness-gap
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-03
- Section: News
- Tags: GPT-6 Astera, ARC-AGI-3, AI 智能体, 智能体接口, 模型评估
- Source: [ARC Prize](https://arcprize.org/blog/astra)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一个发光的推理核心通过一条碎片化的记忆路径和一条完整的记忆路径进入同一个抽象谜题世界](https://cdn.markhuang.ai/news/astra-arc-score-45-1-point-harness-gap/hero.webp)

*同一个模型，两次进入同一个世界。能留住发现的那条路径，走得远得多。*

[ARC Prize 测试了 OpenAI 的 GPT-6 Astra](https://arcprize.org/blog/astra)，在 ARC-AGI-3 上拿到了两个答案——看起来是同一个问题，实际上却差得远。高强度推理下，Astra 在 ARC Prize 的标准接口里只拿到 54.8%，但换成 Provider Adapter（保留不透明的推理状态，还能压缩长对话）之后，分数直接飙到 99.9%。中间差了整整 45.1 分。

我觉得这个接近满分的结果是真的，但功劳不能全算在模型权重头上。这个结果说明，只要工作状态能保留下来，Astra 学起陌生环境来特别厉害。同时也说明，围绕模型的记忆契约直接决定了我能不能看到这种能力。如果我要选一个智能体，这两个事实比 99.9% 这个标题数字更重要。

## 接口改变了分数的意义

ARC-AGI-3 把智能体扔进抽象的回合制环境里，没有明确规则，也没有目标。智能体得自己探索、推断世界怎么运作、找到目标、规划行动。ARC Prize 说人类能解决所有这些环境，所以这个基准测试有人类参照，而不是随便定个及格线。

根据 ARC Prize 的[开源基准测试仓库](https://github.com/arcprize/arc-agi-3-benchmarking)，两种接口在游戏、动作、限制和评分上都保持一致。变的是模型调用之间携带的状态。标准接口用跟提供商无关的文本历史，让模型把有用的发现写进可见笔记里。Provider Adapter 则用 OpenAI 原生的对话处理，包括保留不透明的推理状态和对话压缩。

每个已公布的推理强度级别下，两个分数都差很多。最清楚的对比是高强度：54.8% 对 99.9%。最大强度下是 62.7% 对 98.6%。如果把这两行混在一起，会让人以为 62.7% 和 99.9% 是相同设置跑出来的。其实不是，而且现有结果已经够强了，不需要这种简化。

> **Info:**
>
> 标准分数问的是 Astra 通过通用接口能表现多好。Provider Adapter 分数问的是 OpenAI 整套栈在原生记忆功能加持下能跑出什么结果。前者更适合横向对比，后者更接近真实产品表现。

## 记忆本身就是能力的一部分

ARC-AGI-3 的分数因为上下文处理方式不同而大幅波动，这不是第一次。2026 年 7 月，[OpenAI 报告](https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/)说，保留推理状态和压缩功能让 GPT-5.6 Sol 在公共任务集上的分数从 13.3% 跳到 38.3%，输出 token 还少了六倍。但这两个设置是一起改的，所以实验没法拆开看每项功能各贡献了多少。不过它确实说明了一件事：如果智能体每走一步都得重新想一遍自己之前想过的东西，表现会有多烂。

Astra 的回放录像让这种好处更直观。ARC Prize 看到模型把游戏状态压缩成简短的符号笔记，记下对象、坐标、规则和还没完成的计划。在 Public 和 Semi-Private 任务里，ARC Prize 说 Provider Adapter 跑出来的总耗时快了大约 3.66 倍，两种接口都能解的 167 个游戏加推理强度组合里，token 用量少了 49%。

如果我在做产品评测，会把这条结果带进去。持久状态让 Astra 少做了很多重复工作。ARC Prize 还报告说，Astra 在最大推理强度下，96.0% 的关卡操作次数比人类中位数还少，Provider Adapter 下平均每关操作次数少了 51.7%。

不过操作效率有它的边界。ARC Prize 的[评分方法](https://docs.arcprize.org/methodology)只算影响环境的交互次数，内部推理步骤、工具调用、重试都不算。这个测试告诉我的是 Astra 在外部试错很少的情况下就学会了行动。能耗、需要多少监督、从错误的生产假设里恢复过来——这些都得另外测。

## 公平的基准测试仍可能是不公平的产品测试

对标准结果有个很直接的质疑：为什么要用跟模型训练和部署环境不一样的记忆行为来测试模型？之前 GPT-5.6 结果出来的时候 OpenAI 就提过这个。如果买家想知道“我用 OpenAI 官方支持的栈能拿到什么”，这个质疑确实有道理。99.9% 的结果回答的就是这个问题。

但如果问的是“哪个模型换到不同提供商和运行时环境里适应性最好”，那就不够有说服力了。原生适配器能展示模型的全部能力，但结果绑死了特定提供商的状态处理方式，换个系统未必能复现，也未必能审查。不透明性也是个问题——如果一个错误假设在好几步操作之后还活着，开发者能看到后果，却没法检查到底是什么状态在维持它。

Astra 不是个例。[TechCrunch 报道](https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/)，Nvidia 的研究接口加上记忆支持和监督组件后，把 Claude Opus 5 在 ARC-AGI-3 上的分数从 30% 拉到了 100%。两套设置没法直接比，但都暴露了同一个选型的坑：光看模型名字根本定义不了一个完整的智能体。

公众的反应很快就从分数跳到了 ARC-AGI-3 是不是已经饱和、Astra 算不算 AGI。一个简短的[Reddit 讨论](https://www.reddit.com/r/OpenAI/comments/1w6g0is/gpt_astra_benchmarks/)里两个问题都有。ARC Prize 的态度更谨慎——他们的文章说，在这个严格限定、确定性的基准测试上打满不算证明 AGI，现实世界要开放得多。

## 我希望记分卡上有两条赛道

两条赛道我都留着。通用赛道测可移植性，让跨提供商的比较更靠谱。原生赛道测客户实际能部署的最佳系统。只发通用结果可能埋掉有用的能力；只发原生结果又可能遮住提供商层到底贡献了多少。

如果是生产决策，我会把模型连同接口、状态策略、压缩行为、工具和推理强度一起打版本号。然后在真实工作流里故意制造状态变化：中途改目标、注入错误观察、跨过压缩边界、长时间暂停后恢复。我要测的失败场景是——系统信心十足地维护着一个错误前提。

这和我之前写[Agentic Index](https://markhuang.ai/news/agentic-index-needs-your-failure-test)时的观点一脉相承：排行榜给模型赢得的是测试机会，不是生产资质。Astra 的 99.9% 值得认真对待，而 54.8% 的那组运行告诉我下一步该查什么。记忆层应该写进产品规格和评估记录里，它的故障模式应该写进风险评审里。
