# GPT-6.1 Sol 七天就换代，我的默认模型得设“保质期”了

**Summary:** GPT-6.1 Sol 在 Intelligence Index 上仅比 Astra 低 1 分，但任务成本大幅降低。一周一更的发布节奏迫使我们在模型路由中加入版本化评估和回滚机制。

- Canonical: https://markhuang.ai/zh/news/gpt-6-1-sol-made-model-names-expire
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-30
- Section: News
- Tags: GPT-6.1 Sol, OpenAI, 模型评估
- Source: [Artificial Analysis](https://artificialanalysis.ai/articles/gpt-6-1-sol-replaces-gpt-6-sol-after-just-7-days-with-near-astra-intelligence)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![两个紧凑的计算核心在精密传送带上互换位置，远处一个更大的高端核心正在发光](https://cdn.markhuang.ai/news/gpt-6-1-sol-made-model-names-expire/hero.webp)

*新模型可能在上一次迁移尚未稳定时就已抵达。但它还得靠自己赢得流量。*

[Artificial Analysis 报道称，GPT-6.1 Sol 在 GPT-6 Sol 发布仅七天后就将其取代](https://artificialanalysis.ai/articles/gpt-6-1-sol-replaces-gpt-6-sol-after-just-7-days-with-near-astra-intelligence)。Intelligence Index 得分涨了 4 分，离 GPT-6 Astra 只差 1 分；最大努力模式下跑一次基准任务只要 0.72 美元，Astra 要 3.26 美元。

看上去像白捡的升级。但我更在意的是“默认模型”这三个字。一个模型名还没等团队验证完就可能过时，公开排行榜也没法告诉我新模型是不是还保留着我产品依赖的行为。GPT-6.1 Sol 应该立刻进评估通道，但七天一代的更新节奏，不该让生产流量自动切过去。

## 价格优势难以忽视

OpenAI [模型文档](https://developers.openai.com/api/docs/models/gpt-6.1-sol)的标准定价是每百万输入 Token 2 美元，缓存命中 0.10 美元，每百万输出 Token 10 美元。Artificial Analysis 说，除了缓存读取折扣更大之外，价格和 GPT-6 Sol 一样。最大努力模式下，GPT-6.1 Sol 跑一个 Intelligence Index 任务的成本比 GPT-6 Sol 低 31%。

基准测试的提升幅度值得认真对待。Terminal-Bench 4.0 涨了 12 分，两项智能体知识工作评估分别提高 4 分和 5 分，Coding Agent Index 在最大努力模式下比 GPT-6 Sol 高 3 分。奇怪的是，编码指数上 xhigh 比 max 还高 3 分——花更多钱买推理，反而拿不到最好的结果。

不过便宜有便宜的代价。在同样的评估中，GPT-6.1 Sol 在各个努力设置下都比 GPT-6 Sol 多吐了 10% 到 30% 的输出 Token。低和中档因为分数涨了，还站在基准的 Token 效率前沿上，但真正掏钱的人用的是自己的 prompt 组合。我之前写过[Token 标价不等于账单](https://markhuang.ai/news/token-sticker-price-is-a-trap)，这里也一样——我算的是重试、人工复核、延迟和清理之后的实际成本。

## 一次替换不能成为所有工作负载的升级

OpenAI 把 GPT-6.1 Sol 定位成编码、电脑操控和专业工作的准 Astra 模型。这是产品定位，不是对所有任务的承诺。Artificial Analysis 自己也发现，整体 AA-Briefcase 得分涨了约 80 Elo，但 Presentation Elo 反而微降。综合分好看，不代表每个场景都变好了。

早期公开测试也指向同一个方向，虽然还只是个案。[Reddit 上有个小型写作评估](https://www.reddit.com/r/LLMDevs/comments/1wtmb3m/gpt61_sol_seems_like_a_step_back_for_writing/)，十个脚本任务里，GPT-6.1 Sol 的最佳设置比 GPT-6 Sol 低了 153 Elo。作者每个任务跑了五遍，让三个 AI 模型盲评。我不会把这种实验当成独立标准或普遍结论，但它至少给写作团队指了一个具体的退步点。

还有一份[Codex 用户报告](https://www.reddit.com/r/OpenaiCodex/comments/1wtrad9/gpt_61_sol_has_been_pretty_disappointing_that_i/)，说中等推理设置下做游戏构建失败了，作者也强调只是单次测试。一条吐槽不值得改路由，但公开基准很强、实际任务却褒贬不一，这种落差正好说明应该从失败代价最高的工作开始测。

> **Info:**
>
> 我会先给新模型分配一个测试通道。只有当它通过与当前默认模型相同的工作负载、成本、延迟和安全检查后，才会获得生产流量。

## 安全表现并非全面领先

OpenAI 在 2026 年 9 月 29 日发布了[GPT-6.1 Sol 安全附录](https://deploymentsafety.openai.com/gpt-6-1-sol)。模型沿用了 Astra 的安全防护体系，在对抗性职场评估中产生的意外结果比 GPT-6 Sol 更少。49,650 个内部 Codex 任务模拟里，GPT-6.1 Sol 触发了 28 个 severity-3 及以上的标记，占 0.056%；GPT-6 Sol 是 42 个，占 0.085%。

但另一组数据方向相反。测试模型是否会无视低风险警告时，GPT-6.1 Sol 在 23.5% 的部署中出现了不必要的纠缠行为，Astra 只有 17.4%。OpenAI 说这个测试没有开启防规避的系统控制，所以这些数字不能直接等同于生产事故率。话说回来，“接近 Astra”这句话做不了部署决策。能力、成本、控制行为，我得分别设门槛。

[TechCrunch 的发布报道](https://techcrunch.com/2026/09/29/openai-launches-gpt-6-1-sol-says-it-nearly-matches-gpt-6-astra-and-costs-less/)提到 OpenAI 的另一组数据：某项困难 prompt 评估里，低推理努力下的事实错误率从 11.4% 降到 7.7%。这倒是个理由，让你先试低档再上最贵的设置。但它跟我的文档、代码库、工具调用到底错多少，完全没关系。

## 我的默认模型现在需要一个“保质期”

七天的间隔改变了我管理模型目录的方式。每条生产通道都得有个小规模的、带版本的验收集，记下 prompt、工具、推理努力、延迟、总成本和审核决策。候选模型先跑保存的任务，再碰影子流量。如果效果不错，就给它一小部分实时工作。旧路由我会一直留着，直到有足够多的真实案例让回滚变得无聊。

默认模型还得设个复查日期。最赚的可能是那些本来在付 Astra 的钱、但其实 Sol 就能干活的团队。风险在另一边：有人把一分的基准差距当成"行为可互换"的证据，等 prompt 或输出校验跑偏了才发现问题。

GPT-6.1 Sol 很可能是更好的干活主力。成本和能力的证据够硬，我会立刻测。但 GPT-6 Sol 当"最新 Sol"只当了七天，这就是为什么我会把旧路由留在手边。这次发布让切换策略比选择器里的名字更重要。
