Kimi K3 跑出 57 分,代价是 1.3 亿输出 Token
Kimi K3 在 Artificial Analysis Intelligence Index 上获得 57 分,但其评估产生了约 1.3 亿输出 Token、近 1 美元的任务成本、延迟的权重发布以及 64 加速器的部署建议,共同构成了真实的权衡。
AI 驱动 · 每小时限 20 次请求

Artificial Analysis 的 Kimi K3 页面把好消息和坏消息写在了一起。Kimi K3 在该网站的 Intelligence Index 上拿到 57 分,紧咬着对比中领先的几个闭源系统。但它在整个评估过程中吐出了大约 1.3 亿个输出 Token,而同类模型的平均值只有 6300 万。
这两组数字放在一起才是我想聊的。月之暗面(Moonshot AI)做出了一个能力异常强悍的 2.8 万亿参数模型,权重也快要公开了。但 Kimi K3 并没有让前沿智能显得轻量、廉价或唾手可得——它反而把这笔账算得更清楚了:更强的开放模型确实能在质量上缩小差距,可完成任务所需的推理工作量也跟着大幅膨胀。
答案快照
| 问题 | 我的解读 |
|---|---|
| 发生了什么? | Artificial Analysis 在其 Intelligence Index 上给 Kimi K3 评分为 57,评估中共产生约 1.3 亿输出 Token,每秒输出 62 个 Token,每个基准任务的加权成本约为 0.94 美元。 |
| Kimi K3 是什么? | 月之暗面将其描述为一个拥有 2.8 万亿参数、原生支持视觉、上下文窗口长达一百万 Token 的模型,专为编程、知识工作和推理而构建。 |
| 谁会受益? | 希望立即使用强大托管模型的团队,以及愿意等待权重发布并能处理超大规模部署的研究人员或基础设施运营商。 |
| 有什么陷阱? | 独立评估发现其输出量巨大、输出速度低于平均水平,且每个任务的成本接近其对比中最昂贵的模型。 |
| 我的论点 | Kimi K3 让开放模型的能力更具可信度,但其真正的考验在于每个已完成任务所包含的智能,而非每个基准分数点所代表的智能。 |
一个高分,一条长尾
Artificial Analysis 表示,其 4.1 版 Intelligence Index 综合了九项评估,涵盖知识、科学、银行、编程、长上下文和终端工作。在这个综合指标上,Kimi K3 的 57.1 分落后于 Claude Fable 5 with fallback(59.9 分)和 GPT-5.6 Sol max(58.9 分),但领先于对比图中展示的其他多个专有和开放模型。
我认为这确实值得注意。这不是厂商在精心挑选的任务上宣布胜利的图表,而是一个独立的评测框架将 Kimi K3 置于其测试过的最强系统所在的性能区间。月之暗面自己的 Kimi K3 发布文章也异常明确地指出,该模型在整体性能上仍落后于最强大的专有模型。
但同一页独立记录显示,Intelligence Index 运行产生了 1.3 亿个输出 Token,是 6300 万对比平均值的两倍多。Artificial Analysis 还报告其输出速度为每秒 62 个 Token,低于 73 个 Token 的平均值。这些数字提醒我别把分数当成全部。一个模型完全可以在能力上逼近顶尖,但走到那里的路又长又贵。

Token 消耗量改写了成本账
Kimi K3 页面列出了托管定价:每百万输入 Token 3 美元,每百万输出 Token 15 美元。在整个 Intelligence Index 评估中,Artificial Analysis 称运行该模型花费了 2690.80 美元。其每个任务的加权成本约为 0.94 美元,低于同一对比中的 GPT-5.6 Sol max,但远高于多个综合智能分数更低的模型。
所以我不会把 K3 叫做"便宜的前沿模型"。在这组特定基准上它确实比前两名省钱,但离"推理白菜价"还差得远。一篇在 K3 发布前发表的 TechRadar 评测 报告称,Kimi K2.6 API 定价约为每百万输入 Token 0.55 美元,每百万输出 Token 2.65 美元。虽然两者能力并非完全可比,但这表明 K3 如何彻底改变了 Kimi 过去的低价策略。
因此,我发现最有说服力的公开问题并非 K3 是否“真的”属于前沿。在一个 LocalLLaMA 关于基准结果的讨论 中,开发者们立刻询问最大推理会使用多少 Token,以及长时间思考是否会抹去价格优势。这才是正确的怀疑态度。输出单价、冗余输出、延迟和重试率会层层叠加。
今天的“开放”只是一个交付时间表
月之暗面称 Kimi K3 是首个 3 万亿参数级别的开放模型,但其发布文章表示完整权重将于 2026 年 7 月 27 日发布。文章还称,包含更多架构、训练和评估细节的技术报告将随权重一同发布。在我检查公告时,托管模型已通过 Kimi 的产品和 API 提供;承诺的权重发布仍是未来的工作。
但这不意味着“开放”的说法毫无意义。给了具体日期总比画饼强,况且月之暗面已经为 Kimi K2.5 交出了代码仓库和模型权重。不过措辞得精确:Kimi K3 现在是服务,不是开源项目。等权重文件和许可证真正落地,它才算一个可审查、可下载的开放权重版本。
这一区别对最能从开放权重中受益的人至关重要。研究人员需要 checkpoint 和技术报告来复现结论。基础设施团队需要模型文件和服务支持来估算内存、吞吐量和运营成本。考虑使用托管 API 的产品团队可以更早开始,但他们评估的是月之暗面的服务,而非未来版本所承诺的可移植性。

架构并未让它变小
月之暗面表示,K3 通过其 Stable LatentMoE 设计激活了 896 个专家中的 16 个,并将这种稀疏性与 Kimi Delta Attention 和 Attention Residuals 相结合。该公司声称,这些改进使其扩展效率比 Kimi K2 提高了约 2.5 倍。这些是开发者的架构声明,而非独立的部署结果,因此我会等到技术报告发布后再下定论。
但有一个操作细节已经足够具体,足以重置预期。月之暗面建议在至少配备 64 个加速器的超节点配置上部署 Kimi K3。稀疏激活减少了每个 Token 相对于使用所有参数所需的工作量,但它并没有把一个 2.8 万亿参数的 checkpoint 缩成一台工作站就能跑的东西。权重存储、专家路由、高带宽通信、散热和推理服务软件,一样都不能少。
开放权重的故事到这里就分成了两条线。大型实验室和推理服务商确实能拿到对前沿系统的实质掌控力。但对大多数独立开发者来说,即使权重公开了,K3 仍然会通过 API 或托管平台来用。“开放”扩大了能审查和部署模型的人群,但不等于人人都部署得起。

切换前我会衡量什么
如果我要为智能体编程或研究评估 Kimi K3,我不会从 57 分的分数开始。我会从一组具有已知答案、固定工具权限和评审标准的任务集开始。然后我会衡量任务接受率、总输出和推理 Token 数、完成时间、工具调用次数、重试次数和人工修正时间。
我还会测试推理强度档位——如果有的话。月之暗面表示 K3 默认以最大推理强度启动,低强度和高强度模式稍后才会推出。在常规任务上少花点推理预算,可能比多拿一个基准分数更实际,毕竟独立数据已经表明 K3 的默认路径相当吃 Token。
最后,我会将托管决策与开放权重决策分开。对于 API,问题在于可靠性、隐私条款、速率限制、延迟和成功任务成本。对于自托管,问题在于许可证、量化质量、硬件拓扑、部署支持和总体拥有成本。一个模型名称并不代表这是同一种采购选择。
我的结论
Kimi K3 值得关注,因为独立结果支持了其核心能力声明。57 分的成绩将一个已宣布的开放权重模型带入了一个性能梯队,而这个梯队最近还是封闭系统的专属领地。这为开发者提供了更多筹码,也为开放模型生态系统设定了一个更大的优化目标。
但那 1.3 亿输出 Token 让我无法将这一结果视为一场胜利巡游。前沿能力固然宝贵,但通过冗长的推理轨迹、较慢的生成速度和庞大的部署规模实现的能力,在运营上仍然可能是错误选择。Kimi K3 已经登顶。现在我想看看各团队能不能扛住 Token 账单、拿到承诺的权重,然后高效地把这些智能变成真正完成的工作。
许可
新闻文本 © 2026 Mark Huang。 新闻文本可在非商业场景下分享或翻译,但需署名并链接到 https://markhuang.ai/zh/news/kimi-k3-130-million-token-catch.
建议署名: 基于「Kimi K3 跑出 57 分,代价是 1.3 亿输出 Token」(作者:Mark Huang),原文发布于 https://markhuang.ai/zh/news/kimi-k3-130-million-token-catch。
