跳转到主要内容

四分钱拿下 61.4%:DeepSeek V4 Flash 的推理边界在哪?

ARC Prize 验证 DeepSeek V4 Flash 0731 在 ARC-AGI-2 上以每任务 0.04 美元成本达成 61.4% 准确率。这为低成本推理开辟了新路径,但也划清了基准测试与生产应用的界限。

ARC Prize5 分钟阅读
分享:
AI 驱动

AI 驱动 · 每小时限 20 次请求

Mark 正研究一台温暖的卡通谜题机器,它把彩色网格卡片变成答案,旁边还堆着几枚硬币
四分钱的推理成绩值得关注,但也要把这道题到底考了什么说清楚。

ARC Prize 于 2026 年 7 月 31 日公布了 DeepSeek V4 Flash 0731 的验证结果,覆盖三档推理设置。最大努力下,模型在 ARC-AGI-1 半私有集上每道题花 0.02 美元拿到 89.0%,在 ARC-AGI-2 上每道题 0.04 美元拿到 61.4%。

这个组合没法轻描淡写地放过。但我的关注点比排行榜上的欢呼更窄:我想把 DeepSeek 放进低成本推理的候选名单,而不是假装同样的四分钱就能买到一个靠谱的智能体或一套交付方案。

快速答案

问题我的解读
有什么变化?DeepSeek V4 Flash 0731 在最大推理模式下在 ARC-AGI-2 上达到了 61.4%,而低推理模式下仅为 46.0%。
为什么重要?经验证的成本是每道 ARC-AGI-2 题 0.04 美元,更强的推理已经便宜到可以按需加码。
测试覆盖了什么?静态彩色网格问题,通过精确输出评分,没有智能体框架或客户端工具。
它没有证明什么?工具调用、长时间运行的可靠性、出错后的恢复、高并发下的延迟,以及每个真正交付的结果的综合成本。
我的决定放进具体工作负载里跑一遍。不能光凭这个分数就把它从解题选手提拔成默认智能体。

多花推理算力确实换来了真提升

三档设置让这比一个头条数字有用得多。ARC-AGI-2 上,低推理 46.0%,高推理 56.0%,最大推理 61.4%。ARC-AGI-1 的涨幅更小,从 84.0% 到 87.0% 再到 89.0%。越难的题集,档位之间的差距越明显——低档到最大档拉开了 15.4 个百分点。

我看到的是路由决策:便宜跑一遍够用就用便宜的;一旦失败代价超过几分钱,就给真正需要的题多分配算力。我能据此行动,而"哪个模型更聪明"这种争论对我毫无意义。

Mark 在三条卡通推理路径中做选择,这些路径使用越来越多的谜题步骤和硬币来获得更强的彩色网格结果
推理档位是一个产品级开关。真正该问的是:再跑一遍能把结果改多少,值不值这点成本。

四分钱说的是这场考试,不是所有活

ARC-AGI 故意出得很紧凑:给模型看几组彩色网格变换的样例,让它推出规则,再补上缺失的那张网格。ARC Prize 指南说,半私有的 ARC-AGI-2 评估共 120 道题,只有输出和标准答案完全一致才算对。它用 pass@2,允许猜两次,因为有些题本身就带有明确歧义。

这个基准很擅长把"面对陌生抽象题时的临场适应力"单独拎出来测,但也正因为如此,它被控制得很死。ARC Prize 的验证测试政策写得很清楚:ARC-AGI-1 和 ARC-AGI-2 只把模型当输入到输出的预测器来评。没有智能体框架,也不挂任何客户端工具。

这条边界直接决定了我怎么用这个结果。一个真正上线的智能体得自己选工具、维护状态,还得能发现中间结果出了问题、及时恢复、知道什么时候该停。这些 ARC 都不考。

模型本身还有更大的产品叙事

DeepSeek 的官方 API 文档显示,当前 Flash 版本为 DeepSeek-V4-Flash-0731,支持思考与非思考两种模式、工具调用,上下文窗口达到 100 万 token。这些能力让它有资格接入更复杂的工作流——但静态推理分数并不能证明工作流本身跑得通。

有一篇Reddit 帖子就跳过了这一步,说基准跑分便宜了,智能体循环就更现实了。作者后来自己补了更正:图表把不同推理配置混在一起画,当成本-性能讨论的引子还行,当严谨排名就不够格。我同意这个更正。便宜的尝试确实能支撑重试和校验,前提是这些检查能拦住真正要紧的错误。

这个分数我能信到什么程度

ARC-AGI-2 的初衷就是让 AI 觉得难,但人还能做。它的基准论文把这道题定义成"面对新问题时习得技能的能力"——这比那些靠背知识点就能刷高分的测试有意思多了。

不过质疑的声音也得听。一篇针对 ARC-AGI 和 OpenAI o3 的独立分析指出,这类网格题属于特定题型,可能更奖励大量试错而非真正理解规则。ARC Prize 自己的2025 年技术报告也提醒,前沿推理模型的表现仍然受限于知识覆盖面,还可能催生新型基准污染。

这些批评告诉我这条线画在哪:61.4% 说明模型在这场考试里把陌生视觉变换处理得不错。但如果把它当成"通用智能达到了 61.4%",或者指望 61.4% 的业务需求都能搞定,那就是让一个数字背它背不动的东西了。

Mark 将一个小型卡通 AI 机制从整洁的彩色网格谜题台引导到一条带门的测试通道旁,旁边是一个充满工具的混乱工作流
从基准到上线还得再过一道关。真实工作流里多了工具、状态、审批、容错,还有后果。

我的看法

凡是还在用昂贵推理当默认方案的地方,我都会拿 DeepSeek V4 Flash 0731 去试。先挑有确定性评分器或强校验逻辑的小范围任务,同一批题分别用低、高、最大三档跑,看延迟和每个最终交付结果的综合成本,只在多花推理确实划算的场景里加档。

四分钱的 ARC-AGI-2 成绩让 DeepSeek 进了我的候选名单,但采购决定得等它真正跑通了业务再下。比起"智能突然几乎免费"这种说法,我更关心一个更实际的问题:一个好的调度层能不能更频繁地请求深度推理,同时在模型碰触工作流其余环节之前,仍然要求它拿出证据。

许可

新闻文本 © 2026 Mark Huang。 新闻文本可在非商业场景下分享或翻译,但需署名并链接到 https://markhuang.ai/zh/news/deepseek-v4-flash-four-cent-score.

建议署名: 基于「四分钱拿下 61.4%:DeepSeek V4 Flash 的推理边界在哪?」(作者:Mark Huang),原文发布于 https://markhuang.ai/zh/news/deepseek-v4-flash-four-cent-score。