ARC Prize 验证 DeepSeek V4 Flash 达到 61.4%,每个任务费用为 0.04 美元
ARC Prize 的外部评估文件记录了 Liang Wenfeng 的 open-weight 模型从 Max 努力下的 61.4% 降至 Low 下的 46.0%,且 Max 的每个任务成本为 $0.04。
By Ryan Merket · Published
Primary source: ARC Prize
Why it matters
ARC Prize's outside evaluation gives developers a checkpoint-specific measurement of DeepSeek V4 Flash's ARC-AGI-2 performance, reasoning-effort curve and benchmark cost.

ARC Prize 验证了 DeepSeek V4 Flash 0731 在 ARC-AGI-2 半私有评测(最大推理努力)中的得分为 61.4%,并报告每个任务的成本为 $0.04。该结果对应于 7 月 31 日的检查点,并包含三个努力等级:Max 为 61.4%,High 为 56.0%,Low 为 46.0%。
ARC Prize 通过其验证项目评估了该命名检查点并报告了任务表现与成本。这里关注的是该外部评估。该检查点来自 DeepSeek,这家总部位于杭州的 AI 公司由 Liang Wenfeng 创立。
ARC Prize 结果页面 将该结果标记为已验证,并标识了 Max、High 和 Low 推理变体。该页面还报告了在最大努力下 ARC-AGI-1 半私有评测的 89.0%,每个任务成本为 $0.02。
ARC Prize 创建了其验证项目,因为结果会因提示、数据集策划和测试方法而异。其方法论将资源效率视为测量的一部分,这也是结果页面在报告任务完成率的同时显示成本的原因。
该 $0.04 数字适用于本次评估中在最大努力下的每个 ARC-AGI-2 任务。它并非对编码代理任务、研究运行或其他负载的一般定价。
三个努力等级揭示 ARC-AGI-2 的成本权衡
ARC Prize 在半私有基准上测试了 Max、High 和 Low 推理变体。V4 Flash 在 Max 下得分 61.4%,High 下得 56.0%,Low 下得 46.0%。
15.4 个百分点的差距显示了 ARC-AGI-2 结果对推理投入的高度依赖。除非运营者还能看到产生最高分所需的计算量,否则模型的最高分对生产规划的指导作用有限。DeepSeek 将推理努力作为一个参数公开,允许开发者根据工作负载的延迟和开支限制调整推理深度。
ARC Prize 报告的 $0.04 数字仍然特指最大努力的 ARC-AGI-2 评测。重复的工具调用、长上下文窗口和大输出都可能使应用的成本远高于单次基准任务的费用。
DeepSeek 当前的 API 定价 显示 V4 Flash 的费用为每百万未缓存输入 token $0.14、每百万缓存输入 token $0.0028 和每百万输出 token $0.28。这些 token 费率解释了 DeepSeek 如何对普通 API 使用计费;它们并不构成通用的单任务价格。
Liang's efficiency discipline came from quantitative trading
Liang 在 2023 年创立 DeepSeek,此前他建立了 High-Flyer——一家将机器学习应用于自动化交易的量化对冲基金。据 Fortune 报道,他在 Zhejiang University 获得电子信息工程学士学位和信息与通信工程硕士学位。
这一背景有助于解释 DeepSeek 对模型能力与计算关系的关注。量化交易奖励那些在成本计算中也能存活下来的改进。DeepSeek 通过模型架构、API 定价和开源发布将这种纪律性应用到产品中。
据 DeepSeek 的技术论文,V4 Flash 包含 2840 亿个总参数,而每个 token 大约激活 130 亿个参数。其混合专家(mixture-of-experts)设计将每个 token 路由到模型的子集,而不是对每个请求使用所有参数。
V4 论文将 Liang 列为 300 多名作者之一,并描述了 compressed sparse attention、heavily compressed attention、manifold-constrained hyper-connections 和 Muon optimizer。该架构支持一百万 token 的上下文窗口,而 DeepSeek 的 API 文档列出最大输出为 384,000 tokens。
据其 透明中心 报道,DeepSeek 于 4 月 24 日发布了更广泛的 V4 家族。ARC Prize 将 V4 Flash 0731 检查点的结果标定为 7 月 31 日,并标识了 Max、High 和 Low 变体。命名检查点将已验证的分数与特定模型版本关联起来。
开放权重扩大了检查点的分发范围
DeepSeek 在 Hugging Face 上以 MIT 许可证发布了 V4 Flash 0731 权重。模型卡为 Transformers、vLLM、SGLang 和 Docker 提供了部署路径,并附有本地推理的说明。
该发布为 DeepSeek 提供了两条采纳路径。开发者可以使用托管 API,而基础设施团队则可以自行运行该检查点并修改周边的推理栈。可下载的权重和宽松的许可使模型能够被在 DeepSeek 服务器之外运行的用户采用。
ARC-AGI 有其局限。它评估的是对陌生视觉推理任务的适应性,而不是生产代理所需的一整套可靠性、安全性、编码和工具使用行为。ARC Prize 没有列出 V4 Flash 0731 的 ARC-AGI-3 成绩。该基准更接近需要代理在交互式环境中随时间收集信息并采取行动的场景。
已验证的结果在可记录的条件下回答了一个狭窄的问题:DeepSeek V4 Flash 0731 在最大努力下解决了 61.4% 的 ARC-AGI-2 半私有任务,报告的每任务成本为 $0.04。High 和 Low 努力下较低的得分显示了当模型在推理上投入更少计算时该结果发生了多大变化。