DeepSeek 推出 V4 Flash,具备强劲的 agent 得分和低廉的 API 价格

DeepSeek 的开放权重模型在 API 价格上低于竞争对手,而第三方测试将其最大推理版本评为同类中接近顶尖。

By · Published

Primary source: Simon Willison's Weblog

Why it matters

Agent products can burn through tokens on reasoning and tool calls. DeepSeek is cutting that variable cost while keeping the weights available for independent deployment.

Illustration of DeepSeek V4 Flash depicted as a robotic hand manipulating symbols of data and value.

DeepSeek, founded by Liang Wenfeng, released DeepSeek-V4-Flash-0731 on July 31st, pairing an MIT-licensed model with API prices low enough to change the cost assumptions behind coding agents and other token-heavy software.

DeepSeek 将此次发布描述为 V4 Flash 的正式版本,用以替换其预览检查点并带来“显著增强的代理能力”。一项早期独立评估支持了该说法的部分内容:Artificial Analysis 给该模型的最大推理配置打出 Intelligence Index 评分 50,在其比较类别中 101 个大型开源权重模型中排名第三。

这一名次之所以重要,是因为 DeepSeek 根据其 current API pricing page 对未命中缓存的输入令牌收取每百万 $0.14、对输出令牌收取每百万 $0.28。缓存命中输入降至每百万 $0.0028。该模型支持 100 万令牌的上下文窗口和多达 384,000 个输出令牌,为开发者提供了在不立即承受高端专有模型经济成本的情况下运行长时间编码、研究和工具使用会话的空间。

此次发布延续了 Liang 自 2023 年创建 DeepSeek 以来所推行的策略:发布高性能权重,对托管推理采取积极的收费策略,并让外部开发者将底层研究转化为产品。Liang 通过量化金融进入模型开发领域。他在浙江大学学习信息与通信工程,随后共同创立了 High-Flyer。

这一背景有助于解释对效率的关注。量化交易在规模化时会奖励吞吐量、延迟和成本方面的改进。DeepSeek 的模型工作将同样的纪律应用到推理上,在那里令牌价格上微小的差异即可决定一个代理是停留在演示阶段还是成为可行的产品。

基准案例很有说服力,但存在注意事项

独立开发者 Simon Willison 在一篇 7 月 31 日的帖子中强调了该模型的性价比位置。他指出 Artificial Analysis 将 V4 Flash 排在 MiniMax M3 之前,并将其描述为按所测智能单位的最佳价值的有力竞争者之一。

Willison 还提醒人们注意推理设置会影响开发者实际得到的输出。在默认推理级别通过 OpenRouter 运行 V4 Flash 时,生成了一幅破碎的鹈鹕骑自行车的插图。将 reasoning_effort 提高到 high 后,生成了一幅连贯的图像,鸟儿坐在一辆可识别的自行车上。

该实验属于轶事,但它揭示了聚合排行榜可能掩盖的一个操作性权衡。DeepSeek 最强的第三方结果来自最大推理配置,该配置可能消耗更多的输出令牌和时间。DeepSeek 的低令牌价格降低了额外计算带来的财务惩罚,尽管开发者仍需在自己的工作流中测试延迟和可靠性。

DeepSeek 的 模型卡 也需要仔细阅读。模型卡显示 V4 Flash 在 Terminal-Bench 2.1 得分 82.7,在 DeepSWE 得分 54.4,在 Toolathlon-Verified 得分 70.3。DeepSeek 使用一个精简版的 DeepSeek Harness 进行了公开的代码代理评估,模型卡称该 Harness 稍后会发布。另有两项报告结果,DSBench-FullStack 和 DSBench-Hard,使用的是 DeepSeek 的内部测试集。这些数字描述的是 DeepSeek 自身的评估设置,而不是外部可完全复现的验证结果。

规模数据也因来源而异。Hugging Face 仓库 报告为 3040 亿参数,而 Artificial Analysis 列出总参数为 2840 亿、每个令牌激活参数为 130 亿。DeepSeek 表示,官方检查点使用与早期 Flash 模型相同的结构,并附带一个 DSpark speculative-decoding 模块。对比内存需求的构建者应将不同来源的度量分开考虑。

开放权重仍然需要强大的硬件

MIT 许可给予开发者广泛的自由来检查、修改和部署 V4 Flash。但部署仍然是一个基础设施项目。Hugging Face 文件大约占用 167GB。更小的量化可能会扩大可访问性,尽管官方检查点远远超出了使紧凑型编码模型变得有吸引力的简单笔记本工作流。

这一区别对考虑自行运行模型的开发者很重要。DeepSeek 面向的是不同的层:愿意管理大型混合专家(mixture-of-experts)模型以换取更强代理性能和对部署的控制的开发者与基础设施提供商。

自托管还为美国公司提供了一条评估权重而不将提示发送到 DeepSeek 托管服务的途径。对于有严格数据驻留、采购或安全要求的组织,这种区分很重要。开放权重在留下信任问题的同时,给工程团队提供了在其控制的基础设施内检查和运行模型的方式。

Liang 的定价押注

DeepSeek 的廉价 API 在模型供应商期望代理驱动消耗的节点上施加了压力。编码系统、研究代理和自动化业务流程会产生长提示、反复的工具调用和大量的推理痕迹。在更高的专有模型价格下,这些循环在产品达到有意义规模之前就可能产生无法预测的账单。

Liang 正在为创始人提供另一条路径:使用 DeepSeek 的托管端点以异常便宜的价格进行推理,或者获取 MIT 许可的权重并独立运行它们。

DeepSeek-V4-Flash-0731 仍需在真实代码库、长期运行的代理和生产工具链中进行更广泛的测试。Liang 已将一个高分的开放权重模型以许多前沿提供商收取令牌价格的一小部分推向市场,迫使竞争对手为每一次代理操作所附带的溢价进行辩护。

Reader comments

Conversation for this story loads after sign-in.