DeepSeek 推出 V4-Flash,每个基准任务 3 美分
Artificial Analysis 在智能方面将 Liang Wenfeng 的模型评为接近 Gemini 3.6 Flash,并且在基准测试成本上大约比 Claude Fable 5 便宜 105 倍。
By Ryan Merket · Published
Primary source: Reuters
Why it matters
Liang Wenfeng is forcing model buyers to measure intelligence per dollar alongside benchmark rank. If V4-Flash holds up in production, high-volume agent products gain room to lower prices or widen margins.

Liang Wenfeng's DeepSeek 于7月31日发布了 V4-Flash。根据 Reuters 于8月3日报道的基准测试结果,在 Artificial Analysis 测试的知名 AI 模型中,V4-Flash 的每项任务平均成本最低。该研究公司计算得出的平均每次测试成本为 $0.03,而 Moonshot AI 的 Kimi K3 为 $0.86,OpenAI 的 GPT-5.6 Sol 为 $1.86,Anthropic 的 Claude Fable 5 为 $3.15。
此次发布延续了 Liang 在 DeepSeek 成立前就已确立的一套策略。他曾在 浙江大学 学习信息与通信工程,随后将机器学习应用于量化投资并共同创办了 High-Flyer hedge fund。在一篇 2025 年 Reuters 的报道 中,Liang 认为中国的 AI 开发者需要开展原创研究,而不是继续做美国实验室的追随者。DeepSeek 此后通过激进的 API 定价和开放模型发布,将这一研究论点转化为分发策略。
V4-Flash 是该策略迄今为止最清晰的体现。该模型在原始智力表现上落后于基准领先者,但以能够显著改变需进行数千或数百万次模型调用的产品经济学的价格,为开发者提供了具有竞争力的推理模型。
The benchmark is a cost story
Artificial Analysis 在其 Intelligence Index 上给了 V4-Flash 50 分,该指数汇总了涵盖编码、推理和职场类任务的九项评估。Reuters 报道称,这一分数与 Google 的 Gemini 3.6 Flash 持平,落后于 Moonshot 的 Kimi K3 七分,并至少比比较中的 OpenAI 与 Anthropic 领先模型低九分以上。
这一性能差距确立了 DeepSeek 所提供的权衡。V4-Flash 面向的工作负载是:在低持续成本下提供足够强的答案,比起追求最高可得基准分更能创造价值。
DeepSeek 在其定价页面上列出 V4-Flash 的价格为 每百万未缓存输入 tokens $0.14,输出 tokens 每百万 $0.28。已缓存的输入每百万 tokens 收费 $0.0028。该模型支持 100 万令牌的上下文窗口、思考和非思考模式、工具调用、JSON 输出以及最多 384,000 个输出令牌。
Artificial Analysis 的每项任务成本计算重要在于,仅看 token 价格可能误导买家。推理模型可能会生成较长的内部执行轨迹或采取额外步骤来完成任务。Artificial Analysis 将每次评估完成过程中消耗的 tokens 一并计入,从而更接近开发者在基准条件下为一次完成任务所支付的费用。
由此产生的差距非常显著。Claude Fable 5 的平均测试成本 $3.15 大约是 V4-Flash $0.03 的 105 倍。Kimi K3 虽然给出了更高的智力得分,但其平均任务成本几乎高出近 29 倍。
这些数字仍然是基准测量结果。提示长度、缓存行为、工具执行以及重试次数都可能使生产成本发生大幅波动。
Liang's cost discipline reaches AI agents
DeepSeek 在 4 月 24 日推出了 V4 系列。其 官方发布文档 将 V4-Flash 描述为一种 mixture-of-experts 模型,具有 2840 亿个总参数和 130 亿个激活参数。对于每个 token 激活模型的较小部分,是 DeepSeek 力图在不为每次请求运行所有参数所带来的推理成本买单的前提下,提供强推理能力的核心手段。
7 月 31 日的发布将 V4-Flash 针对代理工作负载进行了优化。DeepSeek 表示,V4-Flash 的公开测试显著增强了代理能力,而 V4-Pro 则保持不变。这一重点有助于解释为何成本基准比传统聊天机器人价格对比更有分量。
一个代理可能将一次客户请求变成一连串的模型调用:规划任务、搜索文件、调用工具、检查中间工作并修复错误。每一步都消耗令牌。单位成本的微小差异会迅速复利,尤其是对于持续在后台运行的编码产品和企业自动化服务而言。
DeepSeek 为这些开发者在高端前沿模型与可能需要更多重试的小型系统之间提供了另一种选择。产品团队可以将最困难的请求路由到得分最高的模型,同时把例行的规划、提取和工具调用工作交给 V4-Flash。DeepSeek 对 OpenAI- 和 Anthropic-兼容 API 格式的支持,也降低了测试这种安排所需的工程工作量。
Liang 的做法同样迫使模型提供方用可衡量的已完成工作改进来证明其高价的合理性。九分的智力优势在困难的研究或编码任务中可能很有价值;但当工作负载由重复调用构成、且便宜模型能可靠完成时,这一优势就难以自圆其说。
Price is DeepSeek's route back into the contest
DeepSeek 在 2025 年 1 月发布的 R1 使 Liang 成为最受关注的 AI 创始人之一,因为该模型挑战了关于构建有竞争力推理系统需要多少资本和计算力的既有假设。此后,Moonshot AI、MiniMax、Z.AI、Alibaba 和 ByteDance 加速了各自的发布,使中国开发者在国内市场面临与 OpenAI、Anthropic、Google 和 Meta 并存的拥挤竞争格局。
V4-Flash 为 DeepSeek 提供了对该竞争的直接回应。Liang 并未宣称整体基准第一,而是争夺那一层次:模型表现直接转化为产品成本的层次。该层次的买家是运行 API、编写代理和自动化工作流的开发者,在这些场景中,每增加一步推理都会落到账单上。
这一策略契合 Liang 的背景。量化投资奖励的是那些能以较低边际成本反复产出可接受结果的系统。V4-Flash 将类似的纪律应用于推理:DeepSeek 提供了足够广泛任务处理能力,然后用价格让大规模部署更易于证明其合理性。
最终的考验将在基准套件之外进行。开发者需要在自己的工作负载上衡量 V4-Flash 的可靠性、工具使用行为、缓存表现和重试率。如果代理需要反复尝试或人工复核,那么每次 $0.03 的测试就不那么有吸引力了。如果该模型能在生产中持续完成任务,Liang 就为 AI 产品公司创造了降价、扩大利润或运行此前因成本过高而无法自动化的工作流的空间。