DeepSeek 更新 V4-Flash API,用于编程代理,且无需更改架构
DeepSeek 在7月31日的公开测试版中新增了对 Responses API 的原生支持,同时保持 V4-Pro 及其应用和网站中的模型不变。
By Ryan Merket · Published
Primary source: DeepSeek
Why it matters
DeepSeek is using post-training, low pricing and Responses API compatibility to push an existing model into coding-agent workflows while the larger V4-Pro release remains pending.

DeepSeek, the AI lab founded by Liang Wenfeng, 于 7 月 31 日将其更新后的 V4-Flash API 推出公测。根据 DeepSeek's changelog,此发布通过后训练和开发者工具将较小的模型重新定位为用于编码代理,同时保持其底层架构和参数量不变。
DeepSeek 强调此次更新范围有限:V4-Flash-0731 仅适用于 deepseek-v4-flash API。V4-Pro API 以及通过 DeepSeek 应用和网站提供的模型保持不变。DeepSeek 表示正式的 V4-Pro 发布将随后跟进,但未给出日期。
这一区分很重要,因为 DeepSeek 在 4 月 24 日首次发布了 V4 preview,当时包含 Flash 和 Pro 两个变体。7 月 31 日的发布是对现有 Flash 系列的有针对性更新。它并未引入新的 V4 架构,也未替换 DeepSeek 产品面的模型。
Liang 从他在浙江大学学习工程学后共同创立的量化对冲基金 High-Flyer 的技术基础上建立了 DeepSeek。他从自动化交易转向前沿模型的路径有助于解释为何如此强调效率:DeepSeek 多次将计算、推理成本和架构视为需要围绕其进行工程优化的约束,而不是随着规模扩大而消失的成本。
Same model size, different behavior
DeepSeek 表示 V4-Flash-0731 保留了预览版模型的 mixture-of-experts 架构,总参数为 2840 亿,每个 token 激活 130 亿参数。 V4 model materials 列出了一百万 token 的上下文窗口。DeepSeek 将 7 月的构建描述为“re-post-trained”,意指工作重点是在预训练之后塑造现有模型的行为,而不是扩展模型本身。
实际目标是面向代理化的软件开发。V4-Flash 现在原生支持 Responses API,这是 OpenAI 的 Codex 客户端使用的接口,DeepSeek 还发布了专门的 Codex integration guide。开发者可以通过 DeepSeek 的指南将 DeepSeek 配置为 Codex 风格工作流的模型提供者。
DeepSeek 的文档目前将该集成限制在 V4-Flash。根据 API pricing and feature page,V4-Pro 支持预计在 2026 年 8 月初到位。这一排序赋予 Flash 一个明确的任务:在 DeepSeek 完成 Pro 发布之前,成为可用且成本更低的编码代理循环内的 DeepSeek 模型。
DeepSeek is selling post-training as the upgrade
DeepSeek 报告称,通过重调优在代理基准上取得了显著提升。其 July 31st change log 列出了 Terminal Bench 2.1 得分 82.7、NL2Repo 54.2、Cybergym 76.7、DeepSWE 54.4 和 Toolathlon Verified 70.3。DeepSeek 表示这些结果在多个代理任务上超过了 V4-Pro 预览版。
这种比较附带重要限定。DeepSeek 表示其代码代理测试使用了未发布的 DeepSeek Harness 的“minimal mode”,并采用最大推理努力、temperature 为 1.0、top-p 为 0.95。还有两项额外评估,DSBench-FullStack 和 DSBench-Hard,是 DeepSeek 的内部测试集。结果展示了 DeepSeek 优化的方向,但独立测试将决定这些提升在真实代码库和更长运行代理会话中的可靠性。
此次发布也反映了模型竞争的走向。架构发布仍然吸引关注,但开发者是通过工具调用、重试行为、补丁质量、上下文管理以及维持代理运行的成本来体验模型的。后训练可以在不资助另一次完整预训练运行或强迫客户迁移到新端点的情况下改善这些行为。
DeepSeek 将这种迁移刻意做得很小。现有 API 用户保留相同的基础 URL,并选择 deepseek-v4-flash 作为模型。该兼容性选择降低了在现有应用内测试更新所需的工作量,对于已经维护多个模型提供者的团队而言,这一点可能和基准提升一样重要。
The price advantage compounds inside agents
DeepSeek 目前将 V4-Flash 定价为每百万次缓存未命中输入 token 收费 $0.14,每百万次输出 token 收费 $0.28。缓存命中输入费用为每百万次 $0.0028。V4-Pro 的缓存未命中输入定价为 $0.435,输出为 $0.87,缓存命中率为 $0.003625。根据 DeepSeek's pricing documentation,两款模型都支持一百万 token 的上下文和最多 384,000 token 的输出。
这些费率使 Flash 成为代理工作负载的更明确的分发载体。一个编码代理可能将一条指令变成多次模型调用用于计划、文件检查、工具使用、代码生成和审查。RuntimeWire 在 7 月 15 日报道过,这种调用倍增会侵蚀低每 token 价格带来的表面节省。Flash 在这些循环变得昂贵之前,为开发者留出了更大的空间。
Liang's research-first strategy meets developer distribution
Liang 一直将 DeepSeek 描述为一个以研究为主导、追求原创模型工作的机构。在接受 Waves 的一篇翻译采访中,他表示 DeepSeek 希望中国成为一个 AI 的贡献者,而不是继续跟随国外开发的工作。他还将云服务描述为相对于 DeepSeek 对通用人工智能追求的次要目标。
V4-Flash 的更新展示了为什么 API 对这一路线仍然重要。Codex 兼容性将 DeepSeek 放入既有的开发者工作流之中,在那里模型行为会在真实代码库和重复工具交互中受到检验。低价降低了试验成本。不变的架构让 DeepSeek 可以主张改进来自训练技术和产品集成,这是 Liang 可以比完整模型再造更快迭代的两个领域。
V4-Pro 仍是更大的模型,总参数为 1.6 万亿,激活参数为 490 亿。Flash 承担着即时分发的工作。Liang 的赌注是:一个为代理实际运作方式训练和打包的较小模型,能在 DeepSeek 的旗舰发布就绪之前赢得开发者的使用。