尽管公告未更改,OpenRouter 将 DeepSeek V4 Pro 0813 列为 GA

OpenRouter 将该带版本号的端点称为 GA 发布,但 DeepSeek 最近经审查的最新通知称 V4 Pro 未作变更,并未解释 0813 后缀。

By · Published

Primary source: OpenRouter

Why it matters

Developers can call a versioned V4 Pro endpoint with a 1-million-token context window, a 384,000-token output limit and current rates of $0.435 per million input tokens and $0.87 per million output tokens. DeepSeek has not documented what 0813 changes, leaving operators to test capability, latency and reliability before migrating production workloads.

A lone AI researcher in a densely packed data center or server room. (Oil painting in the manner of Edward Hopper)

OpenRouter 在 8 月 12 日将创始人 Liang Wenfeng 的 DeepSeek V4 Pro 0813 列为一般可用(GA)端点,标称 100 万 token 的上下文窗口,并列出费率为每百万输入 token $0.435 和每百万输出 token $0.87。

DeepSeek 在 7 月 31 日的 变更日志 中表示 V4 Pro API 未发生变化,其正式发布将随后到来。与 OpenRouter 列表同日截取的 DeepSeek 主页 亦表示 V4-Pro 未发生变化。

所提供的资料确立了一个新的有版本号的端点和 API 条目,但并未确立一个针对 0813 的特定模型、后训练、能力、延迟、吞吐量或可靠性变化。在审阅的文档中,DeepSeek 也未解释 0813 后缀的含义。

Wenfeng 于 2023 年创立了总部位于杭州的 DeepSeek,此前他共同创立并领导量化对冲基金 High-Flyer,该基金与并曾资助该 AI 开发者。根据 The Washington Post 的人物报道,他获得了浙江大学信息与通信工程的学士和硕士学位。公开报道将他的动机描述为围绕原创技术研究并缩小中国与美国实验室在 AI 方面的差距。

开发者可以调用的内容

DeepSeek 在 4 月 24 日推出 V4 系列预览,包含 Pro 和 Flash 型号,设计围绕 100 万 token 的上下文窗口。4 月变更日志 表示开发者可以通过 OpenAI ChatCompletions 和兼容 Anthropic 的接口调用 V4 Pro,只需将 model 参数设置为 deepseek-v4-pro,而无需更改基础 URL。

OpenRouter 现在使用带版本的 slug deepseek/deepseek-v4-pro-0813。其模型页面 提供与 OpenAI 兼容的 chat completions 和 Responses 端点,以及一个 Anthropic Messages 端点。该列表公开了推理控制、流式输出、工具调用和结构化输出参数。

DeepSeek 文档记载的最大输出长度为 384,000 token。该上限允许异常长的生成,但应用仍需在模型的上下文配额内管理组合提示、对话历史、工具结果和输出。

OpenRouter 将 DeepSeek 标识为该端点的唯一提供方,并表示其会将每个请求直接转发给 DeepSeek。未列出替代主机,因此如果 DeepSeek 的端点不可用或性能下降,OpenRouter 无法将 0813 请求转移给其他提供方。这使得在生产部署中进行直接监控和准备后备方案变得重要。

发布轨迹止步于 0813 之外

DeepSeek 在 7 月 31 日的变更日志记录了 DeepSeek 如何处理较小的 V4 Flash 模型。日志称 DeepSeek-V4-Flash-0731 保留了预览模型的架构和规模,同时接受了额外的后训练。相同的通告明确将该更新限定于 Flash,并称 V4 Pro 的 API、应用和 Web 模型保持不变。

审阅的变更日志中未包含针对 V4 Pro 0813 的等效条目。OpenRouter 称 0813 为 GA 发布,而 DeepSeek 在所提供记录中的最新公告则称 V4 Pro 未发生变化且其正式发布将随后到来。如果 OpenRouter 为现有部署添加了版本号、DeepSeek 更改了服务基础设施但未记录,或 DeepSeek 尚未发布发布说明,则这些陈述可以共存。现有证据无法区分这些可能性。

当该列表出现时,OpenRouter 也未显示延迟或吞吐量测量。DeepSeek 在审阅的材料中未提供针对 0813 的编码、推理、代理任务或可靠性结果。因此 GA 标签描述的是在 OpenRouter 上的可用性,而非相对于先前 V4 Pro 端点经验证的性能。

定价有利于受控的长上下文测试

DeepSeek 的 定价页面 列出了当前 V4 Pro 的费率:每百万未缓存输入 token $0.435、每百万缓存读取 token $0.003625 和每百万输出 token $0.87。该页面还警告未来可能提价,表明当前的工作负载经济性是临时的。

缓存读取费率对于反复提交相同仓库、文档集合、system prompt 或对话前缀的应用很重要。运营者仍需对缓存命中率和输出消耗进行建模,因为较大的上下文配额并不意味着每个请求的成本相同。代理循环也会通过规划、工具调用和重试成倍增加 token 使用量。

OpenRouter 的列表在上线当天显示的加权有效输入价格低于公布费率,这是由于缓存造成的。该数字反映了 OpenRouter 观察到的流量组合,并不是对其他客户工作负载的保证价格。

早期流量覆盖聊天与编码客户端

OpenRouter 模型页面 显示在 8 月 12 日来自 SillyTavern 的 394,000 token、来自 Velocity CLI 的 255,000 token、来自 pi 编码代理的 57,000 token、来自 Janitor AI 的 33,000 token 以及来自 Open WebUI 的 4,000 token。OpenRouter 表示当前活动尚不足以显示流量历史。

这些计数表明聊天界面和编码工具开始测试该端点,但并不能证明持续的采用、客户留存或生产可靠性。OpenRouter 另行表示,其更广泛的市场服务超过 1,000 万用户,每月处理超过 200 万亿 token,并提供来自 70 多个提供方的 400 多个模型。这些是 OpenRouter 整体的数字,而非 DeepSeek V4 Pro 0813 的使用数据。

该端点进入了一个其他开发者也在为编码和代理工作推销长上下文模型的市场。MiniMax M3 支持 100 万 token 的上下文窗口,并增加了原生图像、视频和计算使用能力。OpenAI's GPT-5.3-Codex 面向长期运行的编码和计算使用代理。要将它们与 0813 进行比较,需要任务完成度、延迟、可靠性和整体工作流成本的测量,而 OpenRouter 上线当天的列表并未提供这些数据。

对于开发者而言,具体事件是通过带版本号的 OpenRouter slug 获得访问,该 slug 仅由 DeepSeek 支持。记录在案的上下文窗口、API 接口、输出上限和当前价格足以用于受控测试。考虑生产迁移的团队仍需自行运行工作负载评估,因为无论是 DeepSeek 还是 OpenRouter 都未将 0813 标识与经测量的模型或服务变更关联起来。

Reader comments

Conversation for this story loads after sign-in.