DeepSeek fija las tarifas de la API V4 en horas pico al doble de las de fuera de pico mientras aumentan los precios
El nuevo horario cobra el doble durante siete horas UTC, mientras que las tarifas de salida en horas no pico aún aumentan 136% para V4-Flash y 128% para V4-Pro.
By RuntimeWire Staff · Published
Primary source: DeepSeek
Why it matters
DeepSeek's clock-based rate card gives scheduled workloads a cheaper lane, but every off-peak V4 rate still exceeds today's price. Developers must revisit unit economics before August 16.

Liang Wenfeng de DeepSeek incrementará los precios de la API para sus modelos V4 el 16 de agosto mientras introduce una tarifa de dos niveles diseñada para mover trabajos de cómputo flexibles fuera de sus horas más ocupadas.
DeepSeek dijo que las tarifas para horas valle estarán 50% por debajo de los precios pico. Esa formulación describe la brecha entre los dos nuevos niveles. Todas las tarifas para horas valle en la nueva tabla siguen siendo más altas que el precio correspondiente que DeepSeek cobra hoy.
Los nuevos precios entrarán en vigor a las 16:00 UTC del 16 de agosto de 2026. DeepSeek define las horas pico como 01:00-04:00 UTC y 06:00-10:00 UTC, sumando siete horas cada día. Las otras 17 horas son horas valle.
La ventana más barata sigue costando más
DeepSeek actualmente cobra a los clientes de V4-Flash $0.0028 por 1 millón de tokens de entrada con acierto en caché, $0.14 por 1 millón de tokens de entrada con fallo en caché y $0.28 por 1 millón de tokens de salida.
Bajo el nuevo horario de horas valle, esos precios suben a $0.007, $0.22 y $0.66, respectivamente. Eso equivale a aumentos de 150% para aciertos en caché, 57% para fallos en caché y 136% para salida, incluso cuando un cliente limita su tráfico a la ventana más barata de 17 horas.
Las tarifas pico de V4-Flash alcanzarán $0.014 por entrada con acierto en caché, $0.44 por entrada con fallo en caché y $1.32 por salida.
El incremento es más pronunciado para cierto uso de V4-Pro. A fecha del 13 de agosto, la documentación oficial de precios de DeepSeek lista tarifas actuales de V4-Pro de $0.003625 por entrada con acierto en caché, $0.435 por entrada con fallo en caché y $0.87 por salida por 1 millón de tokens. La tabla combina ese calendario actual con las tarifas anunciadas para el 16 de agosto:
| Model and period | Cache-hit input | Cache-miss input | Output |
|---|---|---|---|
| V4-Flash current | $0.0028 | $0.14 | $0.28 |
| V4-Flash off-peak | $0.007 | $0.22 | $0.66 |
| V4-Flash peak | $0.014 | $0.44 | $1.32 |
| V4-Pro current | $0.003625 | $0.435 | $0.87 |
| V4-Pro off-peak | $0.022 | $0.66 | $1.98 |
| V4-Pro peak | $0.044 | $1.32 | $3.96 |
Todas las cifras son por 1 millón de tokens.
El precio de acierto en caché de V4-Pro en horas valle será aproximadamente seis veces su nivel actual. Sus tarifas de fallo en caché y de salida en horas valle suben alrededor de 52% y 128%. Durante las horas pico, un acierto en caché de V4-Pro costará poco más de 12 veces la tarifa actual.
Para una carga de trabajo distribuida de manera uniforme a lo largo de las 24 horas, el precio combinado de salida sería aproximadamente tres veces la tarifa de hoy para cualquiera de los modelos. Las facturas reales dependerán de cuándo llegue el tráfico, de si los prompts dan en la caché de DeepSeek y de cuánto output genere cada solicitud.
La tarjeta de tarifas favorece la evaluación por lotes, el procesamiento de documentos, el enriquecimiento de datos y otros trabajos que pueden permanecer en cola. Los productos de chat para consumidores y los agentes autónomos tienen menos control sobre el momento. Un agente también puede convertir una instrucción de usuario en llamadas repetidas al modelo, amplificando un aumento por token a lo largo de la planificación, el uso de herramientas y los reintentos. RuntimeWire examinó esa exposición cuando DeepSeek recortó los precios de V4-Pro en julio.
Liang aplica economía de programación a la inferencia
La estructura de dos niveles encaja con la trayectoria de Liang en la IA. Estudió ingeniería de la información en Zhejiang University antes de desarrollar algoritmos para selección de acciones y cofundar el fondo cuantitativo High-Flyer, que se convirtió en la base financiera y técnica de DeepSeek.
Ese trasfondo incluyó infraestructura de cómputo costosa. La historia de High-Flyer dice que su clúster Fire-Flyer I costó aproximadamente 200 millones de yuanes y utilizó 1,100 tarjetas aceleradoras.
La nueva tarjeta de tarifas de DeepSeek da a los desarrolladores una razón para mover trabajo discrecional a la ventana más barata mientras cobra más por el tráfico que llega durante las siete horas pico. La política puede repartir la demanda flexible a lo largo del día sin fijar cada solicitud al precio más alto.
Debido a que las ventanas pico de DeepSeek caen fuera de la mayoría de las horas laborales normales de EE. UU., muchos equipos con sede en EE. UU. pueden programar trabajos por lotes diurnos a tarifas de horas valle. Las aplicaciones que funcionan las 24 horas seguirán encontrando ambos niveles.
Con las nuevas tarifas entrando en vigor a las 16:00 UTC del 16 de agosto, los desarrolladores tienen tres días para cambiar sistemas de encolamiento, establecer políticas de enrutamiento basadas en el tiempo o revisar límites de uso orientados al cliente.
La propuesta de bajo costo de V4 obtiene un nuevo denominador
La documentación de DeepSeek lista V4-Flash y V4-Pro y muestra los precios actuales por millón de tokens usados en la comparación. La documentación de precios de DeepSeek lista una ventana de contexto de 1 millón de tokens, una salida máxima de 384,000 tokens y formatos de API compatibles con OpenAI y compatibles con Anthropic.
La nueva tarjeta de tarifas cambia esas comparaciones. Las cifras de costo de benchmark producidas bajo el calendario actual no describirán la economía de la API después del 16 de agosto. Una afirmación de costo reproducible necesitará especificar la versión del modelo, el comportamiento de la caché y la ventana temporal junto con el consumo de tokens.
La tabla de precios da a los desarrolladores las tarifas y la fecha de vigencia. Preserva una vía más barata para cargas de trabajo que pueden programarse alrededor de la demanda mientras cobra sustancialmente más por el tráfico que no puede esperar.