DeepSeek actualiza la API V4-Flash para agentes de codificación sin cambiar la arquitectura
La beta pública del 31 de julio de DeepSeek agrega soporte nativo para Responses API mientras deja V4-Pro y los modelos en su aplicación y sitio web sin cambios.
By Ryan Merket · Published
Primary source: DeepSeek
Why it matters
DeepSeek is using post-training, low pricing and Responses API compatibility to push an existing model into coding-agent workflows while the larger V4-Pro release remains pending.

DeepSeek, el laboratorio de IA fundado por Liang Wenfeng, puso su API actualizada V4-Flash en beta pública el 31 de julio. Según el registro de cambios de DeepSeek, la versión utiliza post-entrenamiento y herramientas para desarrolladores para reposicionar el modelo más pequeño hacia agentes de codificación, manteniendo fija su arquitectura subyacente y el conteo de parámetros.
DeepSeek enfatizó el alcance limitado de la actualización: V4-Flash-0731 se aplica solo a la API deepseek-v4-flash. La API V4-Pro y los modelos servidos a través de la app y el sitio web de DeepSeek permanecen sin cambios. DeepSeek dijo que el lanzamiento oficial de V4-Pro seguirá, sin fijar una fecha.
Esa distinción importa porque DeepSeek lanzó primero la V4 preview el 24 de abril con variantes Flash y Pro. El lanzamiento del 31 de julio es una actualización dirigida a la línea Flash existente. No introduce una nueva arquitectura V4 ni reemplaza modelos en las superficies de producto de DeepSeek.
Liang construyó DeepSeek a partir de la base técnica de High-Flyer, el fondo de cobertura cuantitativo que cofundó tras estudiar ingeniería en Zhejiang University. Su transición del trading automatizado hacia modelos de vanguardia ayuda a explicar el énfasis en la eficiencia: DeepSeek ha tratado repetidamente el cómputo, el costo de inferencia y la arquitectura como restricciones alrededor de las cuales diseñar, en lugar de costos que desaparecen con la escala.
Mismo tamaño de modelo, comportamiento distinto
DeepSeek dice que V4-Flash-0731 conserva la arquitectura mixture-of-experts del modelo preview, con 284 mil millones de parámetros en total y 13 mil millones activados por token. Los materiales del modelo V4 listan una ventana de contexto de un millón de tokens. DeepSeek describió la compilación de julio como "re-post-trained", lo que significa que el trabajo se centró en moldear el comportamiento del modelo existente después del preentrenamiento en lugar de ampliar el modelo en sí.
El objetivo práctico es el desarrollo de software agentico. V4-Flash ahora soporta de forma nativa la Responses API, la interfaz usada por los clientes de Codex de OpenAI, y DeepSeek ha publicado una Guía de integración de Codex. Los desarrolladores pueden configurar DeepSeek como proveedor de modelos para flujos de trabajo al estilo Codex siguiendo la guía de DeepSeek.
La documentación de DeepSeek limita actualmente esa integración a V4-Flash. Se espera soporte para V4-Pro a principios de agosto de 2026, según la página de precios y características de la API. Ese orden le da a Flash una función específica: convertirse en el modelo de DeepSeek de menor costo y fácilmente disponible dentro de los bucles de agentes de codificación mientras DeepSeek termina el lanzamiento Pro.
DeepSeek vende el post-entrenamiento como la mejora
DeepSeek reporta ganancias sustanciales en benchmarks de agentes tras el retuning. Su registro de cambios del 31 de julio lista puntuaciones de 82.7 en Terminal Bench 2.1, 54.2 en NL2Repo, 76.7 en Cybergym, 54.4 en DeepSWE y 70.3 en Toolathlon Verified. DeepSeek dice que esos resultados superan al preview de V4-Pro en varias tareas de agentes.
La comparación viene con calificaciones materiales. DeepSeek indica que sus pruebas de agentes de código usaron un "modo minimal" de un DeepSeek Harness no publicado con esfuerzo máximo de razonamiento, una temperatura de 1.0 y top-p de 0.95. Dos evaluaciones adicionales, DSBench-FullStack y DSBench-Hard, son conjuntos de prueba internos de DeepSeek. Los resultados muestran aquello para lo que DeepSeek optimizó, aunque las pruebas independientes determinarán con qué fiabilidad esas ganancias se transfieren a repositorios reales y a sesiones de agentes de mayor duración.
Este lanzamiento también refleja hacia dónde se mueve la competencia de modelos. Los lanzamientos de arquitectura aún llaman la atención, pero los desarrolladores experimentan los modelos a través de llamadas a herramientas, comportamiento de reintentos, calidad de parches, gestión de contexto y el costo de mantener un agente en ejecución. El post-entrenamiento puede mejorar esos comportamientos sin financiar otra ejecución completa de preentrenamiento ni forzar a los clientes a migrar a un nuevo endpoint.
DeepSeek hizo esa migración deliberadamente pequeña. Los usuarios existentes de la API conservan la misma URL base y seleccionan deepseek-v4-flash como modelo. La elección de compatibilidad reduce el trabajo requerido para probar la actualización dentro de una aplicación existente, lo que puede importar tanto como una ganancia en benchmarks para equipos que ya mantienen varios proveedores de modelos.
La ventaja de precio se amplifica dentro de los agentes
DeepSeek lista actualmente V4-Flash en $0.14 por millón de tokens de entrada con fallo de caché y $0.28 por millón de tokens de salida. La entrada con acierto de caché cuesta $0.0028 por millón de tokens. V4-Pro tiene un precio de $0.435 por entrada con fallo de caché y $0.87 por salida, con una tasa por acierto de caché de $0.003625. Ambos modelos soportan contextos de un millón de tokens y salidas de hasta 384,000 tokens, según la documentación de precios de DeepSeek.
Esas tarifas hacen de Flash el vehículo de distribución más claro para cargas de trabajo de agentes. Un agente de codificación puede convertir una instrucción en llamadas repetidas al modelo para planificación, inspección de archivos, uso de herramientas, generación de código y revisión. RuntimeWire informó el 15 de julio que esta multiplicación de llamadas puede erosionar los aparentes ahorros de un precio por token bajo. Flash da a los desarrolladores considerablemente más margen antes de que esos bucles se vuelvan costosos.
La estrategia de investigación primero de Liang se encuentra con la distribución a desarrolladores
Liang ha descrito consistentemente a DeepSeek como una organización de investigación que persigue trabajo original en modelos. En una entrevista traducida con Waves, dijo que DeepSeek quería que China pasara a ser un contribuidor en IA en lugar de continuar siguiendo trabajos desarrollados en otros lugares. También describió los servicios en la nube como secundarios frente a la búsqueda de DeepSeek de la inteligencia artificial general.
La actualización V4-Flash muestra por qué la API sigue importando para esa estrategia centrada en la investigación. La compatibilidad con Codex pone a DeepSeek dentro de un flujo de trabajo de desarrolladores ya establecido, donde el comportamiento del modelo se prueba contra bases de código en vivo e interacciones repetidas con herramientas. Los precios bajos reducen el costo de la experimentación. La arquitectura sin cambios permite a DeepSeek argumentar que la mejora provino de la técnica de entrenamiento y la integración de producto, dos áreas en las que Liang puede iterar más rápido que en la generación completa de un nuevo modelo.
V4-Pro sigue siendo el modelo más grande, con 1.6 billones de parámetros en total y 49 mil millones de parámetros activados. Flash lleva el trabajo de distribución inmediato. La apuesta de Liang es que un modelo más pequeño, entrenado y empaquetado para la forma en que los agentes realmente operan, puede ganarse el uso de los desarrolladores antes de que el lanzamiento insignia de DeepSeek esté listo.