DeepSeek lanza V4-Flash a 3 centavos por tarea de referencia

Artificial Analysis situó el modelo de Liang Wenfeng cerca de Gemini 3.6 Flash en cuanto a inteligencia y aproximadamente 105 veces más barato que Claude Fable 5 en el costo de las pruebas de benchmark.

By · Published

Primary source: Reuters

Why it matters

Liang Wenfeng is forcing model buyers to measure intelligence per dollar alongside benchmark rank. If V4-Flash holds up in production, high-volume agent products gain room to lower prices or widen margins.

Comparative analysis of AI models' intelligence and cost efficiency across a digital landscape (Satellite imagery with detailed cartographic overlays and data visualization)

DeepSeek de Liang Wenfeng lanzó V4-Flash el 31 de julio con el costo promedio por tarea más bajo entre los modelos de IA conocidos probados por Artificial Analysis, según los resultados del benchmark informados por Reuters el 3 de agosto. La firma de investigación calculó un costo promedio de $0.03 por prueba, comparado con $0.86 para Kimi K3 de Moonshot AI, $1.86 para GPT-5.6 Sol de OpenAI y $3.15 para Claude Fable 5 de Anthropic.

El lanzamiento amplía una estrategia que Liang desarrolló antes de que existiera DeepSeek. Estudió ingeniería de información y comunicaciones en Zhejiang University, luego aplicó aprendizaje automático a la inversión cuantitativa y cofundó el fondo de cobertura High-Flyer. En un perfil de Reuters de 2025, Liang argumentó que los desarrolladores de IA chinos debían perseguir investigación original en lugar de permanecer como seguidores de los laboratorios estadounidenses. Desde entonces, DeepSeek ha utilizado una política agresiva de precios de API y lanzamientos de modelos abiertos para convertir esa tesis de investigación en una estrategia de distribución.

V4-Flash es hasta ahora la expresión más clara de esa estrategia. El modelo queda detrás de los líderes del benchmark en inteligencia bruta, pero ofrece a los desarrolladores un modelo de razonamiento competitivo a un precio que puede cambiar materialmente la economía de productos que realizan miles o millones de llamadas al modelo.

The benchmark is a cost story

Artificial Analysis le dio a V4-Flash una puntuación de 50 en su Intelligence Index, que combina nueve evaluaciones que cubren programación, razonamiento y tareas de estilo laboral. Reuters informó que la puntuación igualó a Gemini 3.6 Flash de Google, quedó siete puntos por detrás de Kimi K3 de Moonshot y al menos nueve puntos por detrás de los modelos líderes de OpenAI y Anthropic en la comparación.

Esa brecha de rendimiento establece el intercambio que ofrece DeepSeek. V4-Flash está dirigido a cargas de trabajo en las que una respuesta sólida a bajo costo recurrente crea mayor valor que la puntuación de benchmark más alta disponible.

DeepSeek lista V4-Flash a $0.14 por millón de tokens de entrada no almacenados en caché y $0.28 por millón de tokens de salida. Las entradas en caché cuestan $0.0028 por millón de tokens. El modelo soporta una ventana de contexto de 1 millón de tokens, modos de pensamiento y no pensamiento, llamadas a herramientas, salida JSON y hasta 384,000 tokens de salida.

El cálculo de costo por tarea de Artificial Analysis importa porque los precios por token por sí solos pueden engañar a los compradores. Los modelos de razonamiento pueden generar largas trazas internas o dar pasos adicionales para terminar un trabajo. Artificial Analysis incluye los tokens consumidos al completar cada evaluación, produciendo una aproximación más cercana de lo que un desarrollador paga por una tarea finalizada bajo las condiciones del benchmark.

La diferencia resultante es sustancial. El costo promedio por prueba de Claude Fable 5 de $3.15 fue aproximadamente 105 veces el de V4-Flash, de $0.03. Kimi K3 entregó una puntuación de inteligencia más alta, aunque su costo promedio por tarea fue casi 29 veces mayor.

Estas cifras siguen siendo mediciones de benchmark. La longitud del prompt, el comportamiento de la caché, la ejecución de herramientas y el número de reintentos pueden mover los costos de producción de forma pronunciada.

Liang's cost discipline reaches AI agents

DeepSeek presentó la familia V4 el 24 de abril. Su documentación oficial de lanzamiento describe a V4-Flash como un modelo mixture-of-experts con 284 mil millones de parámetros totales y 13 mil millones de parámetros activos. Activar una porción más pequeña del modelo para cada token es central en el esfuerzo de DeepSeek por proporcionar razonamiento fuerte sin pagar el costo de inferencia asociado con ejecutar todos los parámetros para cada solicitud.

El lanzamiento del 31 de julio afinó V4-Flash para cargas de trabajo de agentes. DeepSeek dice que la beta pública de V4-Flash mejoró significativamente las capacidades de los agentes mientras que V4-Pro permaneció sin cambios. Ese enfoque ayuda a explicar por qué el benchmark de costos tiene más peso que una comparación convencional de precios de chatbots.

Un agente puede convertir una solicitud de un cliente en una cadena de llamadas al modelo: planear la tarea, buscar archivos, invocar herramientas, comprobar trabajos intermedios y reparar errores. Cada paso consume tokens. Pequeñas diferencias en el costo unitario se componen rápidamente, especialmente para productos de programación y servicios de automatización empresarial que corren continuamente en segundo plano.

DeepSeek les está dando a esos desarrolladores otra opción entre modelos frontera premium y sistemas más pequeños que pueden necesitar más reintentos. Un equipo de producto puede enrutar sus solicitudes más difíciles a un modelo con alta puntuación mientras envía el trabajo rutinario de planificación, extracción y llamadas a herramientas a V4-Flash. El soporte de DeepSeek para formatos de API compatibles con OpenAI y Anthropic reduce el trabajo de ingeniería necesario para probar esa combinación.

El enfoque de Liang también presiona a los proveedores de modelos a justificar los precios premium con mejoras mensurables en el trabajo completado. Una ventaja de nueve puntos de inteligencia puede ser valiosa para tareas difíciles de investigación o programación. Se vuelve más difícil de defender cuando la carga de trabajo consiste en llamadas repetitivas donde el modelo más barato tiene éxito de manera confiable.

Price is DeepSeek's route back into the contest

El lanzamiento R1 de DeepSeek en enero de 2025 convirtió a Liang en uno de los fundadores de IA más observados después de que el modelo desafiara suposiciones sobre cuánto capital y potencia de cómputo requiere un sistema de razonamiento competitivo. Desde entonces, Moonshot AI, MiniMax, Z.AI, Alibaba y ByteDance han acelerado sus propios lanzamientos, dando a los desarrolladores chinos un campo doméstico concurrido junto a OpenAI, Anthropic, Google y Meta.

V4-Flash le da a DeepSeek una respuesta directa a esa competencia. En lugar de reclamar la posición superior del benchmark en general, Liang compite por la capa donde el rendimiento del modelo se convierte en un costo del producto. Los compradores en esa capa son desarrolladores que ejecutan APIs, codifican agentes y flujos de trabajo automatizados, donde cada paso adicional de razonamiento se refleja en una factura.

La estrategia encaja con el trasfondo de Liang. La inversión cuantitativa recompensa sistemas que producen un resultado aceptable de manera repetida a menor costo marginal. V4-Flash aplica una disciplina similar a la inferencia: DeepSeek ofrece suficiente capacidad para manejar un conjunto amplio de tareas y luego usa el precio para facilitar la justificación del despliegue en alto volumen.

La prueba restante ocurrirá fuera de los suites de benchmark. Los desarrolladores necesitan medir la fiabilidad de V4-Flash, el comportamiento de uso de herramientas, el rendimiento de caché y la tasa de reintentos en sus propias cargas de trabajo. Una prueba de tres centavos resulta menos atractiva si un agente necesita intentos repetidos o revisión humana. Si el modelo completa trabajos de producción de forma consistente, Liang ha creado espacio para que las empresas de productos de IA bajen precios, amplíen márgenes o ejecuten flujos de trabajo que antes eran demasiado caros de automatizar.

Reader comments

Conversation for this story loads after sign-in.