DeepSeek lanza V4 Flash con puntajes sólidos de agentes y precios bajos en la API

El modelo de pesos abiertos de DeepSeek ofrece un precio de API inferior al de sus competidores, mientras que pruebas de terceros sitúan su versión max-reasoning cerca de la cima de su clase.

By · Published

Primary source: Simon Willison's Weblog

Why it matters

Agent products can burn through tokens on reasoning and tool calls. DeepSeek is cutting that variable cost while keeping the weights available for independent deployment.

Illustration of DeepSeek V4 Flash depicted as a robotic hand manipulating symbols of data and value.

DeepSeek, fundada por Liang Wenfeng, lanzó DeepSeek-V4-Flash-0731 el 31 de julio, emparejando un modelo con licencia MIT con precios de API lo suficientemente bajos como para cambiar las suposiciones de costo detrás de los agentes de codificación y otro software intensivo en tokens.

DeepSeek describe el lanzamiento como la versión oficial de V4 Flash, reemplazando su checkpoint de vista previa con "capacidades de agente sustancialmente mejoradas." Una evaluación independiente temprana respalda parte de esa afirmación: Artificial Analysis otorgó a la configuración de razonamiento máximo del modelo una puntuación de 50 en el Intelligence Index, ubicándola en tercer lugar entre 101 modelos grandes de pesos abiertos en su clase de comparación.

Esa ubicación importa porque DeepSeek cobra $0.14 por millón de tokens de entrada que provoquen fallo de caché y $0.28 por millón de tokens de salida, según su página de precios actual de la API. La entrada en caché baja a $0.0028 por millón de tokens. El modelo soporta una ventana de contexto de 1 millón de tokens y hasta 384,000 tokens de salida, dando a los desarrolladores espacio para ejecutar largas sesiones de codificación, investigación y uso de herramientas sin heredar de inmediato la economía de un modelo propietario premium.

El lanzamiento extiende la estrategia que Liang ha perseguido desde la creación de DeepSeek en 2023: publicar pesos capaces, cobrar agresivamente por la inferencia alojada y permitir que desarrolladores externos conviertan la investigación subyacente en productos. Liang llegó al desarrollo de modelos a través de las finanzas cuantitativas. Estudió ingeniería de la información y la comunicación en Zhejiang University, y luego cofundó High-Flyer.

Ese trasfondo ayuda a explicar el enfoque en la eficiencia. El trading cuantitativo recompensa mejoras en rendimiento (throughput), latencia y costo a escala. El trabajo de modelo de DeepSeek aplica la misma disciplina a la inferencia, donde una pequeña diferencia en el precio por token puede determinar si un agente sigue siendo una demostración o se convierte en un producto viable.

El caso de referencia es sólido, con salvedades

El desarrollador independiente Simon Willison resaltó la posición precio-rendimiento del modelo en una publicación del 31 de julio. Señaló que Artificial Analysis sitúa a V4 Flash por delante de MiniMax M3 y lo describió como un contendiente al mejor valor por unidad de inteligencia medida.

Willison también ofreció un recordatorio útil de que los ajustes de razonamiento afectan la salida que los desarrolladores reciben realmente. Ejecutar V4 Flash a través de OpenRouter en su nivel de razonamiento predeterminado generó una ilustración defectuosa de un pelícano montando una bicicleta. Elevar reasoning_effort a high produjo una imagen coherente con el ave sentada en una bicicleta reconocible.

El experimento es anecdótico, pero expone un intercambio operacional que las tablas de clasificación agregadas pueden ocultar. El resultado de terceros más fuerte de DeepSeek proviene de la configuración de razonamiento máximo, que puede consumir más tokens de salida y tiempo. Los bajos precios por token de DeepSeek reducen la penalización financiera por cómputo extra, aunque los desarrolladores aún necesitan probar la latencia y la confiabilidad dentro de sus propios flujos de trabajo.

La ficha del modelo de DeepSeek también requiere una lectura cuidadosa. La ficha del modelo dice que V4 Flash obtuvo 82.7 en Terminal-Bench 2.1, 54.4 en DeepSWE y 70.3 en Toolathlon-Verified. DeepSeek ejecutó evaluaciones públicas de agentes de codificación con una versión mínima de DeepSeek Harness que, según la ficha del modelo, se publicará más adelante. Otros dos resultados reportados, DSBench-FullStack y DSBench-Hard, usan conjuntos de prueba internos de DeepSeek. Esos números describen la propia configuración de evaluación de DeepSeek en lugar de una validación totalmente reproducible por terceros.

Las cifras de tamaño también varían según la fuente. El repositorio de Hugging Face reporta 304 mil millones de parámetros, mientras que Artificial Analysis lista 284 mil millones de parámetros totales y 13 mil millones activos por cada token. DeepSeek dice que el checkpoint oficial usa la misma estructura que el modelo Flash anterior con un módulo DSpark de decodificación especulativa adjunto. Los constructores que comparen requisitos de memoria deberían mantener separadas las mediciones específicas de cada fuente.

Los pesos abiertos aún requieren hardware serio

La licencia MIT otorga a los desarrolladores amplia libertad para inspeccionar, modificar y desplegar V4 Flash. El despliegue sigue siendo un proyecto de infraestructura. Los archivos en Hugging Face ocupan aproximadamente 167 GB. Cuantizaciones más pequeñas pueden ampliar el acceso, aunque el checkpoint oficial está muy lejos del flujo de trabajo simple en laptop que ha hecho atractivos a los modelos de codificación compactos.

Esa distinción es importante para los desarrolladores que piensan en ejecutar el modelo por sí mismos. DeepSeek está apuntando a una capa diferente: desarrolladores y proveedores de infraestructura dispuestos a gestionar un gran modelo de mezcla de expertos a cambio de un rendimiento de agente superior y control sobre el despliegue.

El autoalojamiento también ofrece a las empresas estadounidenses una vía para evaluar los pesos sin enviar indicaciones al servicio alojado de DeepSeek. Esa separación será importante para organizaciones con requisitos estrictos de residencia de datos, adquisiciones o seguridad. Los pesos abiertos dejan pendientes cuestiones de confianza, a la vez que ofrecen a los equipos de ingeniería una forma de inspeccionar y operar el modelo dentro de la infraestructura que controlan.

La apuesta de precios de Liang

La API barata de DeepSeek crea presión en el punto donde los proveedores de modelos esperan que los agentes impulsen el consumo. Los sistemas de codificación, los agentes de investigación y los procesos de negocio automatizados pueden generar indicaciones largas, llamadas repetidas a herramientas y grandes trazas de razonamiento. Con precios más altos de modelos propietarios, esos bucles pueden producir facturas impredecibles antes de que el producto alcance una escala significativa.

Liang está ofreciendo a los fundadores otra ruta: usar el endpoint alojado de DeepSeek para inferencia inusualmente barata, o tomar los pesos con licencia MIT y operarlos de forma independiente.

DeepSeek-V4-Flash-0731 todavía necesita pruebas más amplias en repositorios reales, agentes de larga duración y cadenas de herramientas en producción. Liang ha puesto en el mercado un modelo de pesos abiertos con alta puntuación a una fracción de los precios por token que cobran muchos proveedores de vanguardia, forzando a los competidores a defender la prima asociada a cada acción de agente.

Reader comments

Conversation for this story loads after sign-in.