ARC Prize verifica DeepSeek V4 Flash con 61.4% a $0.04 por tarea
La evaluación externa de ARC Prize documenta cómo el modelo open-weight de Liang Wenfeng cae de 61.4% en Max effort a 46.0% en Low, con Max costando $0.04 por tarea.
By Ryan Merket · Published
Primary source: ARC Prize
Why it matters
ARC Prize's outside evaluation gives developers a checkpoint-specific measurement of DeepSeek V4 Flash's ARC-AGI-2 performance, reasoning-effort curve and benchmark cost.

ARC Prize verificó DeepSeek V4 Flash 0731 con 61.4% en la evaluación Semi-Private de ARC-AGI-2 con esfuerzo de razonamiento máximo, con un costo reportado de $0.04 por tarea. El resultado está vinculado al checkpoint del 31 de julio e incluye tres niveles de esfuerzo: 61.4% en Max, 56.0% en High y 46.0% en Low.
ARC Prize evaluó el checkpoint nombrado mediante su programa de verificación e informó tanto el desempeño en las tareas como el costo. Esa evaluación externa es el foco aquí. El checkpoint proviene de DeepSeek, la compañía de IA de Hangzhou fundada por Liang Wenfeng.
La página de resultados de ARC Prize marca el resultado como verificado e identifica las variantes de razonamiento Max, High y Low. La página también reporta 89.0% en ARC-AGI-1 Semi-Private con esfuerzo máximo, a $0.02 por tarea.
ARC Prize creó su programa verificado porque los resultados pueden variar según el prompting, la curación del conjunto de datos y los métodos de prueba. Su metodología considera la eficiencia de recursos como parte de la medición, por eso la página de resultados informa el costo junto al cumplimiento de tareas.
La cifra de $0.04 se aplica a cada tarea de ARC-AGI-2 con esfuerzo máximo bajo esta evaluación. No es un precio general para trabajos de agentes de codificación, ejecuciones de investigación u otras cargas de trabajo.
Tres niveles de esfuerzo exponen la compensación de costo de ARC-AGI-2
ARC Prize probó las variantes de razonamiento Max, High y Low en el benchmark Semi-Private. V4 Flash obtuvo 61.4% en Max, 56.0% en High y 46.0% en Low.
Esa variación de 15.4 puntos porcentuales muestra cuánto depende el resultado de ARC-AGI-2 del esfuerzo de inferencia. La puntuación máxima de un modelo ofrece una guía limitada para la planificación de producción a menos que los operadores también puedan ver cuánta computación la produjo. DeepSeek expone el esfuerzo de razonamiento como un parámetro, lo que permite a los desarrolladores ajustar la deliberación según los límites de latencia y gasto de una carga de trabajo.
La cifra de $0.04 de ARC Prize sigue siendo específica para la evaluación de ARC-AGI-2 con esfuerzo máximo. Llamadas repetidas a herramientas, ventanas de contexto largas y salidas grandes pueden aumentar el costo de una aplicación mucho más allá de una sola tarea de benchmark.
Los precios de la API actuales de DeepSeek listan V4 Flash a $0.14 por millón de tokens de entrada no cacheados, $0.0028 por millón de tokens de entrada cacheados y $0.28 por millón de tokens de salida. Esas tarifas por token explican cómo factura DeepSeek el uso ordinario de la API; no establecen un precio universal por tarea.
La disciplina de eficiencia de Liang proviene del trading cuantitativo
Liang fundó DeepSeek en 2023 después de crear High-Flyer, un fondo de cobertura cuantitativo que aplicaba machine learning al trading automatizado. Obtuvo una licenciatura en electronic information engineering y una maestría en information and communication engineering en Zhejiang University, según Fortune.
Ese bagaje ayuda a explicar la atención de DeepSeek a la relación entre la capacidad del modelo y la computación. El trading cuantitativo premia las mejoras que sobreviven a un cálculo de costos. DeepSeek aplica esa disciplina a través de la arquitectura del modelo, la fijación de precios de la API y los lanzamientos abiertos.
V4 Flash contiene 284 billion total parameters, activando alrededor de 13 billion para cada token, según el artículo técnico de DeepSeek. Su diseño mixture-of-experts enruta cada token a través de un subconjunto del modelo en vez de usar todos los parámetros para cada solicitud.
El artículo de V4 lista a Liang entre más de 300 autores y describe compressed sparse attention, heavily compressed attention, manifold-constrained hyper-connections y el Muon optimizer. La arquitectura soporta una ventana de contexto de un millón de tokens, mientras que la documentación de la API de DeepSeek lista una salida máxima de 384,000 tokens.
DeepSeek lanzó la familia más amplia V4 el 24 de abril, según su centro de transparencia. ARC Prize fecha su resultado para el checkpoint V4 Flash 0731 el 31 de julio e identifica variantes Max, High y Low. Nombrar el checkpoint vincula las puntuaciones verificadas a una versión específica del modelo.
Los pesos abiertos amplían la distribución del checkpoint
DeepSeek publicó los pesos V4 Flash 0731 en Hugging Face bajo una licencia MIT. La model card proporciona rutas de despliegue para Transformers, vLLM, SGLang y Docker, junto con instrucciones para inferencia local.
El lanzamiento le da a DeepSeek dos vías de adopción. Los desarrolladores pueden usar la API hospedada, mientras que los equipos de infraestructura pueden operar el checkpoint por sí mismos y modificar la pila de inferencia circundante. Los pesos descargables y la licencia permisiva permiten que el modelo llegue a usuarios que lo ejecuten fuera de los servidores de DeepSeek.
ARC-AGI tiene límites. Evalúa la adaptación a tareas novedosas de razonamiento visual en vez del rango completo de comportamiento de fiabilidad, seguridad, codificación y uso de herramientas requerido en agentes de producción. ARC Prize no lista una puntuación ARC-AGI-3 para V4 Flash 0731. Ese benchmark se acerca a entornos interactivos en los que un agente debe recopilar información y actuar a lo largo del tiempo.
El resultado verificado responde a una pregunta estrecha bajo condiciones documentadas: DeepSeek V4 Flash 0731 resolvió 61.4% de las tareas Semi-Private de ARC-AGI-2 con esfuerzo máximo, a un costo reportado de $0.04 por tarea. Las puntuaciones más bajas en los niveles High y Low muestran cuánto cambia ese resultado cuando el modelo dedica menos computación al razonamiento.