Nicholai Mitchko lanza DeepSeek, pila de razonamiento latente autoalojada para GPUs Blackwell
El director de IA de InterSystems emparejó una cabeza de razonamiento CoLaR con un backbone DeepSeek-V4-Flash cuyos expertos MoE enrutados usan NVFP4, mientras que la atención, los expertos compartidos, la cabeza LM y el bloque de borrador permanecen a mayor precisión. Su único benchmark publicado presenta cifras agregadas contradictorias y no cuenta con replicación independiente.
By Ryan Merket · Published
Primary source: Nicholai Mitchko's AI Research blog
Why it matters
Mitchko has made a latent-reasoning system available as weights plus runnable serving code, giving inference teams a concrete test of hidden-state computation. Its specialized vLLM path, heavy Blackwell memory requirement and unreplicated benchmark show how far the approach remains from routine deployment.

Nicholai Mitchko, director de habilitación de IA de InterSystems, ha publicado un modelo de razonamiento latente autoalojado construido alrededor de DeepSeek-V4-Flash. El modelo realiza cómputo intermedio en estados ocultos antes de generar una respuesta visible, pero para servirlo se requiere hardware Nvidia de clase Blackwell y el código de inferencia especializado de Mitchko.
Mitchko publicó DeepSeek-V4-Flash-0731-Latent-Reasoning alrededor del 7 de agosto de 2026. Describe el proyecto como investigación personal más que como un producto de InterSystems. Los materiales públicos no identifican una empresa separada, financiamiento externo, clientes ni despliegues de producción vinculados al lanzamiento.
El proyecto aplica Razonamiento Latente Comprimido, o CoLaR, a un modelo mixture-of-experts de 284 mil millones de parámetros con 13 mil millones de parámetros activos. CoLaR fue introducido por Wenhui Tan y cinco coautores en el artículo de 2025 "Think Silently, Think Fast". El método representa el razonamiento intermedio como estados continuos en lugar de una secuencia de tokens de razonamiento generados.
Un camino de servicio especializado
El anterior lanzamiento CoLaR de Mitchko distribuía el componente de razonamiento como un adaptador que los usuarios debían acoplar a un checkpoint separado de DeepSeek-V4-Flash. Su configuración previa requería que los usuarios ensamblaran por separado el modelo base, la cabeza de razonamiento, el mecanismo de parada y el runtime personalizado. El nuevo lanzamiento coloca los pesos necesarios para la configuración de Mitchko en un único repositorio de modelo, mientras que su ruta de servicio permanece dividida entre el ds4-reasoning-addon y un fork separado de vLLM.
Esa división establece un límite claro alrededor del lanzamiento. Un equipo de inferencia puede descargar el modelo y el código de soporte, pero no puede moverlo sin cambios a un despliegue vLLM ordinario. Los operadores deben ejecutar el addon de Mitchko y mantener su fork del motor de inferencia.
El componente de razonamiento latente tiene 35.7 millones de parámetros. Lee el estado oculto de la capa 35 del backbone, proyecta ese estado a una representación de 1,024 dimensiones y escribe el resultado decodificado en el flujo residual en la capa 42. El checkpoint registra un factor de compresión de seis, y una cabeza de parada aprendida determina cuándo termina el bucle latente. La generación de tokens visibles comienza después de ese bucle interno.
El paquete también incluye un bloque de borrador DSpark de tres capas para decodificación especulativa. Sus ajustes de precisión varían según el componente: los pesos del mixture-of-experts enrutados usan NVFP4 con tamaño de grupo 16, mientras que los módulos de atención, los expertos compartidos, la cabeza del modelo de lenguaje y el bloque de borrador permanecen a mayor precisión. Mitchko estima que el checkpoint ocupa alrededor de 158 a 164 GiB en dos GPUs.
Un benchmark, dos cifras agregadas
Mitchko reporta una evaluación BIG-Bench Hard que abarca 27 subtareas, con 50 ejemplos por tarea y 1,350 ejemplos en total. La ficha del modelo informa una puntuación agregada de 0.880 +/- 0.008 usando el extractor de coincidencia exacta flexible en lm-evaluation-harness 0.4.12.
Su publicación de lanzamiento anexa también muestra 0.94 +/- 0.008 cerca del inicio de la sección del benchmark, y luego identifica 0.880 como el agregado confiable. Los números en conflicto impiden una comparación limpia con otros sistemas. La cifra menor coincide con la ficha del modelo y con la calificación posterior de la publicación, pero ambas siguen siendo auto-reportadas.
Los resultados por tarea varían ampliamente. Mitchko reporta puntuaciones perfectas en seguimiento de objetos barajeados, expresiones booleanas, falacias formales y la tarea de pingüinos-en-una-tabla del benchmark. La puntuación cae a 0.58 en preguntas de desambiguación y a 0.26 en lenguajes Dyck, una prueba de emparejamiento de corchetes. Él caracteriza el resultado en Dyck como una debilidad genuina en razonamiento mecánico y con fuerte carga sintáctica.
La extracción de respuestas afecta materialmente la evaluación. El matcher estricto de BIG-Bench Hard busca la frase literal "The answer is X." El modelo de Mitchko no usa ese formato de salida, por lo que él reporta resultados usando en su lugar el extractor flexible del benchmark. Ese método puede ser apropiado para la salida del modelo, pero debe permanecer fijado en cualquier intento de comparación o replicación.
La evaluación cubre solo 50 ejemplos por subtarea, y Mitchko estima una incertidumbre de aproximadamente +/- 0.05 a 0.07 para tareas individuales. El lanzamiento no proporciona resultados replicados de forma independiente. La ficha del modelo tampoco publica evaluaciones para programación, trabajo con contexto largo, uso de herramientas o cargas de trabajo de producción. La evidencia disponible muestra que la configuración de servicio se ejecuta y puede ser puntuado en un benchmark de razonamiento; no establece una ventaja general sobre sistemas que generan tokens de razonamiento explícitos.
El hardware limita a los primeros usuarios
La implementación de Mitchko apunta a hardware Nvidia de clase Blackwell. Su configuración recomendada tiene al menos 192 GiB de VRAM total, y la configuración que verificó usa dos GPUs RTX PRO 6000 Blackwell de 96 GiB.
Ese requisito reduce la audiencia probable a equipos de inferencia con servidores recientes de múltiples GPUs. Los pesos públicos reducen la barrera para inspeccionar y probar el proyecto, mientras que la huella de memoria y el motor de servicio bifurcado lo hacen inapropiado para la mayoría de desarrolladores individuales o despliegues hospedados estándar.
El razonamiento latente también cambia lo que los operadores pueden inspeccionar. El texto de razonamiento generado puede estar incompleto o ser engañoso, pero proporciona a los desarrolladores un artefacto para revisar durante la depuración y evaluación. El sistema de Mitchko en cambio transporta el cómputo intermedio a través de un estado de 1,024 dimensiones. Los operadores pueden inspeccionar la respuesta final y los resultados de los benchmarks, pero la ruta de razonamiento es menos accesible para el registro convencional y el análisis basado en texto.
La cabeza de parada aprendida introduce otra dependencia operativa porque controla cuánto tiempo permanece el modelo en su bucle interno. Fallas durante esa fase pueden manifestarse solo a través de latencia, uso de recursos o una mala respuesta final. Por lo tanto, probar el comportamiento de parada a través de prompts y cargas de trabajo importará tanto como reproducir el benchmark principal.
Mitchko ha suministrado los pesos y el código de servicio necesarios para que equipos experimentados prueben esa proposición en su propio hardware. Ejecuciones independientes determinarán si el enfoque se mantiene más allá de su configuración Blackwell y de la evaluación BIG-Bench Hard.