Inco AI lanza DFlash 2 e informa que las secuencias de tokens aceptadas son un 21% más largas

Inco AI agrega un selector de ruta y una convolución local a DFlash 2, reportando borradores aceptados un 21% más largos con 1.3% de latencia de ciclo adicional.

By · Published

Primary source: Inco AI

Why it matters

Agent workloads multiply token demand and serving costs. If Inco AI's gains hold across production stacks, DFlash 2 can reduce target-model passes without changing model output.

Simplified schematic representing Inco AI DFlash 2 processing multiple data tokens along parallel paths for LLM verification.

Zhijian Liu es un autor académico vinculado a UC San Diego detrás de DFlash, el método de decodificación especulativa paralela que Inco AI lanzó en una versión actualizada el 18 de agosto. DFlash 2 añade dos pequeños componentes diseñados para obtener más tokens aceptados por cada costosa pasada de verificación del LLM.

Inco AI informa un aumento del 21% en la longitud promedio de aceptación respecto al DFlash original. Su benchmark publicado en Qwen usa un modelo DFlash Qwen3-4B de cinco capas sobre GSM8K. El selector de trayectorias y la convolución responsables de la ganancia reportada añadieron 1.3% a la latencia del ciclo de borrador-verificación en las pruebas de Inco AI. Inco AI dice que la salida final permanece sin cambios porque el modelo objetivo más grande sigue verificando cada token propuesto.

El artículo de DFlash nombra a Liu junto a los autores vinculados a UC San Diego Jian Chen y Yesheng Liang. El artículo fue enviado a arXiv en febrero. Su movimiento central fue hacer la etapa de borrador en paralelo, reemplazando las conjeturas token por token de un modelo pequeño por un bloque propuesto completo generado en una sola pasada.

Inco AI está construyendo su primer producto público alrededor del enfoque DFlash. Inco AI describe DFlash 2 como la primera pieza de una pila de inferencia de extremo a extremo diseñada para cargas de trabajo de agentes, donde una sola tarea puede ejecutarse durante horas y generar muchos más tokens que una sesión de chat convencional.

Un borrador paralelo aprende a leer sus propias conjeturas

La decodificación especulativa usa un modelo más pequeño para proponer varios tokens futuros antes de pedir al modelo objetivo más grande que los verifique juntos. Las conjeturas aceptadas ahorran pasadas hacia adelante. Las conjeturas rechazadas se descartan, preservando la salida del modelo objetivo.

La mayoría de los sistemas de decodificación especulativa todavía generan el borrador de forma secuencial. DFlash propone cada posición en paralelo, lo que elimina ese bucle de borrado pero crea un problema distinto: tokens plausibles de forma independiente pueden formar una secuencia pobre cuando se colocan uno junto al otro.

DFlash 2 añade un selector de trayectorias que mantiene los 16 mejores candidatos en cada posición, puntúa pares de tokens vecinos y recorre esas puntuaciones precalculadas para escoger una secuencia coherente. Inco AI dice que el selector añade 2 millones de parámetros y 0.6% de latencia por ciclo. En la prueba Qwen3-4B de Inco AI, produjo borradores aceptados más largos que un módulo de corrección DSpark mientras usaba aproximadamente 40 veces menos parámetros.

La segunda adición apunta a lo que Inco AI denomina "suffix decay". El drafteador original se vuelve menos preciso cerca del final de un bloque propuesto, reduciendo el número de tokens que sobreviven la verificación. DFlash 2 inserta una convolución local de dos pasos alrededor de cada subcapa de atención y feed-forward, permitiendo que cada posición mezcle información con su predecesora inmediata mientras mantiene la computación en paralelo.

Inco AI dice que la convolución añade 16.5 millones de parámetros, aproximadamente 3% del drafteador de cinco capas, y 0.7% de latencia por ciclo. Los experimentos de Inco AI encontraron que esta pequeña operación local recuperó gran parte de la precisión al final del bloque que se obtenía triplicando el drafteador de cinco capas a 15, una expansión que implicó un costo de latencia del 15.2%.

En la suite de benchmarks de Inco AI, el selector y la convolución mejoraron la longitud promedio de aceptación en 21% respecto a DFlash, con ganancias individuales que van del 16% al 25%. La latencia añadida al ciclo borrador-verificación fue de 1.3%.

Esos son los benchmarks de Inco AI, y las cifras principales de rendimiento dependen del modelo, la tarea, los ajustes de muestreo, el hardware y la concurrencia. Para el recién publicado drafteador Qwen3.8-27B, Inco AI informa entre 2.7x y 3.4x el rendimiento de la decodificación autorregresiva en SGLang con tamaño de lote uno. Su Muse Glimmer drafter produjo entre 3.1x y 4.6x de rendimiento en las pruebas de Inco AI.

Las integraciones están haciendo la venta

El repositorio DFlash de código abierto original es compatible con SGLang, vLLM, TensorRT-LLM y llama.cpp. El lanzamiento de DFlash 2 incluye configuraciones para SGLang, vLLM, llama.cpp y una compilación oMLX para Apple Silicon.

Vendedores de hardware independientes también han probado el primer DFlash. NVIDIA informó hasta 15x mayor rendimiento para gpt-oss-120b en un sistema Blackwell de ocho GPUs con el mismo objetivo de interactividad. Google informó una aceleración promedio de 3.13x para un benchmark DFlash independiente en JAX sobre TPU v5p. Su comparación de pipeline vLLM en TPU mostró una aceleración de 2.29x de extremo a extremo respecto a la decodificación autorregresiva. Esos resultados validan la arquitectura original en diferentes aceleradores. No confirman de manera independiente la nueva afirmación del 21% de DFlash 2 sobre la longitud de aceptación.

CoreWeave usa DFlash por defecto para su endpoint Kimi K2.7 Code, mientras que Inco AI dice que NVIDIA, Red Hat, Modal, Meta, Poolside y Xiaomi han publicado o distribuido drafteadores compatibles. Inco AI también informa que los modelos DFlash superaron 3.5 millones de descargas en Hugging Face para agosto de 2026.

DFlash se distribuye a través de motores de inferencia y repositorios de modelos que los desarrolladores ya usan, dando a Inco AI un camino dentro de las pilas de servicio existentes mientras construye un producto de inferencia más amplio alrededor del método.

El momento sigue a la carga de trabajo. Los agentes que planifican, llaman a herramientas y revisan salidas convierten la eficiencia de inferencia en un gasto operativo más que en una característica de capacidad de respuesta. Cada token adicional aceptado reduce el número de pasadas completas del modelo objetivo necesarias para terminar la tarea. DFlash 2 intenta reducir ese costo mejorando el drafteador paralelo mientras mantiene el paso de verificación del modelo objetivo.

Reader comments

Conversation for this story loads after sign-in.