Celeris-1 encabeza el ranking de velocidad de IA con 2,158 tokens por segundo
El modelo de difusión de Tom Hamer y Jesse Clark combina una puntuación máxima de rendimiento con un 12 en el Índice de Inteligencia de Artificial Analysis.
By Ryan Merket · Published
Primary source: X - Celeris
Why it matters
Independent speed leadership gives diffusion language models a concrete commercial proof point. Celeris still has to show that the advantage survives production workloads without widening the intelligence gap.

Celeris-1 ha tomado el puesto de mayor velocidad entre modelos comparables no razonantes en la evaluación comparativa actual de Artificial Analysis, generando 2,157.9 tokens de salida por segundo. El resultado les da a los fundadores Tom Hamer y Jesse Clark un punto de datos independiente para su apuesta de que la difusión puede hacer que los modelos de lenguaje sean lo suficientemente rápidos para integrarse en interfaces de voz, herramientas de programación y bucles de agentes con múltiples pasos.
Celeris dijo en un hilo del 4 de agosto en X que una instantánea de benchmark anterior midió a Celeris-1 en 2,038 tokens de salida por segundo, el doble de la tasa del siguiente modelo, y lo clasificó en primer lugar en una comparación de 591 modelos por velocidad de salida, tiempo de respuesta, tiempo al primer token y tiempo por tarea de inteligencia. El resumen público actual de Artificial Analysis informa una cifra de rendimiento aún mayor y etiqueta a Celeris-1 como el primero en velocidad entre 80 modelos en su clase comparable de precio y capacidad. Registra un tiempo al primer token de 0.64 segundos.
El resultado independiente afina la propuesta que Hamer y Clark hicieron cuando lanzaron públicamente Celeris-1 a finales de julio. La pareja cofundó previamente Marqo, que construye infraestructura de búsqueda semántica y visual para minoristas en línea. Celeris afirma que Hamer obtuvo una maestría en aprendizaje automático de Cambridge y construyó infraestructura en AWS. Clark lideró el aprendizaje automático en Amazon Robotics, trabajó como principal científico de aprendizaje automático en Stitch Fix y ocupó puestos de investigación en física en Stanford y University College London.
Su cambio de infraestructura de búsqueda a inferencia de modelos sigue la misma tesis subyacente: la latencia restringe qué sistemas de IA pueden los desarrolladores poner en producción. Celeris enumera a Lightspeed Venture Partners, Blackbird Ventures y January Capital como patrocinadores.
La difusión mueve la generación a paralelo
La mayoría de los modelos de lenguaje comerciales usan decodificación autorregresiva, generando cada token después del token anterior. Celeris describe un proceso diferente: Celeris-1 comienza con una versión aproximada de una respuesta y refina la secuencia en varias pasadas paralelas. El método adapta la difusión, una arquitectura ampliamente asociada con la generación de imágenes, al texto.
En el lanzamiento del 27 de julio de Celeris-1, Celeris describió el modelo como la segunda API de modelo de lenguaje basada en difusión disponible comercialmente después de Mercury de Inception. Clark dijo que la pregunta de investigación era si una nueva arquitectura podría preservar un razonamiento sólido mientras operaba dentro de los límites de latencia en tiempo real.
El propio benchmark de Celeris midió 1,664 tokens de salida por segundo, por debajo de los posteriores resultados de Artificial Analysis. El rendimiento del benchmark puede cambiar con la longitud del prompt, la carga del endpoint y la configuración de la prueba, por lo que las cifras son instantáneas en el tiempo más que propiedades fijas del modelo.
En la prueba MMLU-Pro de Celeris, Celeris-1 obtuvo 75.9% con un tiempo de respuesta medio reportado por el servidor de 158 milisegundos. GPT-5 obtuvo 81.9% en 2,046 milisegundos, mientras que Mercury 2 obtuvo 63.7% en 257 milisegundos. Celeris usó presupuestos de razonamiento cero para Celeris-1, GPT-5 y los otros modelos con capacidad de razonamiento en la comparación, y probó Mercury 2 en modo instantáneo. La mayoría de las cifras de latencia fueron reportadas por los proveedores de los modelos; los endpoints de Gemini se midieron de extremo a extremo desde un cliente colococado.
Artificial Analysis ofrece una lectura más mesurada de la inteligencia de Celeris-1. Su página actual da al modelo una puntuación de 12 en el Artificial Analysis Intelligence Index, clasificándolo en el puesto 40 entre 80 modelos comparables. Por lo tanto, el benchmark respalda el argumento de velocidad de Celeris con más fuerza que su afirmación de inteligencia casi de vanguardia.
Ese perfil define el mercado inmediato. La documentación para desarrolladores de Celeris orienta a los constructores hacia tareas cortas y repetidas como clasificación, extracción, puntuación, reescritura de consultas, traducción en vivo y llamadas a herramientas de agentes. Ahorrar segundos en cada solicitud puede acumularse a lo largo de un agente que hace docenas de llamadas al modelo antes de devolver una respuesta.
Celeris-1 se entrega a través de una API compatible con OpenAI, lo que permite a los desarrolladores cambiar de endpoint sin reescribir el formato básico de la solicitud. Los precios son $0.20 por millón de tokens de entrada y $0.70 por millón de tokens de salida. Los planes empresariales incluyen clústeres dedicados, límites de tasa personalizados y despliegue en una nube privada virtual.
Para Hamer y Clark, la clasificación de velocidad llega a menos de dos semanas del lanzamiento de Celeris-1 el 24 de julio. Ese calendario convierte un argumento de arquitectura en una herramienta de adquisición de desarrolladores: los constructores pueden comparar la API con proveedores de modelos establecidos mientras Celeris aún tiene la atención generada por su lanzamiento. La prueba más dura llega en producción, donde los requisitos de precisión, la variación de la carga de trabajo y el rendimiento sostenido del endpoint determinarán si la velocidad del benchmark produce mejor software.