Cursor publica MoK como código abierto tras alegar una ganancia del 41% en el rendimiento de entrenamiento
Un kernel con licencia Apache fusiona la comunicación y el cómputo de MoE para entrenar modelos en racks Nvidia GB300 NVL72.
By Ryan Merket · Published
Primary source: X
Why it matters
Cursor is spending its funding on vertical model infrastructure, and MoK shows how application companies can cut training costs by optimizing communication across entire GPU racks.

Cursor (@cursor_ai) liberó como código abierto Mixture-of-Kittens el 4 de agosto, un kernel de GPU que la empresa de codificación de IA dice que incrementó el rendimiento de extremo a extremo para entrenar sus modelos Composer en un 41% frente a su pila de producción anterior.
El lanzamiento expone una pieza de la infraestructura de modelos que el CEO Michael Truell (@mntruell) y la operación de investigación de Cursor han construido bajo el editor de código de la compañía. Truell cofundó la empresa matriz de Cursor, Anysphere, con tres compañeros de MIT en 2022. Desde entonces, Cursor se ha adentrado más en el desarrollo de modelos, presentando su Composer 2 coding model en marzo después de lo que describió como su primer ciclo continuo de preentrenamiento.
Mixture-of-Kittens, o MoK, apunta a una de las partes más costosas del entrenamiento de modelos mixture-of-experts: mover tokens entre las GPUs que contienen distintos expertos, ejecutar las redes feed-forward seleccionadas y devolver los resultados. Los investigadores de Cursor encontraron que esta capa podía consumir más de la mitad del tiempo total de entrenamiento, según la carga de trabajo y la configuración.
MoK combina esos pasos de comunicación y computación dentro de un megakernel único diseñado para sistemas Nvidia GB300 NVL72. Un rack NVL72 enlaza 72 GPUs en un dominio NVLink, creando oportunidades para superponer transferencias de datos con cómputo. También obliga a los equipos de infraestructura a coordinar cuidadosamente el trabajo en todo el rack en lugar de optimizar cada multiplicación de matrices de forma aislada.
Afirmaciones de los benchmarks de Cursor
Cursor dice que MoK entregó hasta 2.37x el throughput forward en MXFP8 del baseline público más rápido en sus pruebas a nivel de capa. Las comparaciones cubrieron NCCL con PyTorch, DeepEP con PyTorch, DeepEP con Transformer Engine y la configuración HybridEP de Nvidia con Megatron.
La cifra máxima es un resultado dentro de las propias pruebas de Cursor, más que una mejora uniforme en todos los modos de precisión y pasadas de entrenamiento. Cursor reportó ganancias máximas de 1.78x para la ejecución backward en MXFP8, 1.92x para forward en BF16 y 1.58x para backward en BF16.
Para la comparación en producción, Cursor probó 512 GPUs distribuidas en varios racks GB300 NVL72. Su pila anterior basada en DeepEP procesaba 760.9 tokens por segundo por GPU, mientras que MoK procesó 1,070.2, según la compañía. Eso produjo el aumento de extremo a extremo reportado de 1.41x.
El número de producción proviene del sistema interno de entrenamiento de Cursor y no puede reproducirse únicamente a partir del repositorio público. Sin embargo, Cursor ha liberado el código usado para sus benchmarks de capas MoE individuales, dando a los ingenieros de infraestructura una forma de probar las afirmaciones de rendimiento más específicas en hardware compatible.
Cursor afirma que MoK ya impulsa el entrenamiento de Composer en decenas de miles de GPUs. Esa cifra de despliegue y los resultados de los benchmarks son reportados por la compañía.
Reconstruyendo la capa MoE en torno a la comunicación
La implementación usa despacho basado en pull, donde una GPU recupera los tokens que necesita de pares, seguido de operaciones de combinación basadas en push. Cursor dice que esa disposición reduce la sincronización entre las 72 GPUs y entregó hasta un 29% más de utilización del ancho de banda NVLink que el despacho basado en push bajo cargas desiguales de expertos.
MoK divide los streaming multiprocessors de la GPU entre comunicación y cómputo, y luego ajusta cuántos tokens atraviesan el sistema en cada minibatch. Los ring token buffers permiten al kernel reutilizar una asignación de memoria fija sin esperar a que la CPU calcule y asigne buffers para cada conteo de tokens cambiante.
El kernel también fija el orden de las operaciones en punto flotante, produciendo salidas idénticas bit a bit para las mismas entradas. Cursor dijo que necesitaba ese determinismo para experimentos internos y para aprendizaje por refuerzo on-policy posterior al entrenamiento. MoK soporta BF16 y MXFP8, con Cursor usando MXFP8 en producción mientras mantiene el experto compartido en BF16 por estabilidad durante el entrenamiento.
El Repositorio de GitHub está disponible bajo la licencia Apache 2.0. Los autores nombrados son Stuart H. Sul, Nash Brown, Henry Wildermuth, William Lin y Federico Cassano.
Cursor avanza más profundo en la pila de modelos
El lanzamiento de Cursor hace visible cuánto de infraestructura hay debajo de una aplicación de IA que comenzó como un editor de código. La compañía está entrenando modelos propietarios de codificación, operándolos en grandes clústeres de GPU y escribiendo kernels específicos de hardware cuando las implementaciones públicas dejan demasiado rendimiento sin aprovechar.
Ese trabajo está respaldado por una gran base de capital. En su anuncio de Serie D del 13 de noviembre de 2025, Cursor dijo que recaudó $2.3 mil millones con una valoración post-money de $29.3 mil millones de inversores que incluyen a Accel, Thrive Capital, Andreessen Horowitz, Coatue, Nvidia y Google. Cursor dijo en ese momento que la financiación apoyaría una inversión más profunda en investigación.
Liberar MoK como código abierto da a otros laboratorios acceso a una implementación probada en producción mientras invita a ingenieros externos a inspeccionarla y ampliarla. La audiencia inmediata sigue siendo reducida: equipos que entrenan grandes modelos mixture-of-experts en sistemas GB300 NVL72. Esas son máquinas costosas, y el software está adaptado a su modelo de red y ejecución.
El lanzamiento también le da a Cursor un artefacto público para reclutar investigadores que de otra forma podrían asociar a la compañía principalmente con su editor. Cursor dice que agentes de IA ayudaron a su pequeño grupo de investigación a escribir kernels individuales y a trabajar en el megakernel distribuido. MoK es la apuesta de infraestructura resultante: mejores modelos de codificación dependerán en parte de hacer que cada clúster de entrenamiento entregue más trabajo útil por segundo.