Moonshot publica el informe sobre el Kimi K3, detallando cómo funciona un modelo abierto 2.8T
El informe del 27 de julio detalla la atención híbrida, el enrutamiento de expertos 16-de-896 y una pila de servicio que aún requiere escala de centros de datos.
By Ryan Merket · Published
Primary source: X
Why it matters
K3 shows that open weights alone do not make a frontier model practical. Draft models, cache systems and accelerator-scale serving now shape distribution and cost.

Zhilin Yang's Moonshot AI lanzó los pesos completos y el informe técnico de Kimi K3 el 27 de julio, documentando la arquitectura e infraestructura detrás de un modelo de 2.8 billones de parámetros que activa 104 mil millones de parámetros por cada token.
El lanzamiento sigue a la introducción de K3 del 16 de julio, cuando Moonshot AI empezó a ofrecer el modelo a través de Kimi, Kimi Work, Kimi Code y su API. El desarrollador de Beijing había prometido publicar los pesos y el informe para el 27 de julio. Su repositorio público de GitHub ahora incluye la licencia de los pesos, especificaciones del modelo e instrucciones de despliegue.
Yang ha pasado gran parte de su carrera investigadora trabajando en el problema que K3 está diseñado para atacar: hacer que los modelos de lenguaje retengan y recuperen información a lo largo de secuencias largas. Antes de fundar Moonshot AI en 2023, coescribió Transformer-XL y XLNet, obtuvo su doctorado en Carnegie Mellon University y trabajó en Meta AI y Google Brain. La cofundadora de Moonshot AI, Yuxin Wu, trabajó previamente en modelos foundation en Google Brain y creó la librería de visión por computadora Detectron2 de Meta.
Meta AI researcher Zhuokai Zhao (@zhuokaiz) llamó la atención el 30 de julio sobre cinco elecciones a nivel de algoritmo en el informe que, según él, merecían un examen más detenido. Su primer ejemplo expuso un límite importante alrededor de la frase "open model": Moonshot AI publicó los pesos principales de K3 mientras retenía su propio modelo borrador de decodificación especulativa, escribió Zhao.
Una implementación independiente ya ha llenado esa brecha. Inferact publicó un Kimi K3 DSpark draft model abierto, y vLLM añadió soporte de producción para él. La decodificación especulativa usa un modelo más pequeño para proponer varios tokens antes de que el modelo principal los verifique en paralelo, reduciendo la latencia que los usuarios experimentan entre tokens generados.
La arquitectura está construida alrededor del costo de inferencia
K3 combina dos sistemas de atención. La mayoría de las capas usan Kimi Delta Attention, o KDA, que mantiene un estado recurrente de tamaño fijo en lugar de preservar una caché convencional de clave-valor que crece con cada token. Capas periódicas de atención completa mantienen acceso exacto a la secuencia más amplia. Moonshot AI dice que esta estructura híbrida soporta una ventana de contexto de 1,048,576 tokens sin el crecimiento de memoria de un modelo con atención completa en todas las capas.
Attention Residuals cambia cómo se mueve la información entre capas. En lugar de sumar repetidamente la salida de cada capa a un único flujo residual acumulado, K3 aprende qué peso asignar a estados residuales anteriores. La arquitectura está pensada para recuperar representaciones útiles desde distintas profundidades en lugar de tratar cada contribución previa por igual.
Moonshot AI también amplió la estructura mixture-of-experts del modelo a 896 expertos enrutados, seleccionando 16 por cada token. Stable LatentMoE realiza el cómputo de expertos en una dimensión latente más estrecha para reducir el movimiento de pesos y la comunicación. Una técnica llamada Quantile Balancing asigna trabajo usando la distribución de las puntuaciones del enrutador, eliminando un parámetro de balanceo ajustado manualmente que usan otros enfoques de enrutamiento de expertos.
Estas decisiones permiten a Moonshot AI afirmar una mejora aproximada de 2.5x en la eficiencia de escalado respecto a Kimi K2. Esa cifra es la medida de Moonshot AI, y combina cambios de arquitectura, entrenamiento y datos en lugar de aislar la contribución de una sola técnica.
La aparente eficiencia de K3 también tiene un umbral mínimo de infraestructura. Moonshot AI recomienda despliegues con al menos 64 aceleradores para comunicación de alto ancho de banda. La guía de despliegue de vLLM indica que servir el modelo requiere al menos un nodo B300 o GB300 NVL72 de ocho GPU, con soporte también para 16 GPU B200. Ejecutar K3 localmente sigue estando fuera del alcance de las estaciones de trabajo de desarrolladores ordinarios a pesar de los pesos públicos.
Un tercero triplicó la velocidad de decodificación para un solo usuario
En 16 GPUs Nvidia GB300, vLLM midió K3 en 118 tokens por segundo para un único usuario sin decodificación especulativa. Añadir el borrador DSpark de Inferact aumentó ese resultado a 370 tokens por segundo, una ganancia declarada de 3.14x. Las tareas de programación y otras tareas predecibles promediaron 4.73 tokens borrador aceptados por paso, en comparación con 2.61 para trabajos de mayor entropía como la escritura creativa.
La prueba mide una configuración de hardware y una carga de trabajo específicas más que el costo o el rendimiento de un servicio de producción típico. Aun así muestra por qué importa el modelo borrador. Liberar un checkpoint a escala fronteriza da a los desarrolladores acceso a las capacidades del modelo, mientras que los gestores de caché circundantes, los núcleos de comunicación, los modelos borrador y los planificadores determinan si alguien puede servirlo de forma económica.
Moonshot AI ha fijado precios agresivos para ese trabajo de servicio. Su K3 API cobra $0.30 por millón de tokens de entrada en caché, $3 por millón de tokens de entrada no en caché y $15 por millón de tokens de salida. Moonshot AI afirma que su sistema de inferencia desagregado Mooncake alcanza tasas de acierto de caché por encima del 90% en cargas de trabajo de programación, una aseveración que haría que la tasa de entrada más baja sea la relevante para muchas sesiones de agente de larga duración.
El modelo sigue sujeto a limitaciones documentadas por Moonshot AI. K3 espera que los marcos de agentes preserven su historial de razonamiento anterior a través de las interacciones, y la calidad puede volverse inestable cuando ese historial falta. Moonshot AI también advierte que K3 puede tomar acciones inesperadas cuando las instrucciones son ambiguas, y dice que su experiencia de usuario general todavía está por detrás de Claude Fable 5 y GPT-5.6 Sol.
El informe llega menos de tres meses después de que Moonshot AI recaudara alrededor de $2 mil millones con una valuación por encima de $20 mil millones en una ronda liderada por Long-Z Investments de Meituan, según reportes de TechCrunch. Ese financiamiento le da a Yang el capital para seguir entrenando a escala de billones de parámetros. El lanzamiento de K3 muestra la otra mitad de la apuesta: Moonshot AI está usando pesos abiertos para reclutar a proveedores de infraestructura y desarrolladores para que absorban parte de la ingeniería requerida para distribuir sus modelos.