Microsoft actualiza su modelo de codificación Copilot 10 semanas después de su lanzamiento

El modelo de mezcla de expertos de 138 mil millones de parámetros incorpora entrada de imagen y llega 10 semanas después del primer modelo de codificación Copilot interno de Microsoft.

By · Published

Primary source: Microsoft AI

Why it matters

Microsoft is using Copilot usage and its production harness to compress model iteration into weeks, lowering inference costs while reducing its dependence on outside model vendors.

Microsoft upgrades its Copilot coding model 10 weeks after launch — The 138 billion-parameter mixture-of-experts model adds image input and arrives 10 weeks after Microsoft's first in-house Copilot coding model.

Microsoft lanzó MAI-Code-1.1-Flash el 11 de agosto y puso el modelo de codificación en producción en GitHub Copilot, reemplazando la primera versión de su modelo de codificación interno apenas 10 semanas después del lanzamiento.

En su anuncio, Microsoft dijo que la actualización transmite tokens 25% más rápido, usa 25% menos tokens para completar una tarea y cuesta una cuarta parte que MAI-Code-1-Flash, que debutó el 2 de junio. Microsoft también añadió entrada de imágenes, permitiendo que el modelo convierta capturas de pantalla, diagramas y diseños de interfaces en código.

El ciclo de lanzamiento inusualmente corto muestra cómo Microsoft planea competir en modelos de codificación: usar Copilot como canal de distribución y como entorno de entrenamiento, y luego reemplazar rápidamente los modelos a medida que los datos de producción revelan dónde tienen dificultades los desarrolladores. La compañía entrenó la nueva versión alrededor del trabajo en línea de comandos y .NET tras recibir comentarios que identificaron ambos como puntos débiles.

Un modelo grande con una huella activa pequeña

La ficha técnica del modelo MAI-Code-1.1-Flash describe un modelo sparse mixture-of-experts con 138 mil millones de parámetros totales y 5 mil millones de parámetros activos. Acepta texto e imágenes, tiene una ventana de contexto de 256,000 tokens y fue entrenado entre marzo y agosto de 2026.

Ese diseño permite a Microsoft mantener los requisitos de cómputo activo del modelo más cercanos a los de un modelo pequeño, al tiempo que conserva un conjunto de parámetros mucho mayor. MAI-Code-1.1-Flash parte de un checkpoint comprimido de 5 mil millones de parámetros activos de MAI-Thinking-1 y depende del modelo de codificación original.

Microsoft usó aproximadamente 2 millones de tareas sintéticas de agente durante una etapa intermedia de entrenamiento, seguidas de aprendizaje por refuerzo en más de 150,000 entornos. La compañía evaluó los checkpoints resultantes dentro del mismo arnés de GitHub Copilot usado para el tráfico de producción, incluyendo navegación de repositorios, llamadas a herramientas y verificación de tareas de extremo a extremo.

La ganancia de referencia más clara del modelo se dio en Terminal-Bench 2.1, que mide la capacidad de un agente para completar trabajo a través de un terminal. MAI-Code-1.1-Flash registró una tasa de éxito del 62.9%, frente al 51.7% de su predecesor. Esa es la mejora relativa del 22% citada por Microsoft.

La mejora en SWE-Bench Verified fue más reducida. El nuevo modelo obtuvo 72.6%, comparado con 71.6% del modelo de junio. Utilizó un promedio de 8,600 tokens de solución por tarea, frente a 10,800. Los resultados de Microsoft también lo colocan por encima de GPT-5.4 mini en ambas pruebas, aunque las cifras se generaron usando el arnés de producción de Copilot de Microsoft en lugar de una evaluación neutral de terceros.

Microsoft informó por separado una mejora del 15% en tareas .NET. Sus mediciones de producción mostraron 4% más código generado que sobrevivía hasta un commit y un aumento del 9% en las visitas de retorno de desarrolladores. Esas cifras son métricas internas, reportadas por la propia empresa, y el anuncio no especifica su línea base ni la ventana de medición.

Los datos de Copilot alimentan el siguiente modelo

La actualización del modelo ofrece una visión más concreta del ciclo de entrenamiento que Microsoft describió cuando introdujo MAI-Code-1-Flash en junio. Microsoft puede entrenar dentro del arnés de Copilot, dirigir el modelo a los desarrolladores, observar resultados agregados del producto y enfocar la siguiente corrida de entrenamiento en tareas que deprimen la aceptación o la retención.

El resumen de datos dice que Microsoft usó indicaciones de conversación y el contexto asociado de suscriptores de GitHub Copilot Free, Pro y Pro+ que no se habían excluido del entrenamiento del modelo. Los datos filtrados se usaron para despliegues de aprendizaje por refuerzo y para entrenar un modelo de recompensa interno. Microsoft dijo que eliminó información identificativa, imágenes, rastros de uso de herramientas y contenido sensible para la seguridad, y no utilizó las respuestas de producción como objetivos de entrenamiento supervisado.

Los datos de entrenamiento incluyeron más de 10 billones de tokens de texto y menos de 1 millón de imágenes, según el resumen. El corpus combinó repositorios públicos, datos web, libros, material académico, datos adquiridos comercialmente y tareas sintéticas de ingeniería de software. Los conjuntos de datos más recientes recopilados datan de julio de 2026, un mes antes del lanzamiento.

Este ciclo de retroalimentación de producción es central para la economía del lanzamiento. Microsoft dijo en julio que millones de desarrolladores ya estaban usando el primer modelo MAI-Code y que produjo mayores tasas de aceptación de código y de retorno que GPT-5.4 mini y Claude Haiku 4.5. Mover más tráfico de Copilot a un modelo más barato construido por Microsoft puede reducir el costo de atender sesiones de agente de alto volumen, al tiempo que le da a Microsoft un control más estricto sobre la latencia, el entrenamiento y el comportamiento específico del producto.

La información de precios sigue siendo inconsistente en los materiales de lanzamiento de Microsoft. La ficha del modelo marca los precios como "por finalizar", mientras que la tabla de facturación de modelos en vivo de GitHub actualmente lista la entrada más amplia MAI-Code-1-Flash en $0.75 por millón de tokens de entrada, $0.075 para entrada en caché y $4.50 por millón de tokens de salida. El anuncio de Microsoft no asocia tarifas específicas en dólares a la reducción del 75% que afirma.

MAI-Code-1.1-Flash está disponible a través de GitHub Copilot. Microsoft también ha abierto un repositorio oficial para información de lanzamiento y retroalimentación de desarrolladores.

Reader comments

Conversation for this story loads after sign-in.