Hablemos de MAI-Code: el modelo de código propio de Microsoft

Imagen de Nibaldo Pino Araya
Nibaldo Pino Araya
| 1 octubre, 2026

Microsoft ya tiene su propia familia de modelos de programación dentro de GitHub Copilot. No compite por ser el más listo del mercado, y precisamente por eso conviene entender qué aporta a tu empresa. 

MAI- Code

En esta nueva edición de la serie Hablemos de… volvemos a Microsoft. En una entrega anterior hablamos de MAI-Thinking-1 y de la apuesta de la compañía por tener modelos propios. Hoy toca su familia de código, MAI-Code, que en tres meses ha lanzado dos versiones, ha retirado la primera y ha bajado su precio de lista un 73%. 

La pregunta que queremos responder es práctica: qué significa para una empresa tener disponible un modelo de programación de Microsoft, integrado en GitHub Copilot, cuando OpenAI y Anthropic también están peleando en precio. 

MAI-Code-1.1-Flash se queda lejos de los modelos de frontera en los benchmarks, aunque gasta pocos tokens y cuesta poco. En un equipo de desarrollo, lo que acaba pesando en la factura es el coste por tarea resuelta, más que el precio por token. 

Por qué Microsoft quiere su propio modelo de código 

Microsoft es dueña de buena parte de las herramientas con las que se programa en el mundo: GitHub, Visual Studio Code y Visual Studio. Hasta este año, los modelos que funcionaban dentro de Copilot eran de terceros. MAI-Code es la respuesta a esa dependencia: un modelo propio que la compañía puede optimizar de punta a punta, desde la infraestructura hasta el producto, y abaratar cuando le convenga. 

La familia, en dos versiones 

MAI-Code-1-Flash se presentó en Build el 2 de junio de 2026. Según su model card, es un modelo Mixture of Experts de unos 137.000 millones de parámetros totales con solo 5.000 millones activos por inferencia y una ventana de contexto de 256K tokens. En la práctica, tiene la capacidad de un modelo grande y un coste por consulta cercano al de uno pequeño. 

El 11 de agosto llegó MAI-Code-1.1-Flash (138.000 millones totales, también 5.000 millones activos), y la 1-Flash quedó retirada el 10 de septiembre. Microsoft anunció para la 1.1: 

  • Visión nativa: el modelo lee capturas de errores, mockups o diagramas y trabaja sobre ellos. 
  • Un 25% menos de tokens por tarea y tokens que se generan un 25% más rápido. 
  • Mejoras del 22% en Terminal-Bench 2.1 dentro de Copilot CLI y del 15% en tareas .NET, que según la compañía eran las dos peticiones más repetidas por los desarrolladores. 
  • Un precio de lista en GitHub Copilot de 0,20 dólares por millón de tokens de entrada y 1,20 por millón de salida, un 73% menos que su predecesor. 

Microsoft insiste en dos detalles de origen. El modelo se entrenó desde cero, sin destilar modelos de terceros, y se hizo directamente sobre el harness de producción de GitHubCopilot, es decir, en el mismo entorno de herramientas y agentes en el que se va a usar. 

Dónde se sitúa frente al estado del arte 

En su model card, Microsoft compara MAI-Code-1.1-Flash solo con modelos pequeños: obtiene un 72,6% en SWE-Bench Verified frente al 69,8% de Claude Haiku 4.5 y el 69,2% de GPT-5.4 mini, y un 62,9% en Terminal-Bench 2.1 frente al 49,4% y el 60,7% respectivamente. 

La comparación incómoda es con la frontera. OpenAI publica para su familia GPT-5.6 resultados en Terminal-Bench 2.1 de entre el 84,7% (Luna) y el 88,8% (Sol), y en SWE-Bench Pro de entre el 62,7% y el 64,6%. Anthropic, que lanzó Claude Opus 5.5 el 22 de septiembre a 4 y 20 dólares por millón de tokens (un 20% menos que Opus 5), ya reporta sobre versiones más nuevas de estos benchmarks. 

 

MAI- Code rendimiento

Terminal-Bench 2.1 frente a precio de salida en GitHub Copilot. Cifras publicadas por cada fabricante. Elaboración: Raona. 

El 30 de julio OpenAI recortó un 80% el precio de GPT-5.6 Luna, que quedó exactamente al mismo precio de lista que MAI-Code-1.1-Flash y con mejor puntuación en Terminal-Bench. Conviene tomarlo con cautela, porque cada fabricante mide con su propio harness, pero deja claro que MAI-Code no gana la comparación por precio por token. 

Lo que dicen los datos de producción 

El argumento a favor de Microsoft está en los datos de uso. El 29 de julio, el equipo de VS Code publicó datos agregados de uso real de Copilot Chat entre el 2 de junio y el 24 de julio. MAI-Code-1-Flash conservaba más código hasta el commit que Claude Haiku 4.5 y GPT-5.4 mini. Los modelos grandes, como GPT-5.6 Luna o Kimi K2.7 Code, quedaban ligeramente por encima en calidad, pero consumían entre un 67% y un 94% más de tokens por turno. 

En pruebas A/B con el modo automático de Copilot, que asigna el modelo sin que el usuario elija, quienes trabajaron con MAI-Code volvieron a usar la herramienta en los dos días siguientes un 6% más que con GPT-5.4 mini y un 11% más que con Haiku 4.5, con menos tokens de mediana. 

Para quien paga la factura, la consecuencia es directa: dos modelos con el mismo precio por millón de tokens pueden tener costes muy distintos por tarea si uno necesita muchos más tokens y más turnos para llegar al mismo commit. 

Los agregadores independientes, como LLM Stats, sitúan a MAI-Code en la zona media en calidad de código y bien posicionado en coste. Parte de sus datos son autoinformados por el fabricante, y la verificación externa exhaustiva todavía está pendiente. 

 

Qué implica para tu empresa 

  • Cartera de modelos. Ningún equipo va a programar solo con un modelo caro o solo con uno barato. La arquitectura razonable combina un modelo de frontera para el razonamiento profundo y otro eficiente para el trabajo iterativo del día a día, y MAI-Code ocupa ese segundo carril dentro del mismo selector de Copilot. 
  • Gobernanza de datos. Microsoft indica que los datos de clientes de Copilot Business y Copilot Enterprise no se usan para entrenar. Además, la política que habilita el modelo viene desactivada por defecto para los administradores, de modo que la adopción es una decisión explícita de cada organización. 
  • Dependencia de proveedor. El modelo es propietario y no publica sus pesos, a diferencia de la familia Phi. Su ventaja está ligada al ecosistema de GitHub y Microsoft; fuera de él, se diluye. 
  • Coste medible. Con precios públicos por token y datos de consumo por tarea, por primera vez es razonable modelar cuánto cuesta asistir a un equipo de N desarrolladores con cifras reales en lugar de estimaciones. 

Cómo decidir sin dejarse llevar por el benchmark 

Nuestra recomendación es decidir con evidencia propia. Seleccionar entre 20 y 30 tareas representativas del equipo (refactors, tests, migraciones, corrección de errores) y compararlas con dos o tres modelos en el mismo flujo. La métrica útil es el coste por tarea resuelta y los tokens hasta el commit, además del porcentaje de acierto. Después, pilotar con gobierno: qué superficies se habilitan, qué políticas se activan y cómo se documenta la decisión. 

MAI-Code no es el modelo más inteligente del mercado y Microsoft tampoco lo vende así: ha anunciado modelos de código MAI más grandes para este mismo año, pensados para competir con la frontera. Lo que ya ha demostrado es que puede construir, entrenar y servir un modelo propio, barato y ajustado a su producto. Para las empresas que trabajan en el ecosistema Microsoft, el análisis de coste de sus herramientas de desarrollo tiene desde ahora una opción más. 

Cierre 

Si estás valorando qué modelos de código encajan en tu organización, cómo combinarlos y cómo medir su impacto real en productividad y coste, en Raona acompañamos a empresas en la adopción de GitHub Copilot y de IA para desarrollo con criterio y con datos propios. Cuéntanos cómo trabaja tu equipo y lo analizamos juntos. ¡Hablemos! 

Fuentes 

  1. Microsoft AI, «Introducing MAI-Code-1-Flash», 2 de junio de 2026. https://microsoft.ai/news/introducingmai-code-1-flash/ 
  1. Microsoft AI, «MAI-Code-1.1-Flash: better, faster, at a quarter of the cost», 11 de agosto de 2026. https://microsoft.ai/news/mai-code-1-1-flash-br-better-faster-at-a-quarter-of-the-cost/ 
  1. Microsoft AI, MAI-Code-1.1-Flash Model Card. https://microsoft.ai/pdf/MAI-Code-1.1-Flash-Model-Card.PDF 
  1. Visual Studio Code Blog, «MAI-Code-1-Flash: early results from real developers», 29 de julio de 2026. https://code.visualstudio.com/blogs/2026/07/29/mai-code-1-flash 
  1. GitHub Changelog, «MAI-Code-1.1-Flash available in GitHub Copilot», 11 de agosto de 2026. https://github.blog/changelog/2026-08-11-mai-code-1-1-flash-available-in-github-copilot/ 
  1. GitHub Changelog, «MAI-Code-1-Flash deprecated», 10 de septiembre de 2026. https://github.blog/changelog/2026-09-10-mai-code-1-flash-deprecated/ 
  1. GitHub Docs, modelos y precios de GitHub Copilot. https://docs.github.com/en/copilot/reference/copilot-billing/models-and-pricing 
  1. OpenAI, «GPT-5.6», 9 de julio de 2026. https://openai.com/index/gpt-5-6/ 
  1. Anthropic, Claude Opus 5.5, 22 de septiembre de 2026. https://www.anthropic.com/claude-opus-5-5 
  1. LLM Stats, ficha de MAI-Code-1.1-Flash. https://llm-stats.com/models/mai-code-1.1-flash 

Las cifras de benchmarks son las publicadas por cada fabricante con metodologías y harnesses distintos, por lo que sirven para orientar y no constituyen una comparación controlada. 

 


Nibaldo Pino Araya

Experto en IA y análisis de datos con 7+ años de experiencia en la industria y 9 en academia, apasionado por la innovación tecnológica y especializado en soluciones avanzadas de machine learning, NLP y visión por computador en Raona.

Compartir en Redes Sociales