MAI-Code-1-Flash logo

MAI-Code-1-Flash

Microsoft · Lanzado jun 2026

Condicional

El primer modelo de código propio de Microsoft — un MoE disperso pequeño, rápido y agresivamente optimizado en costos a $0.75/$4.50 por 1M de tokens. Ofrece una ventaja de 16 puntos sobre Claude Haiku 4.5 en SWE-Bench Pro usando hasta un 60% menos de tokens. Está diseñado específicamente para flujos de trabajo de Copilot de alto volumen — autocompletados, refactorizaciones, andamiajes —, no es un modelo frontera. Rinde mejor dentro del ecosistema Copilot; el acceso por API fuera de él aún se está desplegando.

¿Es adecuada para ti?

Bueno para

  • Flujos de trabajo de codificación agentiva iterativos y rápidos en VS Code / GitHub Copilot donde la latencia y el coste de tokens importan más que el razonamiento de frontera
  • Autocompletados de código de alto volumen, refactorizaciones, generación de andamiaje de tests y código repetitivo — la carga de trabajo diaria de Copilot
  • Despliegues empresariales sensibles al coste: a $0.75/$4.50 por 1M de tokens, rebaja a Claude Haiku 4.5 y GPT-5.5 entre 2 y 6 veces
  • Desarrolladores en planes Copilot Free/Pro/Pro+/Max que quieren estirar aún más sus créditos mensuales de IA

No recomendado para

  • Cambios arquitectónicos complejos en múltiples archivos o diseño de algoritmos novedosos que requieren razonamiento de código de nivel frontera
  • Tareas no relacionadas con código de propósito general — este es un modelo de codificación especializado, no un asistente general
  • Agentes de CI/CD en producción fuera del entorno de Copilot — el acceso API de terceros a través de Fireworks/Baseten/OpenRouter aún se está desplegando

Rendimiento por tarea

Autocompletado de código

Excellent

Excelente — baja latencia, longitud de respuesta adaptativa, diseñado específicamente para el bucle interactivo de Copilot

Refactorización de código

Very Good

Sólido — maneja bien las refactorizaciones rutinarias; un 60% menos de tokens que la competencia en SWE-Bench Verified

Seguimiento de instrucciones (codificación)

Excellent

El mejor de su categoría ligera — +28.9 puntos en IF Bench sobre Haiku 4.5; 85.8% en razonamiento adversarial

Uso agentivo de herramientas (entorno Copilot)

Very Good

Sólido — entrenado con el entorno de producción de Copilot; supera a Haiku 4.5 en τ¹-Bench

Corrección de errores reales (SWE-Bench Pro)

Good

Correcto para su tamaño — 51.2% de aciertos; 16 puntos de ventaja sobre Haiku 4.5 pero muy por debajo de los modelos frontera

Arquitectura multiarchivo / diseño novedoso

Fair

Débil — los 5B de parámetros activos limitan la profundidad de razonamiento; usa un modelo insignia para trabajo complejo

Razonamiento matemático y científico

Very Good

Bueno — 92.5% en AIME 2026, 84.6% en GPQA Diamond; sólido para un modelo ligero

Chat de propósito general / no programación

Poor

No está diseñado para ello — es un modelo de código especializado; usa GPT-5.5 o Claude para tareas generales

Precios

Entrada

$0.75 / 1M tokens

Salida

$4.50 / 1M tokens

Contexto

256K context

Ver precios completos

Pruebas de rendimiento

PruebaPuntuaciónFuente
SWE-Bench Pro51.2% (vs Haiku 4.5: 35.2%) Fuente
SWE-Bench VerifiedBeats Haiku 4.5 with up to 60% fewer tokens Fuente
AIME 202692.5% (vs Haiku 4.5: 83.3%) Fuente
GPQA Diamond84.6% (vs Haiku 4.5: 73.2%) Fuente
IF Bench75.0 (vs Haiku 4.5: 46.1) Fuente
Adversarial reasoning85.8% adjusted accuracy Fuente
Frontier Math (Tier 1-3)6.3% (vs Haiku 4.5: 2.8%) Fuente
Frontier Science58.2% (vs Haiku 4.5: 42.3%) Fuente
HLE18.0% (vs Haiku 4.5: 9.5%) Fuente

Historial de veredictos

15 jul 2026
copy edit to brevity standard — detail preserved in existing structured children

Registro de verificación

  • Precios— Sin cambios

    Agente automatizado

  • Precios— Sin cambios

    Agente automatizado

  • Precios— Sin cambios

    Agente automatizado

  • Precios— Sin cambios

    Agente automatizado

    Pricing unchanged: $0.75/$4.50 per 1M tokens, 256K context. Confirmed live on GitHub Copilot pricing page.

  • Perfil— Sin cambios

    Importado en el lanzamiento

  • Precios— Sin cambios

    Importado en el lanzamiento

Cómo evaluamos