MAI-Code-1-Flash logo

MAI-Code-1-Flash

Microsoft · Veröffentlicht Juni 2026

Bedingt

Microsofts erstes hauseigenes Coding-Modell — ein kleines, schnelles, aggressiv kostenoptimiertes Sparse-MoE für $0.75/$4.50 per 1M tokens. Liefert einen Vorsprung von 16 Punkten gegenüber Claude Haiku 4.5 auf SWE-Bench Pro und verbraucht dabei bis zu 60 % weniger Tokens. Es ist gezielt für Copilot-Workflows mit hohem Volumen gebaut — Autovervollständigungen, Refactorings, Gerüstcode — kein Frontier-Modell. Am besten innerhalb des Copilot-Ökosystems; der API-Zugang außerhalb wird noch ausgerollt.

Ist es das Richtige für dich?

Gut für

  • Schnelle, iterative agentische Coding-Workflows in VS Code / GitHub Copilot, bei denen Latenz und Token-Kosten wichtiger sind als Frontier-Reasoning
  • Code-Vervollständigungen, Refactorings, Test-Gerüst-Generierung und Boilerplate in hohem Volumen — die tägliche Copilot-Arbeit
  • Kostensensitive Enterprise-Deployments: zu $0,75/$4,50 pro 1M Tokens unterbietet es Claude Haiku 4.5 und GPT-5.5 um das 2-6-fache
  • Entwickler mit Copilot-Free/Pro/Pro+/Max-Tarifen, die ihr monatliches KI-Guthaben weiter strecken wollen

Nicht geeignet für

  • Komplexe dateiübergreifende Architekturänderungen oder neuartiges Algorithmen-Design, die Frontier-Code-Reasoning erfordern
  • Allgemeine Nicht-Coding-Aufgaben — dies ist ein spezialisiertes Coding-Modell, kein allgemeiner Assistent
  • Produktive CI/CD-Agenten außerhalb des Copilot-Harness — Drittanbieter-API-Zugriff via Fireworks/Baseten/OpenRouter wird noch ausgebaut

Leistung nach Aufgabe

Code-Vervollständigung und Autocomplete

Excellent

Hervorragend — niedrige Latenz, adaptive Antwortlänge, maßgeschneidert für Copilots interaktiven Loop

Code-Refactoring

Very Good

Stark — bewältigt routinemäßiges Refactoring gut; 60 % weniger Tokens als Konkurrenten auf SWE-Bench Verified

Anweisungsbefolgung (Coding)

Excellent

Klassenbeste in der Leichtgewichts-Stufe — +28,9 Punkte auf IF Bench gegenüber Haiku 4.5; 85,8 % bei adversarialem Reasoning

Agentischer Tool-Use (Copilot-Harness)

Very Good

Stark — mit Copilots Produktions-Harness trainiert; schlägt Haiku 4.5 auf τ¹-Bench

Reale Bugfixes (SWE-Bench Pro)

Good

Solide für seine Größe — 51,2 % Erfolgsquote; 16 Punkte Vorsprung vor Haiku 4.5, aber deutlich unter Frontier-Modellen

Dateiübergreifende Architektur / neues Design

Fair

Schwach — 5B aktive Parameter begrenzen die Reasoning-Tiefe; für komplexe Arbeiten ein Flaggschiff-Modell nutzen

Mathe- und Wissenschafts-Reasoning

Very Good

Gut — 92,5 % AIME 2026, 84,6 % GPQA Diamond; stark für ein Leichtgewichts-Modell

Allgemeiner Chat / Nicht-Coding

Poor

Nicht dafür ausgelegt — ein spezialisiertes Coding-Modell; für allgemeine Aufgaben GPT-5.5 oder Claude nutzen

Preise

Eingabe

$0.75 / 1M tokens

Ausgabe

$4.50 / 1M tokens

Kontext

256K context

Alle Preise ansehen

Benchmarks

BenchmarkWertQuelle
SWE-Bench Pro51.2% (vs Haiku 4.5: 35.2%) Quelle
SWE-Bench VerifiedBeats Haiku 4.5 with up to 60% fewer tokens Quelle
AIME 202692.5% (vs Haiku 4.5: 83.3%) Quelle
GPQA Diamond84.6% (vs Haiku 4.5: 73.2%) Quelle
IF Bench75.0 (vs Haiku 4.5: 46.1) Quelle
Adversarial reasoning85.8% adjusted accuracy Quelle
Frontier Math (Tier 1-3)6.3% (vs Haiku 4.5: 2.8%) Quelle
Frontier Science58.2% (vs Haiku 4.5: 42.3%) Quelle
HLE18.0% (vs Haiku 4.5: 9.5%) Quelle

Urteilsverlauf

15. Juli 2026
copy edit to brevity standard — detail preserved in existing structured children

Prüfprotokoll

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Preise— Keine Änderungen

    Automatisierter Agent

    Pricing unchanged: $0.75/$4.50 per 1M tokens, 256K context. Confirmed live on GitHub Copilot pricing page.

  • Profil— Keine Änderungen

    Beim Start importiert

  • Preise— Keine Änderungen

    Beim Start importiert

Wie wir bewerten