Kimi K3 führt Arena Coding mit $3/$15 an, Open Weights am 27. Juli
- Was ist passiert
- Moonshot AI launched Kimi K3, a 2.8T open-weight MoE model that beat Claude Fable 5 for #1 on Arena Code WebDev (1679) at $3/$15 per 1M tokens.
- Warum es wichtig ist
- It's the third Chinese frontier-competitive open-weight model this month — Hy3, GLM-5.2, and now K3 — while Google's Gemini 3.5 Pro was confirmed 'months behind' the same day, making the open-weight frontier a genuine challenge to US closed models.
- Was zu tun ist
- Watch the July 27 weight release, and if K3 ships open as promised, evaluate it for coding workloads where Fable 5's $10/$50 pricing is unsustainable — K3 at $3/$15 with 90%+ cache-hit rates sets a new cost baseline.
Kimi K3 ist das größte jemals veröffentlichte Open-Weight-Modell — und sein erster Akt: Claude Fable 5 vom ersten Platz der Arena Code WebDev zu verdrängen, und das bei dreifach niedrigeren Kosten.
Moonshot AI brachte das 2,8-Billionen-Parameter Mixture-of-Experts-Modell am 16. Juli 2026 zu einem Pauschalpreis von $3/$15 pro Million Tokens auf den Markt (Moonshot AI, 2026). Der API-Zugang ist ab sofort über die Kimi-App, Kimi Code und einen OpenAI-kompatiblen Endpunkt verfügbar. Die Open Weights sind für den 27. Juli versprochen — sollte das klappen, wäre K3 das größte herunterladbare Modell mit einem Vorsprung von fast 3x gegenüber dem nächstgrößten Open-Weight-Release.
Was Kimi K3 liefert
K3 erreichte 1679 Punkte auf Arena Code WebDev — den Spitzenplatz, vor sowohl Fable 5 als auch GPT-5.6 Sol X-High bei Frontend-Coding-Aufgaben (LMSYS Arena, 2026). Im breiteren Intelligence Index von Artificial Analysis landet es bei 57 — vergleichbar mit Claude Opus 4.8 und GPT-5.5, wenngleich noch hinter Fable 5 und Sol bei allgemeinen Reasoning-Benchmarks.
Zwei neue Architekturkomponenten unterscheiden K3 von seinem Vorgänger Kimi K2: Kimi Delta Attention (KDA), ein hybrider linearer Aufmerksamkeitsmechanismus, und Attention Residuals (AttnRes). Zusammen liefern sie etwa 2,5x bessere Skalierungseffizienz. Das 896-Experten-MoE aktiviert nur 16 Experten pro Token, was die Inferenzkosten niedrig hält (Moonshot AI, 2026).
| Modell | Input-Preis | Output-Preis | Arena WebDev | Weights |
|---|---|---|---|---|
| Kimi K3 | $3 / 1M | $15 / 1M | 1679 (#1) | 27. Jul (versprochen) |
| Claude Fable 5 | $10 / 1M | $50 / 1M | #2 | Closed |
| GPT-5.6 Sol | $5 / 1M | $30 / 1M | #3 | Closed |
Moonshot strafft parallel zum Launch seine ältere Modellpalette: K2.5 und die veraltete moonshot-v1-Serie werden für neue Nutzer geschlossen, vollständiger Sunset bis zum 15. Oktober. Dies positioniert K3 als das einzige Frontend für die gesamte Modellplattform des Unternehmens.
Die chinesische Frontier-Welle
K3 ist das dritte chinesische Frontier-Open-Weight-Modell, das in diesem Monat auf den Markt kommt — nach Tencents Hy3 (7. Juli) und Z.ai's GLM-5.2 (10. Juli). Alle drei beanspruchen Parität oder Überlegenheit gegenüber US-amerikanischen Closed-Source-Frontier-Modellen in spezifischen Dimensionen. K3s 1679 Arena WebDev-Score markiert den bedeutendsten Benchmark-Anspruch der drei.
Der Zeitpunkt ist bemerkenswert: Am selben Tag, an dem Bloomberg bestätigte, dass Googles Gemini 3.5 Pro — das designierte dritte US-Frontier-Modell — in seiner vierten Verzögerung steckt und „Monate hinter dem Zeitplan" liegt, beanspruchte ein chinesisches Open-Weight-Modell den Coding-Thron.
Der große Test ist der 27. Juli. Moonshot hat öffentlich zugesagt, K3s vollständige Gewichte unter einer Apache-2.0-Lizenz zu veröffentlichen. Wenn sie das Versprechen einlösen, wird K3 das größte herunterladbare Modell sein — mit einem Abstand von fast 3x zum nächsten Open-Release. Wenn sie es nicht tun, reiht sich die Ankündigung in eine wachsende Liste von „Coming Soon"-Gewichtsversprechen ein, die nie eingelöst wurden.
Was zu tun ist
- 1 Evaluate Kimi K3 on your coding benchmarks once weights ship July 27 — at $3/$15 with 90%+ cache-hit rates, it resets the cost baseline for heavy coding workloads.
- 2 If self-hosting, budget for 64+ accelerators — K3's 2.8T MoE architecture demands serious GPU resources.
Betroffene Tools & Modelle
Nie wieder etwas verpassen
Das wöchentliche Delta — nur Urteilsänderungen und dringende Punkte. Kein Füllmaterial.