Kimi K3 domine Arena Coding à 3 $/15 $, poids ouverts le 27 juillet
- Ce qui s’est passé
- Moonshot AI launched Kimi K3, a 2.8T open-weight MoE model that beat Claude Fable 5 for #1 on Arena Code WebDev (1679) at $3/$15 per 1M tokens.
- Pourquoi c’est important
- It's the third Chinese frontier-competitive open-weight model this month — Hy3, GLM-5.2, and now K3 — while Google's Gemini 3.5 Pro was confirmed 'months behind' the same day, making the open-weight frontier a genuine challenge to US closed models.
- Que faire
- Watch the July 27 weight release, and if K3 ships open as promised, evaluate it for coding workloads where Fable 5's $10/$50 pricing is unsustainable — K3 at $3/$15 with 90%+ cache-hit rates sets a new cost baseline.
Kimi K3 est le plus grand modèle open-weight jamais publié — et son premier exploit est de battre Claude Fable 5 pour la première place sur Arena Code WebDev, à un coût trois fois inférieur.
Moonshot AI a lancé ce modèle Mixture-of-Experts de 2 800 milliards de paramètres le 16 juillet 2026, à un tarif fixe de 3 $/15 $ par million de tokens (Moonshot AI, 2026). L'accès API est disponible dès maintenant via l'application Kimi, Kimi Code et un endpoint compatible OpenAI. Les poids ouverts sont promis pour le 27 juillet — si cette promesse est tenue, K3 deviendrait le plus grand modèle téléchargeable, avec une avance de près de 3x sur le second plus grand modèle open-weight.
Ce que Kimi K3 apporte
K3 a obtenu 1679 sur Arena Code WebDev — la première place, devant Fable 5 et GPT-5.6 Sol X-High sur les tâches de codage front-end (LMSYS Arena, 2026). Sur l'indice d'intelligence général d'Artificial Analysis, il atteint 57 — comparable à Claude Opus 4.8 et GPT-5.5, bien que toujours derrière Fable 5 et Sol sur les benchmarks de raisonnement général.
Deux nouveaux composants architecturaux distinguent K3 de son prédécesseur, Kimi K2 : Kimi Delta Attention (KDA), un mécanisme d'attention linéaire hybride, et Attention Residuals (AttnRes). Ensemble, ils offrent une efficacité de scaling environ 2,5x supérieure. Le MoE à 896 experts n'active que 16 experts par token, maintenant des coûts d'inférence bas (Moonshot AI, 2026).
| Modèle | Prix entrée | Prix sortie | Arena WebDev | Poids |
|---|---|---|---|---|
| Kimi K3 | 3 $ / 1M | 15 $ / 1M | 1679 (#1) | 27 juil (promis) |
| Claude Fable 5 | 10 $ / 1M | 50 $ / 1M | #2 | Fermé |
| GPT-5.6 Sol | 5 $ / 1M | 30 $ / 1M | #3 | Fermé |
Moonshot réduit sa gamme de modèles plus anciens parallèlement au lancement : K2.5 et la série moonshot-v1 ferment aux nouveaux utilisateurs, avec un arrêt complet au 31 août (Moonshot AI, 2026).
Pourquoi c'est important
C'est le troisième modèle open-weight chinois à entrer en territoire frontier-compétitif en 30 jours. Tencent a sorti Hy3 le 6 juillet sous licence Apache 2.0 avec un fort outillage d'appel de fonctions. Z.ai a lancé GLM-5.2 le 13 juin sous licence MIT avec un contexte d'1M de tokens. Maintenant, K3 arrive avec un score #1 sur Arena WebDev et le plus grand nombre de paramètres jamais publié en open-weight.
Le timing est brutal pour Google. Le jour même du lancement de K3, Bloomberg confirmait que Gemini 3.5 Pro est « en retard de plusieurs mois » sur ses objectifs internes — le modèle américain censé offrir une troisième option frontier aux côtés d'Anthropic et d'OpenAI n'est toujours pas disponible (Bloomberg, 2026).
Moonshot lèverait également de nouveaux capitaux à une valorisation de 31,5 milliards de dollars — un bond substantiel par rapport à sa levée précédente, bien que le chiffre de 4,3 milliards de la Série C de janvier 2026 soit difficile à vérifier indépendamment (Reuters, 2026). C'est une trajectoire habituellement réservée aux labs qui livrent des modèles frontier fermés. Le message est clair : les modèles open-weight attirent des investissements à l'échelle frontier.
La réserve : K3 ne domine pas sur le raisonnement général. Fable 5 et GPT-5.6 Sol conservent l'avantage sur les benchmarks d'exécution précise et d'analyse (Moonshot AI, 2026). C'est un pari sur le codage et l'efficacité-coût, pas une revendication de la couronne frontier globale. Et les poids ne sont pas encore téléchargeables — chaque flagship Kimi précédent a bien livré ses poids en open, mais jusqu'au 27 juillet, c'est une promesse, pas un fait.
Ce qui change pour vous
Si vous payez les tarifs de 10 $/50 $ de Fable 5 (crédits uniquement) pour des workloads de codage, K3 redéfinit la référence de coût. Le modèle affiche des taux de cache-hit supérieurs à 90 % sur les tâches de codage, le cache faisant chuter le prix à 0,30 $ par million de tokens (Moonshot AI, 2026). Pour une équipe qui exécute quotidiennement de lourds pipelines de codage, la différence de coût n'est pas marginale — c'est la différence entre un workflow soutenable et un workflow rationné.
L'accès open-weight, s'il est livré dans les temps, signifie également un déploiement auto-hébergé pour les équipes disposant d'une infrastructure GPU suffisante (64+ accélérateurs). Pas de dépendance API, pas de limite de débit, pas de données sortant de votre infrastructure. Nous recommandons d'évaluer K3 aux côtés de GLM-5.2 et Hy3 une fois que les trois seront téléchargeables.
La tarification du cache est l'avantage caché ici. À 0,30 $ par million de tokens pour les entrées en cache, les passes de codage répétées — relire la même codebase à travers les itérations — deviennent radicalement moins chères. L'architecture de K3 a été conçue pour ce pattern, et les taux de hit supérieurs à 90 % rapportés par Moonshot sur les workloads de codage suggèrent que cela fonctionne comme prévu.
FAQ
Kimi K3 est-il vraiment meilleur que Fable 5 ?
Sur le codage front-end et le développement web, oui — il domine Arena WebDev avec une marge mesurable (1679 contre le score de Fable 5). Sur le raisonnement général, l'exécution précise et les benchmarks de cybersécurité, non — Fable 5 et GPT-5.6 Sol conservent l'avantage. Pensez à K3 comme un spécialiste du codage et de l'efficacité, pas comme un remplacement généraliste du niveau frontier.
Quand puis-je télécharger les poids ?
Moonshot promet une sortie open-weight avant le 27 juillet. Chaque flagship Kimi précédent (K1.5, K2, K2.5) a livré ses poids, donc l'historique soutient cette promesse. D'ici là, K3 est accessible uniquement via API sur la plateforme Kimi et les endpoints compatibles OpenAI.
Comment K3 se compare-t-il à GLM-5.2 et Hy3 ?
K3 est plus grand — 2 800 milliards de paramètres contre 295 milliards pour Hy3 (21 milliards actifs) — et obtient un meilleur score sur Arena WebDev. Hy3 gagne sur la licence permissive Apache 2.0 et des exigences d'auto-hébergement plus faibles. GLM-5.2 a l'avantage de la licence MIT et d'un historique plus long. Tous les trois sont open-weight et sous licence permissive, ce qui rend cette fenêtre de 30 jours sans précédent dans le paysage des modèles ouverts.
Que faire
- 1 Evaluate Kimi K3 on your coding benchmarks once weights ship July 27 — at $3/$15 with 90%+ cache-hit rates, it resets the cost baseline for heavy coding workloads.
- 2 If self-hosting, budget for 64+ accelerators — K3's 2.8T MoE architecture demands serious GPU resources.
Outils et modèles concernés
Ne ratez plus jamais une mise à jour
Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.