Modèles d’IA

54

Trouvez le bon modèle pour votre tâche. Filtrez par point fort, comparez les tarifs et décidez.

Filtrer par fournisseur

54modèles
Astra logo

Astra

OpenAI

pending

Premier modèle à déclencher le seuil de cybersécurité « Critical » d'OpenAI. A résolu 10 problèmes mathématiques ouverts pour environ 2 000 $. Développement activement suspendu depuis août 2026 pour renforcement de la sécurité.

Entrée
Not yet published
Sortie
Not yet published
Contexte
Development slowed Aug 2026. No GA date.
Claude Fable 5 logo

Claude Fable 5

Anthropic

Conditionnel

Le modèle frontière de classe Mythos d'Anthropic — le Claude le plus puissant jamais rendu public, en tête de tous les grands benchmarks à son lancement. Le verdict reste CONDITIONNEL en raison de deux contraintes actuelles : une tarification uniquement à crédits de $10/$50 par 1M tokens sans option d'abonnement, et un classificateur de sécurité qui se déclenche trop souvent sur des tâches de codage courantes, les redirigeant silencieusement vers un repli sur Opus 4.8. Optez pour Fable 5 lorsque le gain de capacité justifie le coût ; pour le travail courant, Sonnet 5 est l'alternative la plus prévisible.

Entrée
$10 / 1M tokens
Sortie
$50 / 1M tokens
Contexte
1M context, 128K max output
Claude Haiku 4.5 logo

Claude Haiku 4.5

Anthropic

Recommandé

La référence rapport qualité-prix d'Anthropic à $1/$5 par 1M tokens — le palier rapide et économique auquel les concurrents se comparent, avec un contexte de 200K et une sortie de 64K. Idéal pour les charges à fort volume sensibles à la latence : classification, extraction, résumé, routage. Passez à Opus 4.8 ou Sonnet 5 lorsqu'un raisonnement profond en plusieurs étapes est nécessaire.

Entrée
$1 / 1M tokens
Sortie
$5 / 1M tokens
Contexte
200K tokens
Claude Opus 4.8 logo

Claude Opus 4.8

Anthropic

Recommandé

Le modèle de raisonnement phare d'Anthropic et le titulaire pratique de la frontière en capacité déployable — contexte de 1M tokens à $5/$25 par 1M tokens, inclus dans tous les plans d'abonnement. Notre choix pour le travail axé sur la revue : revue de code, refactoring sous contraintes et tâches à rythme délibéré. Un codage agentique solide, un raisonnement analytique de premier ordre et un accès stable par abonnement en font le modèle phare par défaut pour la plupart des équipes de production.

Entrée
$5 / 1M tokens
Sortie
$25 / 1M tokens
Contexte
1M tokens
Claude Opus 5 logo

Claude Opus 5

Anthropic

Recommandé

Une intelligence proche de Fable 5 à moitié prix. SOTA sur Frontier-Bench et CursorBench. 85 % de garde-fous cyber en moins que Fable 5. Le modèle frontière de référence pour le codage quotidien.

Entrée
$5.00 / 1M tokens
Sortie
$25.00 / 1M tokens
Contexte
200K tokens
Claude Sonnet 4.6 logo

Claude Sonnet 4.6

Anthropic

Conditionnel

Supplanté par Claude Sonnet 5 (sorti le 30 juin 2026) comme cheval de bataille par défaut du segment intermédiaire. La tarification $3/$15 de Sonnet 4.6 et son contexte de 1M tokens sont désormais égalés par un successeur affichant un bond de 13,4 points sur Terminal-Bench 2.1 à la même grille tarifaire. Ne choisissez 4.6 que pour des déploiements figés ou lorsque le nombre de tokens ~30% plus élevé de Sonnet 5 et la suppression de temperature/top_p/top_k sont rédhibitoires.

Entrée
$3 / 1M tokens
Sortie
$15 / 1M tokens
Contexte
1M tokens
Claude Sonnet 5 logo

Claude Sonnet 5

Anthropic

Recommandé

Le Sonnet le plus agentique d'Anthropic offre des performances proches d'Opus 4.8 pour environ la moitié du prix, avec +13,4 points sur Terminal-Bench 2.1 par rapport à Sonnet 4.6. Le nouveau tokenizer gonfle les décomptes d'environ 30%, si bien que la tarification de lancement ($2/$10 par MTok jusqu'au 31 août) rend la migration neutre en coût, mais les équipes devraient recalculer leurs budgets avant de basculer. Il remplace Sonnet 4.6 comme modèle par défaut sur tous les plans Claude, idéal pour le codage agentique, le débogage de code existant et les pipelines de production — pas pour les raisonnements frontière les plus difficiles ni les tâches de cybersécurité.

Entrée
$3 / 1M
Sortie
$15 / 1M
Contexte
1M tokens
D

DeepSeek V4 Flash

DeepSeek

Recommandé

DeepSeek's volume-tier open-weight model at 284B parameters (13B active MoE) with a 1M-token context window. SWE-bench Verified 79.0% at $0.22 input and $0.66 output per 1M tokens off-peak, doubling during the seven daily peak hours. The August 2026 price rise ended its run as the cheapest credible API (GPT-5.6 Luna now undercuts it on input at $0.20), but it remains a strong value pick, and the MIT license means self-hosting sidesteps API pricing entirely. Still the default workhorse for high-throughput agent pipelines that can run off-peak.

Entrée
$0.22 / 1M tokens
Sortie
$0.66 / 1M tokens
Contexte
1M tokens. Peak 2x: 01-04 + 06-10 UTC
D

DeepSeek V4 Pro

DeepSeek

Recommandé

The strongest open-weight coding model we've tested: SWE-bench Verified 80.6%, LiveCodeBench 93.5% and 3206 Codeforces Elo. At $0.66 input and $1.98 output per 1M tokens off-peak it stays far below Western flagship pricing even after the August 2026 rise, though rates double during the seven daily peak hours. The default for self-hosted agentic coding.

Entrée
$0.66 / 1M tokens
Sortie
$1.98 / 1M tokens
Contexte
1M tokens. Peak 2x: 01-04 + 06-10 UTC
F

FLUX 3

Black Forest Labs

Conditionnel

Modèle de fondation multimodal unifié pour la prédiction d'image, vidéo, audio et action.

Entrée
Not yet published
Sortie
Not yet published
Contexte
Gated early access
G

GLM-5.2

Z.ai

Conditionnel

Meilleur modèle de codage open weight avec un contexte de 1M tokens et licence MIT — bat GPT-5.5 sur plusieurs benchmarks pour une fraction du coût, mais reste derrière Claude Opus 4.8 sur les tâches à horizon long les plus difficiles.

Entrée
$1.40 / 1M tokens
Sortie
$4.40 / 1M tokens
Contexte
1M tokens
G

GLM-5.3

Z.ai

Conditionnel

GLM-5.3 est le dernier modèle de codage et de cyberdéfense à poids ouverts de Z.ai — la même base que GLM-5.2, chaque gain venant du post-entraînement. Mais les chiffres clés sont encore exécutés par le fournisseur, les poids ouverts sont retenus ~2 semaines en raison d'une capacité de sécurité émergente, et le tarif par token n'est pas publié. Tournez-vous dès maintenant vers la sécurité défensive et l'automatisation agentique ; attendez les poids et les audits indépendants avant de standardiser.

Entrée
N/A (rate not yet published)
Sortie
N/A (rate not yet published)
Contexte
1M context
GPT-4.1 logo

GPT-4.1

OpenAI

Recommandé

La cible de migration par défaut pour les workloads GPT-4 Turbo : même format de requête, coût inférieur, contexte de 1M tokens — convertissez les payloads function_call hérités au format tools et passez à la suite.

Entrée
$2 / 1M tokens
Sortie
$8 / 1M tokens
Contexte
1M tokens
GPT-4o (Retired from ChatGPT, API-only) logo

GPT-4o (Retired from ChatGPT, API-only)

OpenAI

Conditionnel

GPT-4o (May 2024) has been superseded by the GPT-5.x family and delisted from OpenAI's flagship API pricing page. It remains available through the API but is no longer a current-generation model. Use only where migration to GPT-5.x is blocked; otherwise, GPT-5.5 or GPT-5.4 offer better performance at comparable cost.

Entrée
$2.50 / 1M tokens
Sortie
$10 / 1M tokens
Contexte
128K tokens
GPT-5.5 logo

GPT-5.5

OpenAI

Recommandé

Le modèle frontière commercial généraliste d'OpenAI et le point d'ancrage OpenAI déployable tant que la famille GPT-5.6 reste sous restriction gouvernementale — $5/$30 par 1M tokens avec un contexte de 1M+. Un raisonnement solide, un large écosystème d'outils et une disponibilité publique complète en font un choix par défaut fiable en production, même si des modèles moins chers l'égalent désormais sur certaines tâches. Pour la plupart des équipes, il reste la référence à laquelle les nouveaux modèles sont comparés.

Entrée
$5 / 1M tokens
Sortie
$30 / 1M tokens
Contexte
1M+ tokens (922K in / 128K out)
GPT-5.5-Cyber logo

GPT-5.5-Cyber

OpenAI

Conditionnel

85,6 % CyberGym — meilleur score mono-modèle — mais accès restreint aux défenseurs habilités uniquement.

Entrée
N/A
Sortie
N/A
Contexte
Trusted Access for Cyber; not commercial API
GPT-5.6 Luna logo

GPT-5.6 Luna

OpenAI

Conditionnel

GPT-5.6 Luna is OpenAI's budget tier — near-GPT-5.5 capability at $1/$6 per 1M tokens, the strongest capability-per-dollar value in the GPT-5.6 family. Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported, Luna lacks activation classifiers, and it is not in the standard ChatGPT picker.

Entrée
$0.20 / 1M tokens
Sortie
$1.20 / 1M tokens
Contexte
Fastest tier. 80% cut Jul 30 → $0.20/$1.20.
GPT-5.6 Sol logo

GPT-5.6 Sol

OpenAI

Recommandé

GPT-5.6 Sol est le modèle frontière le plus rentable, en tête des benchmarks de codage et compétitif sur les raisonnements difficiles pour une fraction du coût de ses pairs. Verdict renforcé par la divulgation du durcissement de sécurité GPT-Red — le modèle a été entraîné de manière adversariale contre un modèle de red teaming dédié en self-play RL à l'échelle frontière, le rendant 6x plus robuste aux injections de prompt.

Entrée
$5 / 1M tokens
Sortie
$30 / 1M tokens
Contexte
Same $5/$30. Fast mode: 2.5× at 2× cost.
GPT-5.6 Terra logo

GPT-5.6 Terra

OpenAI

Conditionnel

GPT-5.6 Terra is OpenAI's mid-tier workhorse — GPT-5.5-class capability at half the cost ($2.50/$15 per 1M tokens). Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported without independent reproduction, and Terra is not selectable in the standard ChatGPT model picker.

Entrée
$2.00 / 1M tokens
Sortie
$12.00 / 1M tokens
Contexte
Mid-tier. 20% cut Jul 30 → $2.00/$12.00.
GPT-5.6-Cyber logo

GPT-5.6-Cyber

OpenAI

Conditionnel

GPT-5.6-Cyber est le modèle de cybersécurité spécialement entraîné d'OpenAI, construit sur GPT-5.6 Sol et disponible exclusivement via le programme contrôlé Daybreak Red. C'est le premier modèle à atteindre le seuil de capacité cyber 'High' d'OpenAI, avec des performances en chaînes d'exploit et zero-day qui dépassent largement les modèles généralistes.

Entrée
$12.50 / 1M tokens
Sortie
$75 / 1M tokens
Contexte
400K tokens
GPT-Live-1 logo

GPT-Live-1

OpenAI

Conditionnel

Le premier modèle vocal full-duplex d'OpenAI — il écoute et parle simultanément, un saut au-delà du mode Advanced Voice en alternance.

Entrée
ChatGPT subscription
Sortie
ChatGPT subscription
Contexte
ChatGPT Voice only
GPT-Live-1 mini logo

GPT-Live-1 mini

OpenAI

Conditionnel

La variante gratuite de GPT-Live-1 — même architecture duplex intégral dans un package plus petit et plus rapide.

Entrée
Free (ChatGPT)
Sortie
Free (ChatGPT)
Contexte
ChatGPT Voice only
GPT-Live-Transcribe logo

GPT-Live-Transcribe

OpenAI

Recommandé

Le modèle parole-texte en streaming à faible latence d'OpenAI délivre des deltas de transcription en direct à 0,017 $/min avec une latence ajustable et une transcription contextuelle.

Entrée
$0.017 / minute
Sortie
N/A
Contexte
Per-minute realtime audio billing
GPT-Transcribe logo

GPT-Transcribe

OpenAI

Recommandé

Le dernier modèle speech-to-text en batch d'OpenAI obtient 3,31 % AA-WER à 0,0045 $/min — 25 % moins cher et mesurablement plus précis que son prédécesseur gpt-4o-transcribe. Il prend en charge les invites contextuelles, les suggestions de mots-clés et la détection de langue sur plus de 22 langues, ce qui en fait le meilleur choix par défaut pour la transcription asynchrone de fichiers sur la plateforme OpenAI. Réserve : pas de diarisation ni d'horodatage au niveau des mots ; utilisez gpt-4o-transcribe-diarize pour l'identification des locuteurs ou gpt-live-transcribe pour les besoins en temps réel. Idéal pour les développeurs qui construisent des pipelines de transcription de réunions, de traitement média et d'interfaces vocales sur l'API OpenAI.

Entrée
$0.0045 / minute
Sortie
N/A
Contexte
Per-minute audio billing
Gemini 2.5 Pro logo

Gemini 2.5 Pro

Google

Recommandé

Désormais le choix économique pour le contexte long : une baisse de prix de 40 % (juin 2026) a rendu les traitements complets de corpus accessibles aux budgets moyens — la plus grande fenêtre de contexte disponible avec une intégration solide dans l'écosystème Google.

Entrée
$1.25 / 1M tokens
Sortie
$10 / 1M tokens
Contexte
1M tokens
Gemini 3.1 Pro logo

Gemini 3.1 Pro

Google

Conditionnel

Le modèle Pro le plus performant de Google accessible au public, avec un contexte d'un million de tokens à un tarif compétitif. Génération précédente : Gemini 3.6 et 3.5 Flash le surpassent désormais en codage et en benchmarks agentiques à moindre coût. Restez-y si vous êtes dans l'écosystème Google Cloud/Vertex AI ; sinon, la gamme Flash ou les concurrents offrent davantage.

Entrée
$2 / 1M
Sortie
$12 / 1M
Contexte
1M tokens
Gemini 3.5 Flash logo

Gemini 3.5 Flash

Google

Recommandé

La référence de Google en efficacité-coût pour l'automatisation agentique du poste de travail, à $1.50/$9 par 1M tokens avec un contexte d'environ 1M. Le Computer Use natif obtient 78,4 sur OSWorld-Verified — à 0,3 point de GPT-5.5 pour environ un tiers du coût. LA réserve à connaître : l'outil Computer Use est en préversion publique, pas encore dans l'API de production ; vérifiez la disponibilité de l'endpoint avant de l'intégrer.

Entrée
$1.50 / 1M tokens
Sortie
$9 / 1M tokens
Contexte
1M tokens
Gemini 3.5 Flash Cyber logo

Gemini 3.5 Flash Cyber

Google

Prudence

Gemini 3.5 Flash Cyber est le premier modèle spécialisé en cybersécurité de Google, fine-tuné à partir de 3.5 Flash pour trouver, valider et corriger des vulnérabilités. Au sein de l'architecture multi-agent de CodeMender, il atteint des performances compétitives sur CyberGym face à des modèles bien plus gros comme Mythos, pour une fraction du coût. Mais les restrictions sont sévères : il fonctionne exclusivement dans CodeMender, disponible uniquement pour les gouvernements et partenaires de confiance via un pilote à accès limité, sans API publique, sans chiffres de benchmark publiés et sans calendrier pour une diffusion plus large.

Entrée
N/A
Sortie
N/A
Contexte
CodeMender-only, government-gated pilot
Gemini 3.5 Flash-Lite logo

Gemini 3.5 Flash-Lite

Google

Recommandé

Gemini 3.5 Flash-Lite est le modèle le plus rapide et le moins cher de la série 3.5 de Google, à 350 tok/s et 0,30 $/2,50 $. Le saut générationnel par rapport à 3.1 Flash-Lite est le véritable sujet — il surpasse nettement son prédécesseur sur les principaux benchmarks agentiques et bat le modèle Gemini 3 Flash pleine taille sur les tâches de codage et de computer-use. Pour les développeurs qui font tourner à grande échelle des sous-agents agentiques, des pipelines de recherche et du traitement de documents, le rapport prix-performance de Flash-Lite est inégalé dans la gamme Google.

Entrée
$0.30 / 1M
Sortie
$2.50 / 1M
Contexte
1M context, 64K output, 350 tok/s
Gemini 3.5 Pro logo

Gemini 3.5 Pro

Google

pending

Le modèle frontière pré-GA de Google — désormais à son quatrième report et « des mois de retard » selon Bloomberg. Le contexte de 2M tokens, le pipeline multimodal natif et le raisonnement Deep Think restent des capacités réelles, mais aucun calendrier de disponibilité générale confirmé n'existe. La capacité de codage est la lacune principale.

Entrée
Not yet published
Sortie
Not yet published
Contexte
Est. $5-15/$30-60 per 1M. 2M ctx. Not GA.
Gemini 3.6 Flash logo

Gemini 3.6 Flash

Google

Recommandé

Gemini 3.6 Flash est le nouveau cheval de bataille par défaut de la gamme Flash de Google — il est à la fois meilleur et moins cher que 3.5 Flash, obtenant des scores supérieurs sur tous les benchmarks tout en réduisant le prix de sortie de 9,00 $ à 7,50 $ par million de jetons. Le gain d'efficacité de 17 % en jetons signifie un coût par tâche plus bas avant même la baisse de prix, et la fonction Computer Use intégrée via l'API en fait une option crédible pour le codage agentique. Pour les développeurs de l'écosystème Google, c'est la mise à niveau évidente — il n'y a aucune raison de rester sur 3.5 Flash.

Entrée
$1.50 / 1M
Sortie
$7.50 / 1M
Contexte
1M context, 64K output
Gemini 3.7 Flash logo

Gemini 3.7 Flash

Google

Recommandé

Gemini 3.7 Flash est le cheval de trait Flash le plus puissant de Google à ce jour pour le codage et les agents — une véritable montée en gamme par rapport à 3.6 Flash, à la moitié du prix précédent jusqu'en 2026. Il reste toutefois derrière la frontière sur les tâches terminal et d'utilisation d'ordinateur les plus difficiles. Une mise à niveau évidente pour les créateurs d'agents sensibles aux coûts et ancrés dans l'écosystème Google ; pas un remplaçant des modèles frontières pour le code.

Entrée
$0.75 / 1M
Sortie
$3.75 / 1M
Contexte
1M context, 64K output
Gemini 3.8 Flash logo

Gemini 3.8 Flash

Google

Recommandé

Gemini 3.8 Flash is Google's strongest Flash workhorse yet — a genuine capability upgrade over the recommended 3.7 Flash at the same introductory price, with real gains across software engineering, agents and professional domains. The deciding caveat is Google's own: 3.8 "works harder," so per-task token burn runs well above 3.7, which remains the efficiency-first pick. Adopt 3.8 for long-horizon coding, agents and finance or legal work — benchmark your own workload before the intro price expires.

Entrée
$0.75 / 1M
Sortie
$3.75 / 1M
Contexte
1M context, 64K output
Gemini 4 logo

Gemini 4

Google

pending

Le prochain modèle de Google DeepMind, confirmé. Le pré-entraînement a débuté le 21 juillet 2026. Aucun benchmark, aucun tarif, aucune spécification, aucune date de GA.

Entrée
Not yet published
Sortie
Not yet published
Contexte
Pre-training started Jul 2026. No GA date.
G

Grok 4.5

SpaceXAI

Conditionnel

Modèle de coding/agentique à prix compétitif à 2 $/6 $ par 1M tokens avec un contexte de 500K — les benchmarks publiés par xAI le placent en milieu de peloton derrière Fable 5 et GPT-5.5, bien qu'il devance Opus 4.8 sur DeepSWE et Terminal-Bench 2.1. La véritable histoire est l'efficacité coût : 4,2× plus efficient en tokens qu'Opus 4.8 sur SWE-Bench Pro. Idéal pour les équipes ayant besoin de coding performant à une fraction des tarifs frontaliers. Pas encore disponible dans l'UE.

Entrée
$2 / 1M tokens
Sortie
$6 / 1M tokens
Contexte
500K tokens
G

Grok 4.6

SpaceXAI

Conditionnel

Compétitif face à la frontière à $2/$6, avec un AA Intelligence Index de 61 (à égalité avec GPT-5.6 Sol) et un GDPVal-AA derrière seulement Claude Opus 5 — un départ solide, mais un seul évaluateur et un seul jour d'existence. Conditionnel : attendez pour miser en production jusqu'à ce que des benchmarks plus larges arrivent.

Entrée
$2.00 / 1M tokens
Sortie
$6.00 / 1M tokens
Contexte
Delayed past Aug 7. Now ~Aug 10-14. 500K ctx.
G

Grok Voice Think Fast 2.0

SpaceXAI

Conditionnel

Le modèle speech-to-speech de nouvelle génération de SpaceXAI, doté d'une architecture de raisonnement parallèle qui le rend nettement plus intelligent que les modèles vocaux conventionnels.

Entrée
$0.08 / min of audio (speech-to-speech)
Sortie
Included in speech-to-speech rate
Contexte
API-only
H

Hy3

Tencent

Conditionnel

Modèle agentique MoE à poids ouverts sous licence Apache 2.0 (295B total, 21B actifs) avec une fiabilité solide en appel d'outils et un bon comportement anti-hallucination, mais le codage est en retrait par rapport à GLM-5.2 et l'auto-hébergement exige 8 GPU ou plus. Niveau gratuit sur OpenRouter jusqu'au 21 juillet — ensuite 0,20 $/0,80 $ par million de tokens. Idéal pour les agents de codage auto-hébergés et le travail documentaire longue durée où la licence permissive prime sur les scores absolus de benchmarks.

Entrée
$0.20 / 1M
Sortie
$0.80 / 1M
Contexte
256K tokens
I

Inkling

Thinking Machines Lab

Conditionnel

Inkling est la meilleure raison à ce jour de prendre l'IA multimodale open-weight au sérieux. Il offre un raisonnement et un codage compétitifs avec une sécurité open-weight de premier ordre et un effort de réflexion contrôlable, le tout sous licence Apache 2.0. Mais Thinking Machines est honnête : ce n'est pas le plus performant dans l'absolu — la factualité est en retrait (SimpleQA 43,9 %) et l'auto-hébergement exige du matériel sérieux (2 To de VRAM). Conditionnel : une base convaincante pour les organisations qui ont besoin de posséder et de fine-tuner un modèle multimodal, pas pour les équipes qui veulent la performance maximale sur étagère.

Entrée
$1.87 / 1M tokens
Sortie
$4.68 / 1M tokens
Contexte
Up to 1M tokens native
K

Kimi K3

Moonshot AI

Conditionnel

Puissant modèle MoE 2,8T paramètres, n°1 Arena WebDev et scores Terminal-Bench élevés, mais désormais sous enquête active de la Maison Blanche pour vol de propriété intellectuelle à échelle industrielle, avec menace de sanctions du Trésor américain.

Entrée
$3.00 / 1M
Sortie
$15.00 / 1M
Contexte
1M ctx, $0.30 cached. Weights live (Jul 27).
L

Laguna S 2.1

poolside

Conditionnel

Laguna S 2.1 est le premier modèle de coding open-weight occidental crédible en 11 mois — un MoE de 118B qui n'active que 8B de paramètres par token tout en obtenant 70,2 % sur Terminal-Bench 2.1, battant des modèles 10 fois sa taille. Mais il n'est pas au niveau frontière — GPT-5.6 Sol et Kimi K3 sont loin devant — et les limitations connues incluent le surapprentissage de harnais et la déformation JSON. Idéal pour le coding agentique auto-hébergé lorsque la souveraineté des données prime sur le leadership absolu des benchmarks.

Entrée
$0.10 / 1M
Sortie
$0.20 / 1M
Contexte
OpenMDW-1.1 license, 1M context
Llama 4 Maverick logo

Llama 4 Maverick

Meta

Conditionnel

Le modèle open source de référence pour les équipes qui ont besoin d'auto-hébergement, de souveraineté des données, ou qui cherchent à éviter l'enfermement propriétaire des API.

Entrée
Free (self-hosted) or $0.20 / 1M tokens (hosted)
Sortie
Free (self-hosted) or $0.60 / 1M tokens (hosted)
Contexte
10M tokens
MAI-Code-1-Flash logo

MAI-Code-1-Flash

Microsoft

Conditionnel

Le premier modèle de codage maison de Microsoft — un MoE sparse petit, rapide et agressivement optimisé en coût à $0,75/$4,50 par 1M tokens. Il offre une avance de 16 points sur Claude Haiku 4.5 sur SWE-Bench Pro tout en utilisant jusqu'à 60% de tokens en moins. Il est conçu spécifiquement pour les workflows Copilot à haut volume — auto-complétions, refactorisations, échafaudages — ce n'est pas un modèle frontière. Meilleur au sein de l'écosystème Copilot ; l'accès API en dehors est encore en déploiement.

Entrée
$0.75 / 1M tokens
Sortie
$4.50 / 1M tokens
Contexte
256K context
MAI-Code-1.1-Flash logo

MAI-Code-1.1-Flash

Microsoft

Conditionnel

MAI-Code-1.1-Flash est le modèle de codage small-tier actualisé de Microsoft pour Copilot — un quart du coût et 22 % meilleur sur Terminal-Bench 2.1 que son prédécesseur de juin, désormais avec la vision native. Il est conçu pour le travail itératif à fort volume plutôt que le raisonnement de frontière, ce qui en fait le modèle de codage sérieux le moins cher de Copilot. Tournez-vous vers lui pour les complétions quotidiennes, les refactorisations et le débogage assisté par image ; utilisez un modèle phare pour l'architecture complexe.

Entrée
$0.20 / 1M
Sortie
$1.20 / 1M
Contexte
256K context
MAI-Cyber-1-Flash logo

MAI-Cyber-1-Flash

Microsoft

Conditionnel

Le premier modèle de cybersécurité interne de Microsoft, construit sur la famille MAI-Thinking-1 et intégré dans le harnais multi-agents MDASH. MAI-Cyber-1-Flash gère environ 90 % des workloads de sécurité à environ la moitié du coût des configurations précédentes, réservant GPT-5.4 pour les 10 % les plus difficiles. Il obtient 95,95 % sur CyberGym — 12 points au-dessus de Mythos 5 — mais il s'agit d'un benchmark rapporté par le fournisseur issu d'une configuration système complète (harnais + double modèle), pas d'un test indépendant modèle contre modèle. Disponible uniquement via Azure AI Foundry avec accès entreprise validé ; pas de tarification autonome ni d'API publique.

Entrée
N/A (MDASH SCU consumption)
Sortie
N/A (MDASH SCU consumption)
Contexte
Azure AI Foundry vetted access
Muse Glimmer logo

Muse Glimmer

Meta

Conditionnel

Muse Glimmer est le modèle agentic open-weight de 30B de Meta, distillé à partir du modèle frontier fermé Muse Spark et publié sous Apache 2.0. Avec une quantification 4-bit, il exécute des appels d'outils multi-étapes, du raisonnement multimodal et de la récupération d'erreurs sur un seul GPU grand public 24 Go sans dépendances cloud.

Entrée
Free (open weights)
Sortie
Free (open weights)
Contexte
131K tokens
Muse Spark 1.1 logo

Muse Spark 1.1

Meta

Conditionnel

Le premier modèle d'IA payant de Meta et sa première salve sur le marché du coding commercial — 1,25 $/4,25 $ par 1M tokens avec 1M de contexte, orchestration native de sous-agents, support MCP/outils et capacité computer-use à environ 4× sous les tarifs d'Anthropic/OpenAI. Domine les benchmarks d'utilisation d'outils mais accuse un retard de 7 points sur Opus 4.8 en coding pur sur SWE-Bench Pro. Poids fermés, préversion publique réservée aux États-Unis. Idéal pour les équipes privilégiant l'orchestration d'outils à bas coût.

Entrée
$1.25 / 1M tokens
Sortie
$4.25 / 1M tokens
Contexte
1M tokens
Muse Spark 1.2 logo

Muse Spark 1.2

Meta

Conditionnel

La mise à jour du modèle de Meta axée sur le codage, co-entraîné avec le harnais Muse Code — 82,9 % sur Terminal-Bench 2.1 et 59,3 % sur DeepSWE 1.1, deuxième seulement derrière Claude Opus 5 sur le premier. Tarification standard inchangée à 1,25 $ en entrée / 4,25 $ en sortie par million de tokens.

Entrée
$1.25 / 1M tokens
Sortie
$4.25 / 1M tokens
Contexte
1M tokens
Mythos 5 (Claude Mythos 5) logo

Mythos 5 (Claude Mythos 5)

Anthropic

Conditionnel

Le modèle de cybersécurité le plus puissant au monde (83,8% CyberGym) — construit sur les poids de Fable 5 avec les classificateurs de sécurité retirés. L'accès a été suspendu après la directive d'exportation du 12 juin ; partiellement restauré le 26 juin pour ~100 organisations américaines désignées d'infrastructure critique (Project Glasswing). Le verdict reste CONDITIONNEL : la capacité est d'élite, mais l'accès est verrouillé par désignation fédérale. Pas une API publique — utilisable uniquement si votre organisation figure sur la liste du Département du Commerce.

Entrée
$10 / 1M tokens
Sortie
$50 / 1M tokens
Contexte
1M tokens (restricted access)
O

Ornith-1.0

DeepReinforce

Conditionnel

Une famille de modèles open source agentic coding sous licence MIT qui atteint des benchmarks compétitifs avec les modèles frontier — battant Claude Opus 4.7 à la fois sur Terminal-Bench 2.1 et SWE-Bench Verified — mais qui nécessite un autohébergement avec des ressources GPU significatives et provient d'un nouveau labo au track record limité.

Entrée
Free (MIT license)
Sortie
Free (MIT license)
Contexte
256K tokens
P

Palmyra X6

Writer

Conditionnel

Palmyra X6 est le modèle phare agentique de Writer pour les workflows marketing et de revenus — post-entraîné sur le GLM-5.2 de Z.ai (poids ouverts), à $2/$8 par 1M de tokens, une fraction du tarif des modèles de pointe. Chaque chiffre clé provient de Writer, et la provenance GLM-5.2 soulève une vraie question d'approvisionnement. Adoptez-le au sein de Writer pour le travail d'agents GTM sensible au coût ; cherchez ailleurs pour une capacité générale benchmarkée de façon indépendante.

Entrée
$2 / 1M
Sortie
$8 / 1M
Contexte
1M context, 8K max output
Q

Qwen3.8-27B

Alibaba

Conditionnel

Qwen3.8-27B est le modèle open-weight à 27 milliards de paramètres d'Alibaba, désormais disponible sous licence Apache 2.0 avec 262K de contexte natif et un déploiement sur une seule GPU. C'est le compagnon auto-hébergeable du flagship Qwen3.8-Max à 2,4T. Les benchmarks restent des chiffres d'Alibaba, d'où le verdict 'conditional' : un modèle réel et exécutable dont les gains de codage revendiqués par le fournisseur attendent encore une reproduction indépendante.

Entrée
Free (open weights — self-hosted)
Sortie
Free (open weights — self-hosted)
Contexte
TBD — context window not published
Q

Qwen3.8-Max

Alibaba

pending

Flagship multimodal MoE 2,4T paramètres. Pas encore GA — aucun tarif par token pour l'API, aucun tableau de benchmarks, aucun poids ouvert publié. Entrée à 6 $/mois via Token Plan Lite.

Entrée
$2.00 / 1M tokens
Sortie
$6.00 / 1M tokens
Contexte
984K tokens. Open weights promised week of Aug 10.
S

Sakana Fugu

Sakana AI

Conditionnel

Orchestrateur multi-agents qui égale les modèles de pointe sur les principaux benchmarks en routant à travers un pool d'agents experts — mais le routage opaque et la dépendance à la plateforme limitent la transparence.

Entrée
$5 / 1M tokens
Sortie
$30 / 1M tokens
Contexte
272K tokens (>272K: $10/$45 per 1M)