Modèles d’IA
46Trouvez le bon modèle pour votre tâche. Filtrez par point fort, comparez les tarifs et décidez.
Filtrer par fournisseur
Astra
OpenAI
Astra is OpenAI's first model to trigger the 'Critical' cybersecurity threshold under its Preparedness Framework — internal evaluations found it may autonomously exploit zero-day vulnerabilities and solved 10 open math problems for ~$2,000. But Astra is not a shipping product: development is actively paused as of August 2026 for security hardening, with no release timeline or pricing. Watch for the safety-governance outcome — this is the first time a major lab has publicly classified its own model as critically dangerous.
- Entrée
- Not yet published
- Sortie
- Not yet published
- Contexte
- Development slowed Aug 2026. No GA date.
Claude Fable 5
Anthropic
Le modèle frontière de classe Mythos d'Anthropic — le Claude le plus puissant jamais rendu public, en tête de tous les grands benchmarks à son lancement. Le verdict reste CONDITIONNEL en raison de deux contraintes actuelles : une tarification uniquement à crédits de $10/$50 par 1M tokens sans option d'abonnement, et un classificateur de sécurité qui se déclenche trop souvent sur des tâches de codage courantes, les redirigeant silencieusement vers un repli sur Opus 4.8. Optez pour Fable 5 lorsque le gain de capacité justifie le coût ; pour le travail courant, Sonnet 5 est l'alternative la plus prévisible.
- Entrée
- $10 / 1M tokens
- Sortie
- $50 / 1M tokens
- Contexte
- 1M context, 128K max output
Claude Haiku 4.5
Anthropic
La référence rapport qualité-prix d'Anthropic à $1/$5 par 1M tokens — le palier rapide et économique auquel les concurrents se comparent, avec un contexte de 200K et une sortie de 64K. Idéal pour les charges à fort volume sensibles à la latence : classification, extraction, résumé, routage. Passez à Opus 4.8 ou Sonnet 5 lorsqu'un raisonnement profond en plusieurs étapes est nécessaire.
- Entrée
- $1 / 1M tokens
- Sortie
- $5 / 1M tokens
- Contexte
- 200K tokens
Claude Opus 4.8
Anthropic
Le modèle de raisonnement phare d'Anthropic et le titulaire pratique de la frontière en capacité déployable — contexte de 1M tokens à $5/$25 par 1M tokens, inclus dans tous les plans d'abonnement. Notre choix pour le travail axé sur la revue : revue de code, refactoring sous contraintes et tâches à rythme délibéré. Un codage agentique solide, un raisonnement analytique de premier ordre et un accès stable par abonnement en font le modèle phare par défaut pour la plupart des équipes de production.
- Entrée
- $5 / 1M tokens
- Sortie
- $25 / 1M tokens
- Contexte
- 1M tokens
Claude Opus 5
Anthropic
Intelligence proche de Fable 5 à moitié prix (5 $/25 $ par 1M). SOTA sur Frontier-Bench et CursorBench.
- Entrée
- $5.00 / 1M tokens
- Sortie
- $25.00 / 1M tokens
- Contexte
- 200K tokens
Claude Sonnet 4.6
Anthropic
Supplanté par Claude Sonnet 5 (sorti le 30 juin 2026) comme cheval de bataille par défaut du segment intermédiaire. La tarification $3/$15 de Sonnet 4.6 et son contexte de 1M tokens sont désormais égalés par un successeur affichant un bond de 13,4 points sur Terminal-Bench 2.1 à la même grille tarifaire. Ne choisissez 4.6 que pour des déploiements figés ou lorsque le nombre de tokens ~30% plus élevé de Sonnet 5 et la suppression de temperature/top_p/top_k sont rédhibitoires.
- Entrée
- $3 / 1M tokens
- Sortie
- $15 / 1M tokens
- Contexte
- 1M tokens
Claude Sonnet 5
Anthropic
Le Sonnet le plus agentique d'Anthropic offre des performances proches d'Opus 4.8 pour environ la moitié du prix, avec +13,4 points sur Terminal-Bench 2.1 par rapport à Sonnet 4.6. Le nouveau tokenizer gonfle les décomptes d'environ 30%, si bien que la tarification de lancement ($2/$10 par MTok jusqu'au 31 août) rend la migration neutre en coût, mais les équipes devraient recalculer leurs budgets avant de basculer. Il remplace Sonnet 4.6 comme modèle par défaut sur tous les plans Claude, idéal pour le codage agentique, le débogage de code existant et les pipelines de production — pas pour les raisonnements frontière les plus difficiles ni les tâches de cybersécurité.
- Entrée
- $3 / 1M
- Sortie
- $15 / 1M
- Contexte
- 1M tokens
DeepSeek V4 Flash
DeepSeek
Modèle de volume à 284B paramètres (13B actifs en MoE). SWE-bench 79,0 % à 0,14 $/0,28 $ par 1M tokens.
- Entrée
- $0.14 / 1M tokens
- Sortie
- $0.28 / 1M tokens
- Contexte
- 1M tokens
DeepSeek V4 Pro
DeepSeek
Le modèle de codage open-weight le plus performant que nous ayons testé. 99,2 % sur SWE-bench Verified.
- Entrée
- $0.435 / 1M tokens
- Sortie
- $0.87 / 1M tokens
- Contexte
- 1M tokens
FLUX 3
Black Forest Labs
Modèle de fondation multimodal unifié pour la prédiction d'image, vidéo, audio et action.
- Entrée
- Not yet published
- Sortie
- Not yet published
- Contexte
- Gated early access
GLM-5.2
Z.ai
Meilleur modèle de codage open weight avec un contexte de 1M tokens et licence MIT — bat GPT-5.5 sur plusieurs benchmarks pour une fraction du coût, mais reste derrière Claude Opus 4.8 sur les tâches à horizon long les plus difficiles.
- Entrée
- $1.40 / 1M tokens
- Sortie
- $4.40 / 1M tokens
- Contexte
- 1M tokens
GPT-4.1
OpenAI
La cible de migration par défaut pour les workloads GPT-4 Turbo : même format de requête, coût inférieur, contexte de 1M tokens — convertissez les payloads function_call hérités au format tools et passez à la suite.
- Entrée
- $2 / 1M tokens
- Sortie
- $8 / 1M tokens
- Contexte
- 1M tokens
GPT-4o (Retired from ChatGPT, API-only)
OpenAI
GPT-4o (May 2024) has been superseded by the GPT-5.x family and delisted from OpenAI's flagship API pricing page. It remains available through the API but is no longer a current-generation model. Use only where migration to GPT-5.x is blocked; otherwise, GPT-5.5 or GPT-5.4 offer better performance at comparable cost.
- Entrée
- $2.50 / 1M tokens
- Sortie
- $10 / 1M tokens
- Contexte
- 128K tokens
GPT-5.5
OpenAI
Le modèle frontière commercial généraliste d'OpenAI et le point d'ancrage OpenAI déployable tant que la famille GPT-5.6 reste sous restriction gouvernementale — $5/$30 par 1M tokens avec un contexte de 1M+. Un raisonnement solide, un large écosystème d'outils et une disponibilité publique complète en font un choix par défaut fiable en production, même si des modèles moins chers l'égalent désormais sur certaines tâches. Pour la plupart des équipes, il reste la référence à laquelle les nouveaux modèles sont comparés.
- Entrée
- $5 / 1M tokens
- Sortie
- $30 / 1M tokens
- Contexte
- 1M+ tokens (922K in / 128K out)
GPT-5.5-Cyber
OpenAI
85,6 % CyberGym — meilleur score mono-modèle — mais accès restreint aux défenseurs habilités uniquement.
- Entrée
- N/A
- Sortie
- N/A
- Contexte
- Trusted Access for Cyber; not commercial API
GPT-5.6 Luna
OpenAI
GPT-5.6 Luna is OpenAI's budget tier — near-GPT-5.5 capability at $1/$6 per 1M tokens, the strongest capability-per-dollar value in the GPT-5.6 family. Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported, Luna lacks activation classifiers, and it is not in the standard ChatGPT picker.
- Entrée
- $0.20 / 1M tokens
- Sortie
- $1.20 / 1M tokens
- Contexte
- Fastest tier. 80% cut Jul 30 → $0.20/$1.20.
GPT-5.6 Sol
OpenAI
GPT-5.6 Sol est le modèle frontière le plus rentable, en tête des benchmarks de codage et compétitif sur les raisonnements difficiles pour une fraction du coût de ses pairs. Verdict renforcé par la divulgation du durcissement de sécurité GPT-Red — le modèle a été entraîné de manière adversariale contre un modèle de red teaming dédié en self-play RL à l'échelle frontière, le rendant 6x plus robuste aux injections de prompt.
- Entrée
- $5 / 1M tokens
- Sortie
- $30 / 1M tokens
- Contexte
- Same $5/$30. Fast mode: 2.5× at 2× cost.
GPT-5.6 Terra
OpenAI
GPT-5.6 Terra is OpenAI's mid-tier workhorse — GPT-5.5-class capability at half the cost ($2.50/$15 per 1M tokens). Now generally available via API and Codex after the July 9 government-gate lift. Remains conditional: all benchmarks are vendor-reported without independent reproduction, and Terra is not selectable in the standard ChatGPT model picker.
- Entrée
- $2.00 / 1M tokens
- Sortie
- $12.00 / 1M tokens
- Contexte
- Mid-tier. 20% cut Jul 30 → $2.00/$12.00.
GPT-Live-1
OpenAI
Le premier modèle vocal full-duplex d'OpenAI — il écoute et parle simultanément, un saut au-delà du mode Advanced Voice en alternance.
- Entrée
- ChatGPT subscription
- Sortie
- ChatGPT subscription
- Contexte
- ChatGPT Voice only
GPT-Live-1 mini
OpenAI
La variante gratuite de GPT-Live-1 — même architecture duplex intégral dans un package plus petit et plus rapide.
- Entrée
- Free (ChatGPT)
- Sortie
- Free (ChatGPT)
- Contexte
- ChatGPT Voice only
GPT-Live-Transcribe
OpenAI
Le modèle parole-texte en streaming à faible latence d'OpenAI délivre des deltas de transcription en direct à 0,017 $/min avec une latence ajustable et une transcription contextuelle.
- Entrée
- $0.017 / minute
- Sortie
- N/A
- Contexte
- Per-minute realtime audio billing
GPT-Transcribe
OpenAI
Speech-to-text par lot : 3,31 % AA-WER à 0,0045 $/min. 25 % moins cher que son prédécesseur.
- Entrée
- $0.0045 / minute
- Sortie
- N/A
- Contexte
- Per-minute audio billing
Gemini 2.5 Pro
Désormais le choix économique pour le contexte long : une baisse de prix de 40 % (juin 2026) a rendu les traitements complets de corpus accessibles aux budgets moyens — la plus grande fenêtre de contexte disponible avec une intégration solide dans l'écosystème Google.
- Entrée
- $1.25 / 1M tokens
- Sortie
- $10 / 1M tokens
- Contexte
- 1M tokens
Gemini 3.1 Pro
Le modèle Pro le plus performant de Google accessible au public, avec un contexte d'un million de tokens à un tarif compétitif. Génération précédente : Gemini 3.6 et 3.5 Flash le surpassent désormais en codage et en benchmarks agentiques à moindre coût. Restez-y si vous êtes dans l'écosystème Google Cloud/Vertex AI ; sinon, la gamme Flash ou les concurrents offrent davantage.
- Entrée
- $2 / 1M
- Sortie
- $12 / 1M
- Contexte
- 1M tokens
Gemini 3.5 Flash
La référence de Google en efficacité-coût pour l'automatisation agentique du poste de travail, à $1.50/$9 par 1M tokens avec un contexte d'environ 1M. Le Computer Use natif obtient 78,4 sur OSWorld-Verified — à 0,3 point de GPT-5.5 pour environ un tiers du coût. LA réserve à connaître : l'outil Computer Use est en préversion publique, pas encore dans l'API de production ; vérifiez la disponibilité de l'endpoint avant de l'intégrer.
- Entrée
- $1.50 / 1M tokens
- Sortie
- $9 / 1M tokens
- Contexte
- 1M tokens
Gemini 3.5 Flash Cyber
Gemini 3.5 Flash Cyber est le premier modèle spécialisé en cybersécurité de Google, fine-tuné à partir de 3.5 Flash pour trouver, valider et corriger des vulnérabilités. Au sein de l'architecture multi-agent de CodeMender, il atteint des performances compétitives sur CyberGym face à des modèles bien plus gros comme Mythos, pour une fraction du coût. Mais les restrictions sont sévères : il fonctionne exclusivement dans CodeMender, disponible uniquement pour les gouvernements et partenaires de confiance via un pilote à accès limité, sans API publique, sans chiffres de benchmark publiés et sans calendrier pour une diffusion plus large.
- Entrée
- N/A
- Sortie
- N/A
- Contexte
- CodeMender-only, government-gated pilot
Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite est le modèle le plus rapide et le moins cher de la série 3.5 de Google, à 350 tok/s et 0,30 $/2,50 $. Le saut générationnel par rapport à 3.1 Flash-Lite est le véritable sujet — il surpasse nettement son prédécesseur sur les principaux benchmarks agentiques et bat le modèle Gemini 3 Flash pleine taille sur les tâches de codage et de computer-use. Pour les développeurs qui font tourner à grande échelle des sous-agents agentiques, des pipelines de recherche et du traitement de documents, le rapport prix-performance de Flash-Lite est inégalé dans la gamme Google.
- Entrée
- $0.30 / 1M
- Sortie
- $2.50 / 1M
- Contexte
- 1M context, 64K output, 350 tok/s
Gemini 3.5 Pro
Le modèle frontière pré-GA de Google — désormais à son quatrième report et « des mois de retard » selon Bloomberg. Le contexte de 2M tokens, le pipeline multimodal natif et le raisonnement Deep Think restent des capacités réelles, mais aucun calendrier de disponibilité générale confirmé n'existe. La capacité de codage est la lacune principale.
- Entrée
- Not yet published
- Sortie
- Not yet published
- Contexte
- Est. $5-15/$30-60 per 1M. 2M ctx. Not GA.
Gemini 3.6 Flash
Meilleur et moins cher que 3.5 Flash sur tous les benchmarks. Prix de sortie réduit de 9,00 $ à 7,50 $ par 1M tokens.
- Entrée
- $1.50 / 1M
- Sortie
- $7.50 / 1M
- Contexte
- 1M context, 64K output
Gemini 4
Gemini 4 is Google DeepMind's confirmed next-generation frontier model — pre-training began July 21, 2026 on what Google calls its 'most ambitious' run yet. Sundar Pichai has positioned it as the answer to coding and agentic gaps, targeting where the frontier will be at launch, not where it sits today. But everything else is unknown: no benchmarks, no pricing, no specs, no GA release date, and the delayed Gemini 3.5 Pro's relationship to it remains unresolved. Watchlist-only until Google ships something concrete.
- Entrée
- Not yet published
- Sortie
- Not yet published
- Contexte
- Pre-training started Jul 2026. No GA date.
Grok 4.5
SpaceXAI
Modèle de coding/agentique à prix compétitif à 2 $/6 $ par 1M tokens avec un contexte de 500K — les benchmarks publiés par xAI le placent en milieu de peloton derrière Fable 5 et GPT-5.5, bien qu'il devance Opus 4.8 sur DeepSWE et Terminal-Bench 2.1. La véritable histoire est l'efficacité coût : 4,2× plus efficient en tokens qu'Opus 4.8 sur SWE-Bench Pro. Idéal pour les équipes ayant besoin de coding performant à une fraction des tarifs frontaliers. Pas encore disponible dans l'UE.
- Entrée
- $2 / 1M tokens
- Sortie
- $6 / 1M tokens
- Contexte
- 500K tokens
Grok 4.6
SpaceXAI
Le modèle de nouvelle génération à 2 000 milliards de paramètres de SpaceXAI, dont l'entraînement s'est achevé le 21 juillet 2026, avec un lancement public prévu le 7 août. Il passe de 1 500 milliards (Grok 4.5) à environ 2 000 milliards de paramètres et vise à égaler ou dépasser la capacité de Kimi K3 tout en conservant l'efficacité en tokens caractéristique de Grok et une vitesse d'environ 80 TPS. Positionné comme un modèle de coding et agentic de classe Opus entraîné avec les données Cursor, il sera disponible dans Cursor, Grok Build et l'API à un tarif estimé d'environ 2 $/6 $ par million de tokens. Pré-GA : aucun benchmark indépendant n'existe encore ; l'évaluation est provisoire tant que le modèle n'est pas livré et que des tests tiers ne valident pas les affirmations.
- Entrée
- $2.00 / 1M tokens
- Sortie
- $6.00 / 1M tokens
- Contexte
- 500K tokens (expected, based on Grok 4.5)
Grok Voice Think Fast 2.0
SpaceXAI
Le modèle speech-to-speech de nouvelle génération de SpaceXAI, doté d'une architecture de raisonnement parallèle qui le rend nettement plus intelligent que les modèles vocaux conventionnels.
- Entrée
- $0.08 / min of audio (speech-to-speech)
- Sortie
- Included in speech-to-speech rate
- Contexte
- API-only
Hy3
Tencent
Modèle agentique MoE à poids ouverts sous licence Apache 2.0 (295B total, 21B actifs) avec une fiabilité solide en appel d'outils et un bon comportement anti-hallucination, mais le codage est en retrait par rapport à GLM-5.2 et l'auto-hébergement exige 8 GPU ou plus. Niveau gratuit sur OpenRouter jusqu'au 21 juillet — ensuite 0,20 $/0,80 $ par million de tokens. Idéal pour les agents de codage auto-hébergés et le travail documentaire longue durée où la licence permissive prime sur les scores absolus de benchmarks.
- Entrée
- $0.20 / 1M
- Sortie
- $0.80 / 1M
- Contexte
- 256K tokens
Inkling
Thinking Machines Lab
Inkling est la meilleure raison à ce jour de prendre l'IA multimodale à poids ouverts au sérieux. Il offre un raisonnement et un codage compétitifs avec la meilleure sécurité open-weight du marché et un effort de réflexion contrôlable, le tout sous licence Apache 2.0. Mais Thinking Machines est honnête : ce n'est pas le plus puissant dans l'absolu — la factualité est en retrait (SimpleQA 43,9 %) et l'auto-hébergement exige du matériel conséquent (2 To de VRAM). Conditional : une base convaincante pour les organisations qui ont besoin de posséder et de fine-tuner un modèle multimodal, pas pour les équipes qui recherchent les performances maximales prêtes à l'emploi.
- Entrée
- $1.87 / 1M tokens
- Sortie
- $4.68 / 1M tokens
- Contexte
- Up to 1M tokens native
Kimi K3
Moonshot AI
Modèle performant désormais sous enquête active de la Maison Blanche pour vol de propriété intellectuelle à l'échelle industrielle. Le Trésor américain menace de sanctions — le risque juridique et opérationnel est matériel. Les benchmarks techniques sont inchangés.
- Entrée
- $3.00 / 1M
- Sortie
- $15.00 / 1M
- Contexte
- 1M ctx, $0.30 cached. Weights live (Jul 27).
Laguna S 2.1
poolside
Laguna S 2.1 est le premier modèle de coding open-weight occidental crédible en 11 mois — un MoE de 118B qui n'active que 8B de paramètres par token tout en obtenant 70,2 % sur Terminal-Bench 2.1, battant des modèles 10 fois sa taille. Mais il n'est pas au niveau frontière — GPT-5.6 Sol et Kimi K3 sont loin devant — et les limitations connues incluent le surapprentissage de harnais et la déformation JSON. Idéal pour le coding agentique auto-hébergé lorsque la souveraineté des données prime sur le leadership absolu des benchmarks.
- Entrée
- $0.10 / 1M
- Sortie
- $0.20 / 1M
- Contexte
- OpenMDW-1.1 license, 1M context
Llama 4 Maverick
Meta
Le modèle open source de référence pour les équipes qui ont besoin d'auto-hébergement, de souveraineté des données, ou qui cherchent à éviter l'enfermement propriétaire des API.
- Entrée
- Free (self-hosted) or $0.20 / 1M tokens (hosted)
- Sortie
- Free (self-hosted) or $0.60 / 1M tokens (hosted)
- Contexte
- 10M tokens
MAI-Code-1-Flash
Microsoft
Le premier modèle de codage maison de Microsoft — un MoE sparse petit, rapide et agressivement optimisé en coût à $0,75/$4,50 par 1M tokens. Il offre une avance de 16 points sur Claude Haiku 4.5 sur SWE-Bench Pro tout en utilisant jusqu'à 60% de tokens en moins. Il est conçu spécifiquement pour les workflows Copilot à haut volume — auto-complétions, refactorisations, échafaudages — ce n'est pas un modèle frontière. Meilleur au sein de l'écosystème Copilot ; l'accès API en dehors est encore en déploiement.
- Entrée
- $0.75 / 1M tokens
- Sortie
- $4.50 / 1M tokens
- Contexte
- 256K context
MAI-Cyber-1-Flash
Microsoft
Le premier modèle de cybersécurité interne de Microsoft, construit sur la famille MAI-Thinking-1 et intégré au sein du système multi-agent MDASH. MAI-Cyber-1-Flash traite environ 90 % des charges de travail de sécurité à environ la moitié du coût des configurations antérieures, réservant GPT-5.4 aux 10 % les plus difficiles. Il obtient 95,95 % sur CyberGym — 12 points au-dessus de Mythos 5 — mais il s'agit d'un benchmark rapporté par le fournisseur provenant d'une configuration système complète optimisée (harness + deux modèles), pas d'un test indépendant modèle contre modèle. Disponible uniquement via Azure AI Foundry avec un accès entreprise validé ; pas de tarification autonome ni d'API publique.
- Entrée
- N/A (MDASH SCU consumption)
- Sortie
- N/A (MDASH SCU consumption)
- Contexte
- Azure AI Foundry vetted access
Muse Spark 1.1
Meta
Le premier modèle d'IA payant de Meta et sa première salve sur le marché du coding commercial — 1,25 $/4,25 $ par 1M tokens avec 1M de contexte, orchestration native de sous-agents, support MCP/outils et capacité computer-use à environ 4× sous les tarifs d'Anthropic/OpenAI. Domine les benchmarks d'utilisation d'outils mais accuse un retard de 7 points sur Opus 4.8 en coding pur sur SWE-Bench Pro. Poids fermés, préversion publique réservée aux États-Unis. Idéal pour les équipes privilégiant l'orchestration d'outils à bas coût.
- Entrée
- $1.25 / 1M tokens
- Sortie
- $4.25 / 1M tokens
- Contexte
- 1M tokens
Muse Spark 1.2
Meta
Meta's coding-focused model update, co-trained with the Muse Code harness — 82.9% on Terminal-Bench 2.1 and 59.3% on DeepSWE 1.1, second only to Claude Opus 5 on the former and trailing both Opus 5 and GPT-5.6 Terra on the latter. Standard pricing unchanged from 1.1 at $1.25 input / $4.25 output per 1M tokens; contributor tier drops to $0.10/$0.20 in exchange for training-data rights. All published benchmarks remain vendor-run with no independent reproduction. Best for cost-sensitive coding teams willing to test a model explicitly optimized for its own harness.
- Entrée
- $1.25 / 1M tokens
- Sortie
- $4.25 / 1M tokens
- Contexte
- 1M tokens
Mythos 5 (Claude Mythos 5)
Anthropic
Le modèle de cybersécurité le plus puissant au monde (83,8% CyberGym) — construit sur les poids de Fable 5 avec les classificateurs de sécurité retirés. L'accès a été suspendu après la directive d'exportation du 12 juin ; partiellement restauré le 26 juin pour ~100 organisations américaines désignées d'infrastructure critique (Project Glasswing). Le verdict reste CONDITIONNEL : la capacité est d'élite, mais l'accès est verrouillé par désignation fédérale. Pas une API publique — utilisable uniquement si votre organisation figure sur la liste du Département du Commerce.
- Entrée
- $10 / 1M tokens
- Sortie
- $50 / 1M tokens
- Contexte
- 1M tokens (restricted access)
Ornith-1.0
DeepReinforce
Une famille de modèles open source agentic coding sous licence MIT qui atteint des benchmarks compétitifs avec les modèles frontier — battant Claude Opus 4.7 à la fois sur Terminal-Bench 2.1 et SWE-Bench Verified — mais qui nécessite un autohébergement avec des ressources GPU significatives et provient d'un nouveau labo au track record limité.
- Entrée
- Free (MIT license)
- Sortie
- Free (MIT license)
- Contexte
- 256K tokens
Qwen3.8-Max
Alibaba
Qwen3.8-Max is Alibaba's 2.4-trillion-parameter flagship, previewed July 2026 as a multimodal MoE model with a 984K context window. It is not yet GA — no per-token API pricing, no benchmark table, no open weights, and no model card have been published, and the "second only to Fable 5" claim is Alibaba's own unverified self-assessment. The preview is worth testing for coding and long-context agent workloads at $6/month entry cost, but wait for published benchmarks, per-token pricing, and the promised open-weight release before committing.
- Entrée
- Credit-based only
- Sortie
- Credit-based only
- Contexte
- 984K tokens
Sakana Fugu
Sakana AI
Orchestrateur multi-agents qui égale les modèles de pointe sur les principaux benchmarks en routant à travers un pool d'agents experts — mais le routage opaque et la dépendance à la plateforme limitent la transparence.
- Entrée
- $5 / 1M tokens
- Sortie
- $30 / 1M tokens
- Contexte
- 272K tokens (>272K: $10/$45 per 1M)