Inkling
Thinking Machines Lab · Sorti juil. 2026
Inkling est la meilleure raison à ce jour de prendre au sérieux l'IA multimodale à poids ouverts. Il offre un raisonnement et un codage compétitifs avec une sécurité à poids ouverts de premier ordre et un effort de réflexion contrôlable, le tout sous licence Apache 2.0. Mais Thinking Machines est honnête : ce n'est pas le plus puissant globalement — la factualité est en retrait (SimpleQA 43,9 %) et l'auto-hébergement exige du matériel sérieux (2 To de VRAM). Conditionnel : une base convaincante pour les organisations qui ont besoin de posséder et de fine-tuner un modèle multimodal, pas pour les équipes qui cherchent des performances maximales prêtes à l'emploi.
Est-ce fait pour vous ?
Recommandé pour
- Base multimodale open-weight (Apache 2.0) — poids complets téléchargeables, modifiables et déployables sur votre propre infrastructure
- Déploiements axés sur la sécurité — meilleurs scores FORTRESS open-weight (78,0% adversarial, 95,9% refus bénin)
- Raisonnement économe en tokens via un effort de réflexion contrôlable — utilise 1/3 des tokens de Nemotron 3 Ultra pour une performance Terminal Bench équivalente
- Fine-tuning spécifique au domaine sur Tinker — gain prouvé en raisonnement financier avec Bridgewater Associates
- Entrée multimodale native (texte, image, audio) — rare parmi les modèles open-weight à ce niveau de capacité
Déconseillé pour
- Tâches de factualité pure et de rappel de connaissances — SimpleQA Verified seulement 43,9%, loin derrière les modèles fermés à 70%+
- Auto-hébergement à budget contraint — le checkpoint BF16 nécessite environ 2 To de VRAM agrégée (8x B300 ou 16x H200)
- Performance maximale brute en codage — SWE-bench Pro 54,3% et Terminal Bench 63,8% derrière la frontière fermée
Performances par tâche
Génération de code
Solide SWE-bench Verified 77,6%, compétitif avec les leaders open-weight ; derrière la frontière fermée sur les dépôts plus difficiles
Raisonnement
AIME 2026 97,1% est quasi saturé ; HLE 29,7% montre les limites sur le raisonnement le plus dur vs 53%+ des leaders fermés
Compréhension multimodale
Vision solide (MMMU Pro 73,5%, Charxiv 82%) avec entrée audio native rare ; limité à la sortie texte
Utilisation d'outils agentiques
MCP Atlas 74,1% et BrowseComp 77,1% montrent un comportement agentique capable à travers divers écosystèmes d'outils
Sécurité et refus
Meilleur de sa catégorie parmi les open-weight sur FORTRESS ; incertitude calibrée plutôt qu'hallucination sur les requêtes ambiguës
Factualité
SimpleQA 43,9% est une faiblesse claire vs les modèles fermés à 70%+ ; la fiabilité factuelle nécessite du fine-tuning
Tarifs
Entrée
$1.87 / 1M tokens
Sortie
$4.68 / 1M tokens
Contexte
Up to 1M tokens native
Tests de performance
Aucun changement de verdict pour l’instant
L’horloge tourne dès le premier jour : les changements apparaîtront ici à mesure que notre verdict évolue.
Sources
- Tinker Models & Pricing documentationjuil. 2026
- TechCrunch — Thinking Machines amps up its bet against one-size-fits-all AIjuil. 2026
- BenchLM — Thinking Machines Chose Open Weights Firstjuil. 2026
- Thinking Machines Lab — Introducing Inkling (official)juil. 2026
- WIRED — Thinking Machines Lab Drops Its First Modeljuil. 2026
Journal de vérification
- Tarifs— Aucun changement
Agent automatisé