I

Inkling

Thinking Machines Lab · Sorti juil. 2026

Conditionnel

Inkling est la meilleure raison à ce jour de prendre au sérieux l'IA multimodale à poids ouverts. Il offre un raisonnement et un codage compétitifs avec une sécurité à poids ouverts de premier ordre et un effort de réflexion contrôlable, le tout sous licence Apache 2.0. Mais Thinking Machines est honnête : ce n'est pas le plus puissant globalement — la factualité est en retrait (SimpleQA 43,9 %) et l'auto-hébergement exige du matériel sérieux (2 To de VRAM). Conditionnel : une base convaincante pour les organisations qui ont besoin de posséder et de fine-tuner un modèle multimodal, pas pour les équipes qui cherchent des performances maximales prêtes à l'emploi.

Est-ce fait pour vous ?

Recommandé pour

  • Base multimodale open-weight (Apache 2.0) — poids complets téléchargeables, modifiables et déployables sur votre propre infrastructure
  • Déploiements axés sur la sécurité — meilleurs scores FORTRESS open-weight (78,0% adversarial, 95,9% refus bénin)
  • Raisonnement économe en tokens via un effort de réflexion contrôlable — utilise 1/3 des tokens de Nemotron 3 Ultra pour une performance Terminal Bench équivalente
  • Fine-tuning spécifique au domaine sur Tinker — gain prouvé en raisonnement financier avec Bridgewater Associates
  • Entrée multimodale native (texte, image, audio) — rare parmi les modèles open-weight à ce niveau de capacité

Déconseillé pour

  • Tâches de factualité pure et de rappel de connaissances — SimpleQA Verified seulement 43,9%, loin derrière les modèles fermés à 70%+
  • Auto-hébergement à budget contraint — le checkpoint BF16 nécessite environ 2 To de VRAM agrégée (8x B300 ou 16x H200)
  • Performance maximale brute en codage — SWE-bench Pro 54,3% et Terminal Bench 63,8% derrière la frontière fermée

Performances par tâche

Génération de code

Very Good

Solide SWE-bench Verified 77,6%, compétitif avec les leaders open-weight ; derrière la frontière fermée sur les dépôts plus difficiles

Raisonnement

Very Good

AIME 2026 97,1% est quasi saturé ; HLE 29,7% montre les limites sur le raisonnement le plus dur vs 53%+ des leaders fermés

Compréhension multimodale

Very Good

Vision solide (MMMU Pro 73,5%, Charxiv 82%) avec entrée audio native rare ; limité à la sortie texte

Utilisation d'outils agentiques

Very Good

MCP Atlas 74,1% et BrowseComp 77,1% montrent un comportement agentique capable à travers divers écosystèmes d'outils

Sécurité et refus

Excellent

Meilleur de sa catégorie parmi les open-weight sur FORTRESS ; incertitude calibrée plutôt qu'hallucination sur les requêtes ambiguës

Factualité

Fair

SimpleQA 43,9% est une faiblesse claire vs les modèles fermés à 70%+ ; la fiabilité factuelle nécessite du fine-tuning

Tarifs

Entrée

$1.87 / 1M tokens

Sortie

$4.68 / 1M tokens

Contexte

Up to 1M tokens native

Voir tous les tarifs

Tests de performance

TestScoreSource
SWE-bench Verified77.6% Source
AIME 202697.1% Source
GPQA Diamond87.2% Source
HLE (text only)29.7% Source
Terminal Bench 2.163.8% Source
MCP Atlas74.1% Source
MMMU Pro (Standard 10)73.5% Source
IFBench79.8% Source
SimpleQA Verified43.9% Source

Aucun changement de verdict pour l’instant

L’horloge tourne dès le premier jour : les changements apparaîtront ici à mesure que notre verdict évolue.

Journal de vérification

  • Tarifs— Aucun changement

    Agent automatisé

Comment nous évaluons