I

Inkling

Thinking Machines Lab · Sorti juil. 2026

Conditionnel

Inkling est la meilleure raison à ce jour de prendre l'IA multimodale open-weight au sérieux. Il offre un raisonnement et un codage compétitifs avec une sécurité open-weight de premier ordre et un effort de réflexion contrôlable, le tout sous licence Apache 2.0. Mais Thinking Machines est honnête : ce n'est pas le plus performant dans l'absolu — la factualité est en retrait (SimpleQA 43,9 %) et l'auto-hébergement exige du matériel sérieux (2 To de VRAM). Conditionnel : une base convaincante pour les organisations qui ont besoin de posséder et de fine-tuner un modèle multimodal, pas pour les équipes qui veulent la performance maximale sur étagère.

Est-ce fait pour vous ?

Recommandé pour

  • Base multimodale open-weight (Apache 2.0) — poids complets téléchargeables, modifiables et déployables sur votre propre infrastructure
  • Déploiements soucieux de la sécurité — meilleurs scores FORTRESS open-weight (78,0 % adversaire, 95,9 % refus bénin)
  • Raisonnement efficace en jetons via effort de réflexion contrôlable — utilise 1/3 des jetons de Nemotron 3 Ultra pour une performance Terminal Bench égale
  • Fine-tuning spécifique au domaine sur Tinker — gain prouvé en raisonnement financier avec Bridgewater Associates
  • Entrée multimodale native (texte, image, audio) — rare parmi les modèles open-weight à ce niveau de capacité

Déconseillé pour

  • Tâches de factualité pure et de rappel de connaissances — SimpleQA Verified seulement 43,9 %, loin derrière les modèles fermés à 70 %+
  • Auto-hébergement avec contrainte budgétaire — le checkpoint BF16 nécessite environ 2 To de VRAM agrégée (8x B300 ou 16x H200)
  • Performance maximale brute en codage dans les classements — SWE-bench Pro 54,3 % et Terminal Bench 63,8 % sont en retrait de la frontière fermée

Performances par tâche

Génération de code

Very Good

Solide SWE-bench Verified 77,6 %, compétitif avec les leaders open-weight ; en retrait de la frontière fermée sur les dépôts plus difficiles

Raisonnement

Very Good

AIME 2026 97,1 % est quasi saturé ; HLE 29,7 % montre des limites sur le raisonnement le plus dur vs 53 %+ des leaders fermés

Compréhension multimodale

Very Good

Vision forte (MMMU Pro 73,5 %, Charxiv 82 %) avec entrée audio native rare ; limité à la sortie texte

Utilisation agentique d'outils

Very Good

MCP Atlas 74,1 % et BrowseComp 77,1 % montrent un comportement agentique compétent à travers divers écosystèmes d'outils

Sécurité et refus

Excellent

Meilleur de sa catégorie parmi les open-weight sur FORTRESS ; incertitude calibrée plutôt qu'hallucination sur les requêtes ambiguës

Factualité

Fair

SimpleQA 43,9 % est une faiblesse clé vs modèles fermés à 70 %+ ; la fiabilité factuelle nécessite du fine-tuning

Tarifs

Entrée

$1.87 / 1M tokens

Sortie

$4.68 / 1M tokens

Contexte

Up to 1M tokens native

Voir tous les tarifs

Tests de performance

TestScoreSource
SWE-bench Verified77.6% Source
AIME 202697.1% Source
GPQA Diamond87.2% Source
HLE (text only)29.7% Source
Terminal Bench 2.163.8% Source
MCP Atlas74.1% Source
MMMU Pro (Standard 10)73.5% Source
IFBench79.8% Source
SimpleQA Verified43.9% Source

Aucun changement de verdict pour l’instant

L’horloge tourne dès le premier jour : les changements apparaîtront ici à mesure que notre verdict évolue.

Journal de vérification

  • Tarifs— Aucun changement

    Agent automatisé

  • Tarifs— Aucun changement

    Agent automatisé

Comment nous évaluons