I

Inkling

Thinking Machines Lab · Veröffentlicht Juli 2026

Bedingt

Inkling ist das bisher staerkste Argument, multimodale Open-Weight-KI ernst zu nehmen. Es liefert wettbewerbsfaehiges Reasoning und Coding mit branchenfuehrender Open-Weight-Sicherheit und steuerbarem Denkaufwand, alles unter Apache 2.0. Doch Thinking Machines ist ehrlich: Es ist nicht das staerkste Modell insgesamt -- die Faktenqualitaet haengt zurueck (SimpleQA 43,9 %) und Self-Hosting erfordert ernsthafte Hardware (2 TB VRAM). Conditional: eine ueberzeugende Basis fuer Organisationen, die ein multimodales Modell besitzen und fine-tunen muessen, nicht fuer Teams, die maximale Out-of-the-Box-Leistung wollen.

Ist es das Richtige für dich?

Gut für

  • Open-Weight-multimodale Basis (Apache 2.0) — vollständige Weights herunterladbar, modifizierbar und auf eigener Infrastruktur deploybar
  • Sicherheitsbewusste Deployments — beste Open-Weight-FORTRESS-Ergebnisse (78,0 % adversarial, 95,9 % harmlose Ablehnung)
  • Token-effizientes Reasoning durch steuerbaren Denkaufwand — verbraucht 1/3 der Tokens von Nemotron 3 Ultra bei gleicher Terminal-Bench-Leistung
  • Domänenspezifisches Fine-Tuning auf Tinker — nachgewiesene Verbesserung im Finanz-Reasoning mit Bridgewater Associates
  • Nativer multimodaler Input (Text, Bild, Audio) — selten unter Open-Weight-Modellen auf diesem Fähigkeitsniveau

Nicht geeignet für

  • Reine Fakten- und Wissensabruf-Aufgaben — SimpleQA Verified nur 43,9 %, weit hinter geschlossenen Modellen mit 70 %+
  • Budget-beschränktes Selbst-Hosting — BF16-Checkpoint benötigt ~2 TB Gesamt-VRAM (8x B300 oder 16x H200)
  • Maximale rohe Coding-Leaderboard-Leistung — SWE-Bench Pro 54,3 % und Terminal Bench 63,8 % liegen hinter der geschlossenen Frontier

Leistung nach Aufgabe

Codegenerierung

Very Good

Solide SWE-Bench Verified 77,6 %, wettbewerbsfähig mit Open-Weight-Spitzenreitern; liegt bei schwierigeren Repos hinter der geschlossenen Frontier

Reasoning

Very Good

AIME 2026 97,1 % ist nahezu gesättigt; HLE 29,7 % zeigt Grenzen beim schwierigsten Reasoning vs. 53 %+ von geschlossenen Spitzenreitern

Multimodales Verständnis

Very Good

Starkes Sehvermögen (MMMU Pro 73,5 %, Charxiv 82 %) mit seltenem nativen Audio-Input; auf Text-Output beschränkt

Agentischer Tool-Use

Very Good

MCP Atlas 74,1 % und BrowseComp 77,1 % zeigen fähiges agentisches Verhalten in verschiedenen Tool-Ökosystemen

Sicherheit und Ablehnung

Excellent

Klassenbeste unter Open-Weight bei FORTRESS; kalibrierte Unsicherheit statt Halluzination bei mehrdeutigen Anfragen

Faktentreue

Fair

SimpleQA 43,9 % ist eine klare Schwäche gegenüber geschlossenen Modellen mit 70 %+; faktische Zuverlässigkeit erfordert Fine-Tuning

Preise

Eingabe

$1.87 / 1M tokens

Ausgabe

$4.68 / 1M tokens

Kontext

Up to 1M tokens native

Alle Preise ansehen

Benchmarks

BenchmarkWertQuelle
SWE-bench Verified77.6% Quelle
AIME 202697.1% Quelle
GPQA Diamond87.2% Quelle
HLE (text only)29.7% Quelle
Terminal Bench 2.163.8% Quelle
MCP Atlas74.1% Quelle
MMMU Pro (Standard 10)73.5% Quelle
IFBench79.8% Quelle
SimpleQA Verified43.9% Quelle

Noch keine Urteilsänderungen

Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.

Prüfprotokoll

  • Preise— Keine Änderungen

    Automatisierter Agent

Wie wir bewerten