I

Inkling

Thinking Machines Lab · Veröffentlicht Juli 2026

Bedingt

Inkling ist der stärkste Grund bisher, Open-Weight-multimodale KI ernst zu nehmen. Es liefert wettbewerbsfähiges Reasoning und Coding mit erstklassiger Open-Weight-Sicherheit und kontrollierbarem Denkaufwand, alles unter Apache 2.0. Aber Thinking Machines ist ehrlich, dass es nicht das insgesamt stärkste ist — die Faktentreue hinkt hinterher (SimpleQA 43,9 %) und Self-Hosting erfordert ernsthafte Hardware (2 TB VRAM). Eingeschränkt: eine überzeugende Basis für Organisationen, die ein multimodales Modell besitzen und feintunen müssen, nicht für Teams, die Spitzenleistung von der Stange wollen.

Ist es das Richtige für dich?

Gut für

  • Open-Weight (Apache 2.0) multimodale Basis — vollständige Gewichte herunterladbar, modifizierbar und auf eigener Infrastruktur deploybar
  • Sicherheitsbewusste Einsätze — beste Open-Weight-FORTRESS-Werte (78,0 % adversarial, 95,9 % benign refusal)
  • Token-effizientes Reasoning durch kontrollierbaren Denkaufwand — verbraucht 1/3 der Tokens von Nemotron 3 Ultra für gleiche Terminal-Bench-Leistung
  • Domänenspezifisches Fine-Tuning auf Tinker — nachgewiesene Verbesserung im Financial Reasoning mit Bridgewater Associates
  • Native multimodale Eingabe (Text, Bild, Audio) — selten unter Open-Weight-Modellen auf diesem Leistungsniveau

Nicht geeignet für

  • Reine Faktentreue- und Wissensabruf-Aufgaben — SimpleQA Verified nur 43,9 %, deutlich hinter geschlossenen Modellen mit 70 %+
  • Budgetbeschränktes Self-Hosting — BF16-Checkpoint benötigt ~2 TB aggregierten VRAM (8× B300 oder 16× H200)
  • Maximale rohe Coding-Leaderboard-Leistung — SWE-bench Pro 54,3 % und Terminal Bench 63,8 % bleiben hinter Closed Frontier zurück

Leistung nach Aufgabe

Code generation

Very Good

Solides SWE-bench Verified 77,6 %, wettbewerbsfähig mit Open-Weight-Spitzenreitern; bleibt bei schwierigeren Repos hinter Closed Frontier zurück

Reasoning

Very Good

AIME 2026 97,1 % ist nahezu gesättigt; HLE 29,7 % zeigt Grenzen bei härtestem Reasoning vs. 53 %+ von Closed-Leadern

Multimodal understanding

Very Good

Starke Vision (MMMU Pro 73,5 %, Charxiv 82 %) mit seltener nativer Audioeingabe; auf Textausgabe beschränkt

Agentic tool use

Very Good

MCP Atlas 74,1 % und BrowseComp 77,1 % zeigen fähiges agentisches Verhalten über diverse Tool-Ökosysteme hinweg

Safety and refusal

Excellent

Branchenbeste unter Open-Weight bei FORTRESS; kalibrierte Unsicherheit statt Halluzination bei mehrdeutigen Anfragen

Factuality

Fair

SimpleQA 43,9 % ist eine klare Schwäche vs. geschlossene Modelle mit 70 %+; faktische Zuverlässigkeit benötigt Fine-Tuning

Preise

Eingabe

$1.87 / 1M tokens

Ausgabe

$4.68 / 1M tokens

Kontext

Up to 1M tokens native

Alle Preise ansehen

Benchmarks

BenchmarkWertQuelle
SWE-bench Verified77.6% Quelle
AIME 202697.1% Quelle
GPQA Diamond87.2% Quelle
HLE (text only)29.7% Quelle
Terminal Bench 2.163.8% Quelle
MCP Atlas74.1% Quelle
MMMU Pro (Standard 10)73.5% Quelle
IFBench79.8% Quelle
SimpleQA Verified43.9% Quelle

Noch keine Urteilsänderungen

Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.

Prüfprotokoll

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Preise— Keine Änderungen

    Automatisierter Agent

Wie wir bewerten