Inkling
Thinking Machines Lab · Veröffentlicht Juli 2026
Inkling ist das bisher staerkste Argument, multimodale Open-Weight-KI ernst zu nehmen. Es liefert wettbewerbsfaehiges Reasoning und Coding mit branchenfuehrender Open-Weight-Sicherheit und steuerbarem Denkaufwand, alles unter Apache 2.0. Doch Thinking Machines ist ehrlich: Es ist nicht das staerkste Modell insgesamt -- die Faktenqualitaet haengt zurueck (SimpleQA 43,9 %) und Self-Hosting erfordert ernsthafte Hardware (2 TB VRAM). Conditional: eine ueberzeugende Basis fuer Organisationen, die ein multimodales Modell besitzen und fine-tunen muessen, nicht fuer Teams, die maximale Out-of-the-Box-Leistung wollen.
Ist es das Richtige für dich?
Gut für
- Open-Weight-multimodale Basis (Apache 2.0) — vollständige Weights herunterladbar, modifizierbar und auf eigener Infrastruktur deploybar
- Sicherheitsbewusste Deployments — beste Open-Weight-FORTRESS-Ergebnisse (78,0 % adversarial, 95,9 % harmlose Ablehnung)
- Token-effizientes Reasoning durch steuerbaren Denkaufwand — verbraucht 1/3 der Tokens von Nemotron 3 Ultra bei gleicher Terminal-Bench-Leistung
- Domänenspezifisches Fine-Tuning auf Tinker — nachgewiesene Verbesserung im Finanz-Reasoning mit Bridgewater Associates
- Nativer multimodaler Input (Text, Bild, Audio) — selten unter Open-Weight-Modellen auf diesem Fähigkeitsniveau
Nicht geeignet für
- Reine Fakten- und Wissensabruf-Aufgaben — SimpleQA Verified nur 43,9 %, weit hinter geschlossenen Modellen mit 70 %+
- Budget-beschränktes Selbst-Hosting — BF16-Checkpoint benötigt ~2 TB Gesamt-VRAM (8x B300 oder 16x H200)
- Maximale rohe Coding-Leaderboard-Leistung — SWE-Bench Pro 54,3 % und Terminal Bench 63,8 % liegen hinter der geschlossenen Frontier
Leistung nach Aufgabe
Codegenerierung
Solide SWE-Bench Verified 77,6 %, wettbewerbsfähig mit Open-Weight-Spitzenreitern; liegt bei schwierigeren Repos hinter der geschlossenen Frontier
Reasoning
AIME 2026 97,1 % ist nahezu gesättigt; HLE 29,7 % zeigt Grenzen beim schwierigsten Reasoning vs. 53 %+ von geschlossenen Spitzenreitern
Multimodales Verständnis
Starkes Sehvermögen (MMMU Pro 73,5 %, Charxiv 82 %) mit seltenem nativen Audio-Input; auf Text-Output beschränkt
Agentischer Tool-Use
MCP Atlas 74,1 % und BrowseComp 77,1 % zeigen fähiges agentisches Verhalten in verschiedenen Tool-Ökosystemen
Sicherheit und Ablehnung
Klassenbeste unter Open-Weight bei FORTRESS; kalibrierte Unsicherheit statt Halluzination bei mehrdeutigen Anfragen
Faktentreue
SimpleQA 43,9 % ist eine klare Schwäche gegenüber geschlossenen Modellen mit 70 %+; faktische Zuverlässigkeit erfordert Fine-Tuning
Preise
Eingabe
$1.87 / 1M tokens
Ausgabe
$4.68 / 1M tokens
Kontext
Up to 1M tokens native
Benchmarks
Noch keine Urteilsänderungen
Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.
Quellen
- Thinking Machines Lab — Introducing Inkling (official)Juli 2026
- Tinker Models & Pricing documentationJuli 2026
- TechCrunch — Thinking Machines amps up its bet against one-size-fits-all AIJuli 2026
- BenchLM — Thinking Machines Chose Open Weights FirstJuli 2026
- WIRED — Thinking Machines Lab Drops Its First ModelJuli 2026
Prüfprotokoll
- Preise— Keine Änderungen
Automatisierter Agent