Inkling
Thinking Machines Lab · Veröffentlicht Juli 2026
Inkling ist der stärkste Grund bisher, Open-Weight-multimodale KI ernst zu nehmen. Es liefert wettbewerbsfähiges Reasoning und Coding mit erstklassiger Open-Weight-Sicherheit und kontrollierbarem Denkaufwand, alles unter Apache 2.0. Aber Thinking Machines ist ehrlich, dass es nicht das insgesamt stärkste ist — die Faktentreue hinkt hinterher (SimpleQA 43,9 %) und Self-Hosting erfordert ernsthafte Hardware (2 TB VRAM). Eingeschränkt: eine überzeugende Basis für Organisationen, die ein multimodales Modell besitzen und feintunen müssen, nicht für Teams, die Spitzenleistung von der Stange wollen.
Ist es das Richtige für dich?
Gut für
- Open-Weight (Apache 2.0) multimodale Basis — vollständige Gewichte herunterladbar, modifizierbar und auf eigener Infrastruktur deploybar
- Sicherheitsbewusste Einsätze — beste Open-Weight-FORTRESS-Werte (78,0 % adversarial, 95,9 % benign refusal)
- Token-effizientes Reasoning durch kontrollierbaren Denkaufwand — verbraucht 1/3 der Tokens von Nemotron 3 Ultra für gleiche Terminal-Bench-Leistung
- Domänenspezifisches Fine-Tuning auf Tinker — nachgewiesene Verbesserung im Financial Reasoning mit Bridgewater Associates
- Native multimodale Eingabe (Text, Bild, Audio) — selten unter Open-Weight-Modellen auf diesem Leistungsniveau
Nicht geeignet für
- Reine Faktentreue- und Wissensabruf-Aufgaben — SimpleQA Verified nur 43,9 %, deutlich hinter geschlossenen Modellen mit 70 %+
- Budgetbeschränktes Self-Hosting — BF16-Checkpoint benötigt ~2 TB aggregierten VRAM (8× B300 oder 16× H200)
- Maximale rohe Coding-Leaderboard-Leistung — SWE-bench Pro 54,3 % und Terminal Bench 63,8 % bleiben hinter Closed Frontier zurück
Leistung nach Aufgabe
Code generation
Solides SWE-bench Verified 77,6 %, wettbewerbsfähig mit Open-Weight-Spitzenreitern; bleibt bei schwierigeren Repos hinter Closed Frontier zurück
Reasoning
AIME 2026 97,1 % ist nahezu gesättigt; HLE 29,7 % zeigt Grenzen bei härtestem Reasoning vs. 53 %+ von Closed-Leadern
Multimodal understanding
Starke Vision (MMMU Pro 73,5 %, Charxiv 82 %) mit seltener nativer Audioeingabe; auf Textausgabe beschränkt
Agentic tool use
MCP Atlas 74,1 % und BrowseComp 77,1 % zeigen fähiges agentisches Verhalten über diverse Tool-Ökosysteme hinweg
Safety and refusal
Branchenbeste unter Open-Weight bei FORTRESS; kalibrierte Unsicherheit statt Halluzination bei mehrdeutigen Anfragen
Factuality
SimpleQA 43,9 % ist eine klare Schwäche vs. geschlossene Modelle mit 70 %+; faktische Zuverlässigkeit benötigt Fine-Tuning
Preise
Eingabe
$1.87 / 1M tokens
Ausgabe
$4.68 / 1M tokens
Kontext
Up to 1M tokens native
Benchmarks
Noch keine Urteilsänderungen
Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.
Quellen
- Tinker Models & Pricing documentationJuli 2026
- TechCrunch — Thinking Machines amps up its bet against one-size-fits-all AIJuli 2026
- BenchLM — Thinking Machines Chose Open Weights FirstJuli 2026
- Thinking Machines Lab — Introducing Inkling (official)Juli 2026
- WIRED — Thinking Machines Lab Drops Its First ModelJuli 2026
Prüfprotokoll
- Preise— Keine Änderungen
Automatisierter Agent
- Preise— Keine Änderungen
Automatisierter Agent