Inkling
Thinking Machines Lab · Lançado 07/2026
O Inkling é o melhor argumento até agora para levar a sério a IA multimodal de pesos abertos. Entrega raciocínio e codificação competitivos com segurança de ponta em pesos abertos e esforço de pensamento controlável, tudo sob Apache 2.0. Mas a Thinking Machines é honesta ao dizer que não é o mais forte no geral — a factualidade fica para trás (SimpleQA 43,9%) e o self-hosting exige hardware pesado (2TB de VRAM). Condicional: uma base atraente para organizações que precisam ter e ajustar um modelo multimodal próprio, não para equipes que buscam o melhor desempenho pronto para uso.
É adequada para ti?
Bom para
- Base multimodal de pesos abertos (Apache 2.0) — pesos completos para download, modificação e implantação na sua própria infraestrutura
- Implantações conscientes da segurança — melhores pontuações FORTRESS de pesos abertos (78,0% adversarial, 95,9% recusa benigna)
- Raciocínio eficiente em tokens via esforço de pensamento controlável — usa 1/3 dos tokens do Nemotron 3 Ultra para desempenho igual no Terminal Bench
- Fine-tuning específico de domínio no Tinker — melhoria comprovada em raciocínio financeiro com a Bridgewater Associates
- Entrada multimodal nativa (texto, imagem, áudio) — raro entre modelos de pesos abertos neste nível de capacidade
Não recomendado para
- Tarefas de factualidade pura e recuperação de conhecimento — SimpleQA Verified apenas 43,9%, bem atrás dos modelos fechados com mais de 70%
- Auto-hospedagem com restrições de orçamento — o checkpoint BF16 requer ~2TB VRAM agregada (8x B300 ou 16x H200)
- Desempenho máximo bruto em tabelas de classificação de código — SWE-bench Pro 54,3% e Terminal Bench 63,8% ficam atrás da fronteira fechada
Desempenho por tarefa
Geração de código
Sólido SWE-bench Verified 77,6%, competitivo com líderes de pesos abertos; fica atrás da fronteira fechada em repositórios mais difíceis
Raciocínio
AIME 2026 97,1% está perto da saturação; HLE 29,7% mostra limites no raciocínio mais difícil vs. 53%+ dos líderes fechados
Compreensão multimodal
Forte visão (MMMU Pro 73,5%, Charxiv 82%) com rara entrada de áudio nativa; limitado à saída de texto
Uso de ferramentas agênticas
MCP Atlas 74,1% e BrowseComp 77,1% mostram comportamento agêntico capaz em diversos ecossistemas de ferramentas
Segurança e recusa
Melhor da categoria entre pesos abertos no FORTRESS; incerteza calibrada em vez de alucinação em consultas ambíguas
Factualidade
SimpleQA 43,9% é uma clara fraqueza vs. modelos fechados com mais de 70%; a fiabilidade factual precisa de fine-tuning
Preços
Entrada
$1.87 / 1M tokens
Saída
$4.68 / 1M tokens
Contexto
Up to 1M tokens native
Testes de desempenho
Ainda sem alterações de veredicto
O relógio começa a contar no primeiro dia: as alterações aparecem aqui à medida que o nosso veredicto evolui.
Fontes
- Tinker Models & Pricing documentation07/2026
- TechCrunch — Thinking Machines amps up its bet against one-size-fits-all AI07/2026
- BenchLM — Thinking Machines Chose Open Weights First07/2026
- Thinking Machines Lab — Introducing Inkling (official)07/2026
- WIRED — Thinking Machines Lab Drops Its First Model07/2026
Registo de verificação
- Preços— Sem alterações
Agente automatizado