Inkling
Thinking Machines Lab · Lançado 07/2026
O Inkling é a razão mais forte até agora para levar a sério a IA multimodal de pesos abertos. Ele oferece raciocínio e codificação competitivos com a melhor segurança de pesos abertos da categoria e esforço de raciocínio controlável, tudo sob Apache 2.0. Mas a Thinking Machines é honesta ao admitir que não é o mais forte em termos gerais — a factualidade deixa a desejar (SimpleQA 43,9%) e a auto-hospedagem exige hardware sério (2TB VRAM). Condicional: uma base atraente para organizações que precisam possuir e ajustar um modelo multimodal, não para equipes que buscam desempenho máximo pronto para uso.
É adequada para ti?
Bom para
- Base multimodal de pesos abertos (Apache 2.0) — pesos completos para download, modificáveis e implantáveis na sua própria infraestrutura
- Implantações com foco em segurança — melhores pontuações FORTRESS entre pesos abertos (78,0% adversarial, 95,9% recusa benigna)
- Raciocínio eficiente em tokens via esforço de raciocínio controlável — usa 1/3 dos tokens do Nemotron 3 Ultra para desempenho equivalente no Terminal Bench
- Ajuste fino específico de domínio no Tinker — ganho comprovado em raciocínio financeiro com a Bridgewater Associates
- Entrada multimodal nativa (texto, imagem, áudio) — raro entre modelos de pesos abertos nesse nível de capacidade
Não recomendado para
- Tarefas puras de factualidade e recuperação de conhecimento — SimpleQA Verified apenas 43,9%, bem atrás de modelos fechados com 70%+
- Auto-hospedagem com orçamento restrito — checkpoint BF16 exige ~2TB de VRAM agregada (8x B300 ou 16x H200)
- Desempenho máximo bruto em leaderboards de codificação — SWE-bench Pro 54,3% e Terminal Bench 63,8% ficam atrás da fronteira fechada
Desempenho por tarefa
Code generation
SWE-bench Verified sólido com 77,6%, competitivo com líderes de pesos abertos; fica atrás da fronteira fechada em repositórios mais difíceis
Reasoning
AIME 2026 97,1% está quase saturado; HLE 29,7% mostra limites no raciocínio mais difícil vs. 53%+ dos líderes fechados
Multimodal understanding
Visão forte (MMMU Pro 73,5%, Charxiv 82%) com rara entrada de áudio nativa; limitado a saída de texto
Agentic tool use
MCP Atlas 74,1% e BrowseComp 77,1% mostram comportamento agêntico capaz em ecossistemas de ferramentas diversos
Safety and refusal
Melhor da categoria entre pesos abertos no FORTRESS; incerteza calibrada em vez de alucinação em consultas ambíguas
Factuality
SimpleQA 43,9% é uma fraqueza clara vs. modelos fechados com 70%+; a confiabilidade factual precisa de ajuste fino
Preços
Entrada
$1.87 / 1M tokens
Saída
$4.68 / 1M tokens
Contexto
Up to 1M tokens native
Testes de desempenho
Ainda sem alterações de veredicto
O relógio começa a contar no primeiro dia: as alterações aparecem aqui à medida que o nosso veredicto evolui.
Fontes
- Tinker Models & Pricing documentation07/2026
- TechCrunch — Thinking Machines amps up its bet against one-size-fits-all AI07/2026
- BenchLM — Thinking Machines Chose Open Weights First07/2026
- Thinking Machines Lab — Introducing Inkling (official)07/2026
- WIRED — Thinking Machines Lab Drops Its First Model07/2026
Registo de verificação
- Preços— Sem alterações
Agente automatizado
- Preços— Sem alterações
Agente automatizado