I

Inkling

Thinking Machines Lab · Lançado 07/2026

Condicional

O Inkling é o melhor argumento até agora para levar a sério a IA multimodal de pesos abertos. Entrega raciocínio e codificação competitivos com segurança de ponta em pesos abertos e esforço de pensamento controlável, tudo sob Apache 2.0. Mas a Thinking Machines é honesta ao dizer que não é o mais forte no geral — a factualidade fica para trás (SimpleQA 43,9%) e o self-hosting exige hardware pesado (2TB de VRAM). Condicional: uma base atraente para organizações que precisam ter e ajustar um modelo multimodal próprio, não para equipes que buscam o melhor desempenho pronto para uso.

É adequada para ti?

Bom para

  • Base multimodal de pesos abertos (Apache 2.0) — pesos completos para download, modificação e implantação na sua própria infraestrutura
  • Implantações conscientes da segurança — melhores pontuações FORTRESS de pesos abertos (78,0% adversarial, 95,9% recusa benigna)
  • Raciocínio eficiente em tokens via esforço de pensamento controlável — usa 1/3 dos tokens do Nemotron 3 Ultra para desempenho igual no Terminal Bench
  • Fine-tuning específico de domínio no Tinker — melhoria comprovada em raciocínio financeiro com a Bridgewater Associates
  • Entrada multimodal nativa (texto, imagem, áudio) — raro entre modelos de pesos abertos neste nível de capacidade

Não recomendado para

  • Tarefas de factualidade pura e recuperação de conhecimento — SimpleQA Verified apenas 43,9%, bem atrás dos modelos fechados com mais de 70%
  • Auto-hospedagem com restrições de orçamento — o checkpoint BF16 requer ~2TB VRAM agregada (8x B300 ou 16x H200)
  • Desempenho máximo bruto em tabelas de classificação de código — SWE-bench Pro 54,3% e Terminal Bench 63,8% ficam atrás da fronteira fechada

Desempenho por tarefa

Geração de código

Very Good

Sólido SWE-bench Verified 77,6%, competitivo com líderes de pesos abertos; fica atrás da fronteira fechada em repositórios mais difíceis

Raciocínio

Very Good

AIME 2026 97,1% está perto da saturação; HLE 29,7% mostra limites no raciocínio mais difícil vs. 53%+ dos líderes fechados

Compreensão multimodal

Very Good

Forte visão (MMMU Pro 73,5%, Charxiv 82%) com rara entrada de áudio nativa; limitado à saída de texto

Uso de ferramentas agênticas

Very Good

MCP Atlas 74,1% e BrowseComp 77,1% mostram comportamento agêntico capaz em diversos ecossistemas de ferramentas

Segurança e recusa

Excellent

Melhor da categoria entre pesos abertos no FORTRESS; incerteza calibrada em vez de alucinação em consultas ambíguas

Factualidade

Fair

SimpleQA 43,9% é uma clara fraqueza vs. modelos fechados com mais de 70%; a fiabilidade factual precisa de fine-tuning

Preços

Entrada

$1.87 / 1M tokens

Saída

$4.68 / 1M tokens

Contexto

Up to 1M tokens native

Ver preços completos

Testes de desempenho

TestePontuaçãoFonte
SWE-bench Verified77.6% Fonte
AIME 202697.1% Fonte
GPQA Diamond87.2% Fonte
HLE (text only)29.7% Fonte
Terminal Bench 2.163.8% Fonte
MCP Atlas74.1% Fonte
MMMU Pro (Standard 10)73.5% Fonte
IFBench79.8% Fonte
SimpleQA Verified43.9% Fonte

Ainda sem alterações de veredicto

O relógio começa a contar no primeiro dia: as alterações aparecem aqui à medida que o nosso veredicto evolui.

Registo de verificação

  • Preços— Sem alterações

    Agente automatizado

Como avaliamos