I

Inkling

Thinking Machines Lab · Lançado 07/2026

Condicional

O Inkling é a razão mais forte até agora para levar a sério a IA multimodal de pesos abertos. Ele oferece raciocínio e codificação competitivos com a melhor segurança de pesos abertos da categoria e esforço de raciocínio controlável, tudo sob Apache 2.0. Mas a Thinking Machines é honesta ao admitir que não é o mais forte em termos gerais — a factualidade deixa a desejar (SimpleQA 43,9%) e a auto-hospedagem exige hardware sério (2TB VRAM). Condicional: uma base atraente para organizações que precisam possuir e ajustar um modelo multimodal, não para equipes que buscam desempenho máximo pronto para uso.

É adequada para ti?

Bom para

  • Base multimodal de pesos abertos (Apache 2.0) — pesos completos para download, modificáveis e implantáveis na sua própria infraestrutura
  • Implantações com foco em segurança — melhores pontuações FORTRESS entre pesos abertos (78,0% adversarial, 95,9% recusa benigna)
  • Raciocínio eficiente em tokens via esforço de raciocínio controlável — usa 1/3 dos tokens do Nemotron 3 Ultra para desempenho equivalente no Terminal Bench
  • Ajuste fino específico de domínio no Tinker — ganho comprovado em raciocínio financeiro com a Bridgewater Associates
  • Entrada multimodal nativa (texto, imagem, áudio) — raro entre modelos de pesos abertos nesse nível de capacidade

Não recomendado para

  • Tarefas puras de factualidade e recuperação de conhecimento — SimpleQA Verified apenas 43,9%, bem atrás de modelos fechados com 70%+
  • Auto-hospedagem com orçamento restrito — checkpoint BF16 exige ~2TB de VRAM agregada (8x B300 ou 16x H200)
  • Desempenho máximo bruto em leaderboards de codificação — SWE-bench Pro 54,3% e Terminal Bench 63,8% ficam atrás da fronteira fechada

Desempenho por tarefa

Code generation

Very Good

SWE-bench Verified sólido com 77,6%, competitivo com líderes de pesos abertos; fica atrás da fronteira fechada em repositórios mais difíceis

Reasoning

Very Good

AIME 2026 97,1% está quase saturado; HLE 29,7% mostra limites no raciocínio mais difícil vs. 53%+ dos líderes fechados

Multimodal understanding

Very Good

Visão forte (MMMU Pro 73,5%, Charxiv 82%) com rara entrada de áudio nativa; limitado a saída de texto

Agentic tool use

Very Good

MCP Atlas 74,1% e BrowseComp 77,1% mostram comportamento agêntico capaz em ecossistemas de ferramentas diversos

Safety and refusal

Excellent

Melhor da categoria entre pesos abertos no FORTRESS; incerteza calibrada em vez de alucinação em consultas ambíguas

Factuality

Fair

SimpleQA 43,9% é uma fraqueza clara vs. modelos fechados com 70%+; a confiabilidade factual precisa de ajuste fino

Preços

Entrada

$1.87 / 1M tokens

Saída

$4.68 / 1M tokens

Contexto

Up to 1M tokens native

Ver preços completos

Testes de desempenho

TestePontuaçãoFonte
SWE-bench Verified77.6% Fonte
AIME 202697.1% Fonte
GPQA Diamond87.2% Fonte
HLE (text only)29.7% Fonte
Terminal Bench 2.163.8% Fonte
MCP Atlas74.1% Fonte
MMMU Pro (Standard 10)73.5% Fonte
IFBench79.8% Fonte
SimpleQA Verified43.9% Fonte

Ainda sem alterações de veredicto

O relógio começa a contar no primeiro dia: as alterações aparecem aqui à medida que o nosso veredicto evolui.

Registo de verificação

  • Preços— Sem alterações

    Agente automatizado

  • Preços— Sem alterações

    Agente automatizado

Como avaliamos