Thinking Machines Lança o Inkling, MoE de 975B com Pesos Abertos
- O que aconteceu
- Thinking Machines Lab released Inkling, an open-weights 975B MoE model with Apache 2.0 license, native multimodality, and controllable thinking.
- Porque é importante
- Inkling is a customization platform masquerading as a model launch — fine-tuning-ready, broad rather than SOTA, with a self-improvement demo that closed the loop in 27 minutes.
- O que fazer
- If you need a customizable base model for specialized workflows, evaluate Inkling on your own data via Tinker. If you need frontier performance out of the box, stick with GPT-5.6 or Fable 5.
A Thinking Machines Lab lançou o Inkling em 15 de julho de 2026 — e ele não está tentando superar o GPT-5.6 (Thinking Machines Lab, 2026(abre num novo separador)). O laboratório de Mira Murati entregou um modelo MoE de 975B de parâmetros (41B ativos) sob Apache 2.0 com todos os pesos disponíveis no Hugging Face (Hugging Face, 2026(abre num novo separador)). O verdadeiro produto não é o modelo em si — é o controle de esforço de raciocínio ajustável e a plataforma de fine-tuning Tinker que o acompanham.
O que aconteceu — Inkling chega ao mercado
O Inkling é um modelo generalista amplo do tipo Mixture-of-Experts com multimodalidade nativa: texto, imagens e áudio como entrada, texto como saída. Ele é competitivo em tarefas de codificação agentiva, raciocínio e multimodalidade, mas explicitamente não é estado da arte em nenhum benchmark específico.
A inovação principal é um controle de esforço de raciocínio ajustável. Desenvolvedores podem trocar desempenho por eficiência de tokens no mesmo modelo — com esforço máximo de raciocínio, o Inkling iguala o Nemotron 3 Ultra no Terminal Bench 2.1 usando cerca de um terço dos tokens.
Os pesos estão no Hugging Face nos formatos original e NVFP4 para sistemas NVIDIA Blackwell. Endpoints de inferência estão disponíveis via TogetherAI, Fireworks, Modal, Databricks e Baseten. A Thinking Machines também apresentou uma prévia do Inkling-Small — 276B totais, 12B ativos — com desempenho similar em raciocínio e tarefas agentivas por um custo menor. Os pesos completos serão liberados após a conclusão dos testes.
Em segurança, a pontuação FORTRESS adversarial do Inkling de 78,0% é a mais alta entre os modelos de pesos abertos testados. No leaderboard Agentic Web Dev da Design Arena, ele marcou 1.257 — empatado com o Claude Opus 4.6 e à frente do Gemini 3.5 Flash (1.254) (Thinking Machines Lab, 2026(abre num novo separador)).
Por que o Inkling importa
O Inkling não é um desafiante de fronteira. Ele marcou 29,7% no HLE (contra 53,3% do Fable 5) e 77,6% no SWE-Bench Verified (contra 95,0% do Fable 5) (Thinking Machines Lab, 2026(abre num novo separador)). Essas diferenças são reais e deliberadas — a Thinking Machines aposta que a customização, não o desempenho bruto, é o diferencial.
A demonstração de lançamento concretiza a tese. O Inkling escreveu seu próprio job de fine-tuning, executou-o no Tinker e se converteu em um modelo lipograma que nunca usa a letra "e" — completando o ciclo de autoaperfeiçoamento em aproximadamente 27 minutos (Thinking Machines Lab, 2026(abre num novo separador)). Essa é a proposta: um modelo base que pode se especializar para o seu fluxo de trabalho sem um pipeline de treinamento externo.
"Queremos tornar a customização acessível para mais casos de uso", escreveu a empresa em seu post de lançamento. "Escolher o modelo base certo para fazer fine-tuning é um julgamento qualitativo que combina benchmarks mensuráveis com a sensação única de cada modelo."
A plataforma Tinker é o canal de distribuição. O Inkling está disponível lá com 50% de desconto introdutório nos preços (Thinking Machines Lab, 2026(abre num novo separador)), e a demonstração de autoaperfeiçoamento mostra que a plataforma consegue lidar com cargas reais de fine-tuning em menos de meia hora.
O que muda para você
Se você precisa de um modelo base customizável para fluxos de trabalho especializados de raciocínio ou tarefas agentivas, avalie o Inkling com seus próprios dados. A plataforma Tinker foi projetada para tornar essa avaliação rápida — carregue seus dados, execute um job de fine-tuning e teste o resultado.
Se você precisa de desempenho de fronteira pronto para uso, o Inkling não é o seu modelo. Fique com o GPT-5.6 Sol ou o Fable 5 para cargas de trabalho em produção onde cada ponto de benchmark conta.
O Inkling recebe nosso veredito Conditional: uma base atraente para organizações que precisam ter e fazer fine-tuning de um modelo multimodal próprio, não para equipes que buscam o máximo desempenho pronto para uso.
| Benchmark | Inkling | Fable 5 |
|---|---|---|
| HLE | 29,7% | 53,3% |
| SWE-Bench Verified | 77,6% | 95,0% |
| FORTRESS (segurança) | 78,0% | — |
| Design Arena (Agentic Web) | 1.257 | — |
Perguntas Frequentes
O Inkling é gratuito?
Sim — todos os pesos estão no Hugging Face sob Apache 2.0. A inferência hospedada está disponível via Tinker (50% de desconto introdutório nos preços), TogetherAI, Fireworks e outros.
Como o Inkling se compara ao GPT-5.6 ou ao Fable 5?
Não se compara — e esse é o ponto. O Inkling fica 20+ pontos atrás dos modelos de fronteira fechados no HLE e no SWE-Bench, mas sua licença de pesos abertos e a plataforma de fine-tuning Tinker o tornam uma base de customização, não um modelo SOTA pronto para uso.
Ferramentas e modelos afetados
Nunca mais precisas de te pôr a par
O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.