I

Inkling

Thinking Machines Lab · Lanzado jul 2026

Condicional

Inkling es la mejor razón hasta ahora para tomarse en serio la IA multimodal de pesos abiertos. Ofrece razonamiento y programación competitivos con la mejor seguridad de su clase en modelos abiertos y esfuerzo de pensamiento controlable, todo bajo Apache 2.0. Pero Thinking Machines es honesta: no es el más potente en conjunto — la factualidad se queda corta (SimpleQA 43.9%) y el autoalojamiento exige hardware serio (2 TB de VRAM). Condicional: una base convincente para organizaciones que necesitan poseer y afinar un modelo multimodal, no para equipos que buscan el máximo rendimiento inmediato.

¿Es adecuada para ti?

Bueno para

  • Base multimodal de pesos abiertos (Apache 2.0): pesos completos descargables, modificables y desplegables en infraestructura propia
  • Despliegues con conciencia de seguridad: mejores puntuaciones FORTRESS entre modelos de pesos abiertos (78.0% adversarial, 95.9% rechazo benigno)
  • Razonamiento eficiente en tokens mediante esfuerzo de pensamiento controlable: usa 1/3 de los tokens de Nemotron 3 Ultra para igual rendimiento en Terminal Bench
  • Ajuste fino específico de dominio en Tinker: mejora demostrada en razonamiento financiero con Bridgewater Associates
  • Entrada multimodal nativa (texto, imagen, audio): poco común entre modelos de pesos abiertos a este nivel de capacidad

No recomendado para

  • Tareas de factualidad pura y recuperación de conocimiento: SimpleQA Verified solo 43.9%, muy por detrás de modelos cerrados con más del 70%
  • Autoalojamiento con presupuesto limitado: el checkpoint BF16 requiere ~2TB de VRAM agregada (8x B300 o 16x H200)
  • Máximo rendimiento bruto en rankings de programación: SWE-bench Pro 54.3% y Terminal Bench 63.8% por detrás de la frontera cerrada

Rendimiento por tarea

Generación de código

Very Good

Sólido SWE-bench Verified 77.6%, competitivo con los líderes de pesos abiertos; por detrás de la frontera cerrada en repositorios más difíciles

Razonamiento

Very Good

AIME 2026 97.1% casi saturado; HLE 29.7% muestra límites en el razonamiento más difícil frente al 53%+ de los líderes cerrados

Comprensión multimodal

Very Good

Fuerte en visión (MMMU Pro 73.5%, Charxiv 82%) con entrada de audio nativa poco común; limitado a salida de texto

Uso agéntico de herramientas

Very Good

MCP Atlas 74.1% y BrowseComp 77.1% muestran comportamiento agéntico capaz en diversos ecosistemas de herramientas

Seguridad y rechazo

Excellent

El mejor entre los de pesos abiertos en FORTRESS; incertidumbre calibrada en lugar de alucinación ante consultas ambiguas

Factualidad

Fair

SimpleQA 43.9% es una debilidad clara frente a modelos cerrados con más del 70%; la fiabilidad factual necesita ajuste fino

Precios

Entrada

$1.87 / 1M tokens

Salida

$4.68 / 1M tokens

Contexto

Up to 1M tokens native

Ver precios completos

Pruebas de rendimiento

PruebaPuntuaciónFuente
SWE-bench Verified77.6% Fuente
AIME 202697.1% Fuente
GPQA Diamond87.2% Fuente
HLE (text only)29.7% Fuente
Terminal Bench 2.163.8% Fuente
MCP Atlas74.1% Fuente
MMMU Pro (Standard 10)73.5% Fuente
IFBench79.8% Fuente
SimpleQA Verified43.9% Fuente

Aún no hay cambios de veredicto

El reloj corre desde el primer día: los cambios aparecerán aquí a medida que evolucione nuestro veredicto.

Registro de verificación

  • Precios— Sin cambios

    Agente automatizado

Cómo evaluamos