Inkling
Thinking Machines Lab · Lanzado jul 2026
Inkling es la mejor razón hasta ahora para tomarse en serio la IA multimodal de pesos abiertos. Ofrece razonamiento y programación competitivos con la mejor seguridad de su clase en modelos abiertos y esfuerzo de pensamiento controlable, todo bajo Apache 2.0. Pero Thinking Machines es honesta: no es el más potente en conjunto — la factualidad se queda corta (SimpleQA 43.9%) y el autoalojamiento exige hardware serio (2 TB de VRAM). Condicional: una base convincente para organizaciones que necesitan poseer y afinar un modelo multimodal, no para equipos que buscan el máximo rendimiento inmediato.
¿Es adecuada para ti?
Bueno para
- Base multimodal de pesos abiertos (Apache 2.0): pesos completos descargables, modificables y desplegables en infraestructura propia
- Despliegues con conciencia de seguridad: mejores puntuaciones FORTRESS entre modelos de pesos abiertos (78.0% adversarial, 95.9% rechazo benigno)
- Razonamiento eficiente en tokens mediante esfuerzo de pensamiento controlable: usa 1/3 de los tokens de Nemotron 3 Ultra para igual rendimiento en Terminal Bench
- Ajuste fino específico de dominio en Tinker: mejora demostrada en razonamiento financiero con Bridgewater Associates
- Entrada multimodal nativa (texto, imagen, audio): poco común entre modelos de pesos abiertos a este nivel de capacidad
No recomendado para
- Tareas de factualidad pura y recuperación de conocimiento: SimpleQA Verified solo 43.9%, muy por detrás de modelos cerrados con más del 70%
- Autoalojamiento con presupuesto limitado: el checkpoint BF16 requiere ~2TB de VRAM agregada (8x B300 o 16x H200)
- Máximo rendimiento bruto en rankings de programación: SWE-bench Pro 54.3% y Terminal Bench 63.8% por detrás de la frontera cerrada
Rendimiento por tarea
Generación de código
Sólido SWE-bench Verified 77.6%, competitivo con los líderes de pesos abiertos; por detrás de la frontera cerrada en repositorios más difíciles
Razonamiento
AIME 2026 97.1% casi saturado; HLE 29.7% muestra límites en el razonamiento más difícil frente al 53%+ de los líderes cerrados
Comprensión multimodal
Fuerte en visión (MMMU Pro 73.5%, Charxiv 82%) con entrada de audio nativa poco común; limitado a salida de texto
Uso agéntico de herramientas
MCP Atlas 74.1% y BrowseComp 77.1% muestran comportamiento agéntico capaz en diversos ecosistemas de herramientas
Seguridad y rechazo
El mejor entre los de pesos abiertos en FORTRESS; incertidumbre calibrada en lugar de alucinación ante consultas ambiguas
Factualidad
SimpleQA 43.9% es una debilidad clara frente a modelos cerrados con más del 70%; la fiabilidad factual necesita ajuste fino
Precios
Entrada
$1.87 / 1M tokens
Salida
$4.68 / 1M tokens
Contexto
Up to 1M tokens native
Pruebas de rendimiento
Aún no hay cambios de veredicto
El reloj corre desde el primer día: los cambios aparecerán aquí a medida que evolucione nuestro veredicto.
Fuentes
- Tinker Models & Pricing documentationjul 2026
- TechCrunch — Thinking Machines amps up its bet against one-size-fits-all AIjul 2026
- BenchLM — Thinking Machines Chose Open Weights Firstjul 2026
- Thinking Machines Lab — Introducing Inkling (official)jul 2026
- WIRED — Thinking Machines Lab Drops Its First Modeljul 2026
Registro de verificación
- Precios— Sin cambios
Agente automatizado