Inkling
Thinking Machines Lab · Lanzado jul 2026
Inkling es la razón más sólida hasta ahora para tomarse en serio la IA multimodal de pesos abiertos. Ofrece razonamiento y programación competitivos con la mejor seguridad de su clase en pesos abiertos y esfuerzo de razonamiento controlable, todo bajo licencia Apache 2.0. Pero Thinking Machines admite abiertamente que no es el más potente en general — la factualidad se queda atrás (SimpleQA 43.9%) y el autoalojamiento exige hardware serio (2 TB de VRAM). conditional: una base convincente para organizaciones que necesitan poseer y afinar un modelo multimodal, no para equipos que buscan el máximo rendimiento sin personalización.
¿Es adecuada para ti?
Bueno para
- Base multimodal de pesos abiertos (Apache 2.0) — pesos completos descargables, modificables y desplegables en tu propia infraestructura
- Despliegues que priorizan la seguridad — mejores puntuaciones FORTRESS de pesos abiertos (78.0% adversarial, 95.9% rechazo benigno)
- Razonamiento eficiente en tokens mediante esfuerzo de razonamiento controlable — usa 1/3 de los tokens de Nemotron 3 Ultra para igual rendimiento en Terminal Bench
- Ajuste fino específico por dominio en Tinker — mejora demostrada en razonamiento financiero con Bridgewater Associates
- Entrada multimodal nativa (texto, imagen, audio) — poco común entre modelos de pesos abiertos a este nivel de capacidad
No recomendado para
- Tareas puras de factualidad y recuperación de conocimiento — SimpleQA Verified solo 43.9%, muy por detrás de modelos cerrados que superan el 70%
- Autoalojamiento con presupuesto limitado — el checkpoint BF16 requiere ~2 TB de VRAM agregada (8× B300 o 16× H200)
- Máximo rendimiento bruto en benchmarks de programación — SWE-bench Pro 54.3% y Terminal Bench 63.8% quedan por detrás de la frontera cerrada
Rendimiento por tarea
Generación de código
Programación sólida en SWE-bench Verified 77.6%, competitivo con líderes de pesos abiertos; por detrás de la frontera cerrada en repositorios más difíciles
Razonamiento
AIME 2026 al 97.1% está cerca de la saturación; HLE al 29.7% muestra límites en el razonamiento más difícil frente al 53%+ de líderes cerrados
Comprensión multimodal
Visión sólida (MMMU Pro 73.5%, Charxiv 82%) con entrada de audio nativa poco común; limitado a salida de texto
Uso de herramientas agénticas
MCP Atlas 74.1% y BrowseComp 77.1% muestran comportamiento agéntico capaz en diversos ecosistemas de herramientas
Seguridad y rechazo
El mejor de su clase entre pesos abiertos en FORTRESS; incertidumbre calibrada en lugar de alucinación en consultas ambiguas
Factualidad
SimpleQA 43.9% es una debilidad clara frente a modelos cerrados que superan el 70%; la fiabilidad factual necesita ajuste fino
Precios
Entrada
$1.87 / 1M tokens
Salida
$4.68 / 1M tokens
Contexto
Up to 1M tokens native
Pruebas de rendimiento
Aún no hay cambios de veredicto
El reloj corre desde el primer día: los cambios aparecerán aquí a medida que evolucione nuestro veredicto.
Fuentes
- Tinker Models & Pricing documentationjul 2026
- TechCrunch — Thinking Machines amps up its bet against one-size-fits-all AIjul 2026
- BenchLM — Thinking Machines Chose Open Weights Firstjul 2026
- Thinking Machines Lab — Introducing Inkling (official)jul 2026
- WIRED — Thinking Machines Lab Drops Its First Modeljul 2026
Registro de verificación
- Precios— Sin cambios
Agente automatizado
- Precios— Sin cambios
Agente automatizado