Muse Spark 1.2 logo

Muse Spark 1.2

Meta · Lanzado ago 2026

Condicional

La actualización del modelo de Meta enfocado en codificación, co-entrenado con el harness de Muse Code — 82.9% en Terminal-Bench 2.1 y 59.3% en DeepSWE 1.1, solo superado por Claude Opus 5 en el primero. Precios estándar sin cambios a $1.25 entrada / $4.25 salida por 1M tokens.

¿Es adecuada para ti?

Bueno para

  • Cargas de trabajo de agentes de codificación sensibles al coste — los precios estándar de $1.25/$4.25 son 3-5x más baratos que los buques insignia de Claude, GPT y Gemini
  • Integración con el agente Muse Code — co-entrenado con el harness para un rendimiento óptimo en la herramienta
  • Codificación autónoma de larga duración — más de 1,000 llamadas a herramientas en 24 horas, recuperación ante fallos mediante registro de eventos
  • Precisión en codificación de producción sin validación independiente — todos los benchmarks publicados son del fabricante

No recomendado para

  • Tareas no relacionadas con codificación o tareas agentivas generales — checkpoint enfocado en codificación
  • Requisitos de pesos abiertos o self-hosting — pesos cerrados, solo API
  • Open-weight or self-hosting requirements — closed weights, API-only; no Hugging Face weights, no fine-tuning
  • High-concurrency production on contributor tier — 60 RPM cap vs 3,000 standard; training-data grant on all contributor traffic

Rendimiento por tarea

Generación de código

Good

Segundo en Terminal-Bench 2.1 (3.8 pts por detrás de Opus 5); tercero en DeepSWE 1.1

Codificación agentiva

Very Good

Agentes persistentes en segundo plano + aislamiento por worktree; co-entrenado con el harness de Muse Code

Tareas de larga duración

Very Good

Mejora sostenida durante 24 horas en optimización de kernels GPU

Razonamiento general

Fair

Checkpoint enfocado en codificación; los benchmarks de razonamiento, conocimiento y matemáticas siguen sin publicarse

Precios

Entrada

$1.25 / 1M tokens

Salida

$4.25 / 1M tokens

Contexto

1M tokens

Ver precios completos

Pruebas de rendimiento

PruebaPuntuaciónFuente
Terminal-Bench 2.182.9% Fuente
DeepSWE 1.159.3% Fuente
Meta Internal Coding Bench70.6% Fuente
BenchLM Aggregate60.3/100 (#49 of 216) Fuente

Aún no hay cambios de veredicto

El reloj corre desde el primer día: los cambios aparecerán aquí a medida que evolucione nuestro veredicto.

Registro de verificación

Aún no hay comprobaciones de verificación

Todavía no hemos registrado ninguna comprobación de verificación para esta entrada. Cuando se ejecute una, su historial aparecerá aquí.

Cómo evaluamos