Muse Spark 1.2 logo

Muse Spark 1.2

Meta · Lanzado ago 2026

Condicional

La actualización del modelo de Meta enfocado en codificación, co-entrenado con el harness de Muse Code — 82.9% en Terminal-Bench 2.1 y 59.3% en DeepSWE 1.1, solo superado por Claude Opus 5 en el primero. Precios estándar sin cambios a $1.25 entrada / $4.25 salida por 1M tokens.

¿Es adecuada para ti?

Bueno para

  • Cost-sensitive coding agent workloads: $1.25/$4.25 standard pricing undercuts Claude, GPT, and Gemini flagships by 3-5x
  • Muse Code agent integration: co-trained with the harness for best-in-tool performance
  • Long-horizon autonomous coding: 1,000+ tool calls over 24 hours, event-log crash recovery, sustained optimization past initial exploration
  • Multimodal repo understanding: accepts text, image, video, and PDF inputs for coding context

No recomendado para

  • Production coding accuracy without independent validation: all published benchmarks are vendor-run in Meta's own framework; no third-party reproduction exists yet
  • Non-coding or general agentic tasks: coding-focused checkpoint; reasoning, knowledge, math, and multilingual benchmarks remain unpublished
  • Open-weight or self-hosting requirements: closed weights, API-only; no Hugging Face weights, no fine-tuning
  • High-concurrency production on contributor tier: 100 RPM cap vs 3,000 standard per Meta's rate-limit docs; training-data grant on all contributor traffic

Rendimiento por tarea

Generación de código

Good

Segundo en Terminal-Bench 2.1 (3.8 pts por detrás de Opus 5); tercero en DeepSWE 1.1

Codificación agentiva

Very Good

Agentes persistentes en segundo plano + aislamiento por worktree; co-entrenado con el harness de Muse Code

Tareas de larga duración

Very Good

Mejora sostenida durante 24 horas en optimización de kernels GPU

Razonamiento general

Fair

Checkpoint enfocado en codificación; los benchmarks de razonamiento, conocimiento y matemáticas siguen sin publicarse

Precios

Entrada

$1.25 / 1M tokens

Salida

$4.25 / 1M tokens

Contexto

1M tokens

Ver precios completos

Pruebas de rendimiento

PruebaPuntuaciónFuente
Terminal-Bench 2.182.9% Fuente
DeepSWE 1.159.3% Fuente
Meta Internal Coding Bench70.6% Fuente
BenchLM Aggregate60.3/100 (#49 of 216) Fuente

Aún no hay cambios de veredicto

El reloj corre desde el primer día: los cambios aparecerán aquí a medida que evolucione nuestro veredicto.

Registro de verificación

Aún no hay comprobaciones de verificación

Todavía no hemos registrado ninguna comprobación de verificación para esta entrada. Cuando se ejecute una, su historial aparecerá aquí.

Cómo evaluamos