Muse Spark 1.2 logo

Muse Spark 1.2

Meta · Lançado 08/2026

Condicional

Atualização do modelo focado em codificação da Meta, co-treinado com o harness Muse Code — 82,9% no Terminal-Bench 2.1 e 59,3% no DeepSWE 1.1, segundo apenas ao Claude Opus 5 no primeiro. Preços padrão inalterados a $1,25 entrada / $4,25 saída por 1M de tokens.

É adequada para ti?

Bom para

  • Cost-sensitive coding agent workloads: $1.25/$4.25 standard pricing undercuts Claude, GPT, and Gemini flagships by 3-5x
  • Muse Code agent integration: co-trained with the harness for best-in-tool performance
  • Long-horizon autonomous coding: 1,000+ tool calls over 24 hours, event-log crash recovery, sustained optimization past initial exploration
  • Multimodal repo understanding: accepts text, image, video, and PDF inputs for coding context

Não recomendado para

  • Production coding accuracy without independent validation: all published benchmarks are vendor-run in Meta's own framework; no third-party reproduction exists yet
  • Non-coding or general agentic tasks: coding-focused checkpoint; reasoning, knowledge, math, and multilingual benchmarks remain unpublished
  • Open-weight or self-hosting requirements: closed weights, API-only; no Hugging Face weights, no fine-tuning
  • High-concurrency production on contributor tier: 100 RPM cap vs 3,000 standard per Meta's rate-limit docs; training-data grant on all contributor traffic

Desempenho por tarefa

Geração de código

Good

Segundo no Terminal-Bench 2.1 (3,8 pts atrás do Opus 5); terceiro no DeepSWE 1.1

Codificação agentiva

Very Good

Agentes persistentes em segundo plano + isolamento de worktree; co-treinado com harness Muse Code

Tarefas de longo horizonte

Very Good

Melhoria sustentada ao longo de 24 horas na otimização de kernels de GPU

Raciocínio geral

Fair

Checkpoint focado em codificação; benchmarks de raciocínio, conhecimento e matemática permanecem não publicados

Preços

Entrada

$1.25 / 1M tokens

Saída

$4.25 / 1M tokens

Contexto

1M tokens

Ver preços completos

Testes de desempenho

TestePontuaçãoFonte
Terminal-Bench 2.182.9% Fonte
DeepSWE 1.159.3% Fonte
Meta Internal Coding Bench70.6% Fonte
BenchLM Aggregate60.3/100 (#49 of 216) Fonte

Ainda sem alterações de veredicto

O relógio começa a contar no primeiro dia: as alterações aparecem aqui à medida que o nosso veredicto evolui.

Registo de verificação

Ainda não há verificações

Ainda não registámos nenhuma verificação para esta entrada. Assim que uma for executada, o seu histórico aparece aqui.

Como avaliamos