Meta Lanza Muse Glimmer: Modelo Agente Open-Weight de 30B

Meta logoMetaFYI11 de agosto de 2026Modelos
Qué pasó
Meta released Muse Glimmer, a 29.6B-parameter open-weight model under Apache 2.0, distilled from Muse Spark and designed to run always-on agents on a single 24GB consumer GPU with 131K+ context and DFlash speculative decoding for up to 3.1× faster generation.
Por qué importa
Muse Glimmer is the first open-weight model purpose-built for local agentic autonomy — not a general-purpose model that happens to run agents. Apache 2.0 with no commercial restrictions, plus Meta's commitment to open-weight Muse Spark 1.2, signals the company is competing for the developer ecosystem, not just selling cloud API access. Local agents stay offline, unregulatable, and unmetered.
Qué hacer
Test Glimmer against Qwen3.6-27B for terminal/OS automation workloads and against Gemma4-31B for multimodal breadth. The DFlash 3.1× speedup claim needs verification on your own hardware — and the Muse Spark 1.2 open-weight release deserves close attention when it lands.

Meta Lanza Muse Glimmer: Modelo Agente Open-Weight de 30B

Meta lanzó Muse Glimmer el 10 de agosto — un modelo open-weight de 30 mil millones de parámetros bajo licencia Apache 2.0, diseñado específicamente para cargas de trabajo agentivas locales siempre activas. No es un modelo de chat de propósito general. Está destilado de la familia Muse Spark y explícitamente diseñado para ejecutar agentes autónomos en una sola GPU de consumo (24 GB de VRAM). Disponible hoy en Hugging Face. Los pesos son gratuitos — sin claves API, sin facturación por token.

Qué pasó

Muse Glimmer es el primer modelo open-weight de Meta diseñado desde cero para autonomía agentiva local — agentes de IA siempre activos que se ejecutan en tu hardware, no en un centro de datos en la nube.

  • 29.6B parámetros, licencia Apache 2.0. Sin restricciones comerciales, sin cláusulas de reparto de ingresos, sin límites de uso. Destilado de Muse Spark mediante destilación logit, entrenamiento intermedio en datos con alta carga agentiva y trazas de razonamiento más ricas, luego post-entrenado con fine-tuning supervisado, destilación on-policy y aprendizaje por refuerzo en dominios generales, de razonamiento, codificación y agentivos.
  • Objetivo: GPU de consumo. A precisión completa el modelo necesita 55 GB+. Cuantizado a ~4-bit (K-Quant-17 GB), cabe en menos de 20 GB — dejando espacio para la caché KV, el codificador de percepción y un drafter DFlash, todo dentro de una envolvente de 24 GB de VRAM (RTX 3090, RTX 4090 o equivalente). También se distribuye una variante K-Quant-Dynamic orientada a 32 GB.
  • Ventana de contexto de 131K+ tokens. Suficiente para sesiones agentivas de varias horas que abarcan codebases completos, documentos y cadenas de llamadas a herramientas. Entrenado en más de 100 idiomas con corte de conocimiento al 4 de enero de 2026.
  • Arquitectura agent-first. Diseñado para llamada de herramientas, razonamiento multi-paso, recuperación ante fallos y ejecución persistente — no optimizado para Q&A de un solo turno ni escritura creativa. Incluye un codificador de percepción ViT-G/14 de ~1.8B parámetros dedicado a interpretar capturas de pantalla, gráficos y documentos junto con texto.
  • Decodificación especulativa DFlash. Se distribuye con un modelo drafter complementario que propone bloques de 16 tokens en paralelo, que el modelo principal verifica. En una RTX 5090 esto produce una aceleración de generación de 3.1× (74.9 → 233.4 tok/s). En Apple M5 Max: 1.8× (26.6 → 50.2 tok/s). En M4 Max: 1.5× (23.7 → 37.8 tok/s). Estas son las mediciones propias de Meta.

La tabla de benchmarks de Meta compara Glimmer contra Gemma4-31B y Qwen3.6-27B. Glimmer lidera en orquestación agentiva — MCP Atlas (75.5 vs. 54.2/62.5), DeepSearch QA (74.6) y SWE-Bench Pro (51.2 vs. 36.9/50.2). Obtiene 94.7 en AIME 2026. Pero va por detrás de Qwen en OSWorld-Verified (65.9 vs. 75.6), TerminalBench 2.1 (51.7 vs. 60.7) y la mayoría de benchmarks multimodales. Todas las cifras son reportadas por el fabricante.

En una demo, Glimmer descubrió de forma autónoma una instancia de Home Assistant en la red local, consultó APIs de dispositivos, escribió un dashboard HTML/CSS/JavaScript desde cero y desplegó un servidor local para verificar su propio trabajo — un flujo de trabajo agentivo multi-paso, no un Q&A de chatbot.

Los pesos abiertos de Muse Spark 1.2 son los siguientes. Mark Zuckerberg y Alexandr Wang confirmaron que los pesos abiertos del modelo frontier de Meta, Muse Spark 1.2, llegarán "en las próximas semanas". Si Meta cumple, pondría un modelo frontier insignia estadounidense en circulación abierta — algo que ningún laboratorio americano ha hecho a ese nivel.

Por qué importa

Los modelos open-weight que se ejecutan en hardware de consumo existen desde Llama. Pero cada lanzamiento open-weight anterior — Llama, Mistral, Qwen, DeepSeek — fue diseñado como un modelo de propósito general que podía ejecutar agentes. Muse Glimmer es el primer modelo open-weight diseñado para agentes como caso de uso principal.

La autonomía siempre activa se vuelve local. Los flujos de trabajo agentivos en la nube (Claude Code, Cursor Agent, GPT-5.6) facturan por token y dependen de la disponibilidad de la API. Un modelo local ejecutándose en tu GPU elimina ambas cosas — tu agente de codificación funciona 24/7 sin costes medidos ni dependencia de internet. Archivos sensibles, entornos de desarrollo y capturas de pantalla permanecen en tu máquina.

La licencia Apache 2.0 es un giro estratégico. La familia Llama de Meta usaba una licencia comunitaria propia con un límite de 700 millones de usuarios mensuales que generó años de críticas. Muse Spark es cerrado y facturado a $4.25/M tokens de salida. Glimmer bajo Apache 2.0 — sin restricciones, sin límites de uso, libertad comercial total — señala que Meta está compitiendo por el ecosistema de desarrolladores open-weight, no solo vendiendo acceso API. También da a los desarrolladores (y a sus departamentos legales) una claridad inusual para el despliegue empresarial.

El ecosistema open-weight se está especializando. Durante dos años, los laboratorios chinos (DeepSeek, Qwen, Kimi, GLM, MiniMax) dominaron los lanzamientos open-weight, representando aproximadamente el 61% del consumo de tokens en OpenRouter en mayo de 2026. Glimmer es un contrapeso de origen estadounidense — y compite en un nuevo eje: no en cantidad bruta de parámetros o amplitud de razonamiento, sino en fiabilidad agentiva en hardware de consumo.

Los agentes locales son fundamentalmente inregulables. No puedes controlar una descarga de Hugging Face. El marco de revisión previa de la Casa Blanca excluye explícitamente los modelos open-weight de su alcance. Un modelo agentivo Apache 2.0 que se ejecuta en un PC doméstico queda fuera de todos los marcos actuales de gobernanza de IA.

Qué cambia para ti

Si eres desarrollador ejecutando IA local: Muse Glimmer en una GPU de 24 GB significa que puedes ejecutar un agente de codificación siempre activo, asistente de investigación o agente de domótica localmente — sin claves API, sin facturación por token, sin necesidad de internet. Ollama 0.32.7 ya lo soporta. Las integraciones con LM Studio, vLLM, SGLang y OpenRouter se están desplegando esta semana.

Si estás evaluando modelos open-weight: El perfil de benchmarks de Glimmer es más fuerte en orquestación agentiva y razonamiento, y más débil en automatización de terminal y tareas a nivel de SO. Pruébalo contra Qwen3.6-27B si tu carga de trabajo implica comandos de shell o control de GUI de escritorio; pruébalo contra Gemma4-31B si necesitas amplitud de razonamiento multimodal. Vale la pena verificar la aceleración DFlash en tu propio hardware — la diferencia entre 75 tok/s y 233 tok/s puede hacer que un agente se sienta responsivo o inservible.

Si sigues la política de IA: Muse Glimmer es el modelo agentivo open-weight de mayor capacidad lanzado hasta la fecha. Combinado con el compromiso de Meta de abrir los pesos de Muse Spark 1.2, esto presiona los marcos de control de exportaciones y revisión previa que hasta ahora han evitado enfrentarse a modelos agentivos distribuidos abiertamente.

FAQ

¿Cómo se compara Glimmer con Muse Spark 1.2? Glimmer es una destilación — más pequeño (29.6B vs. un modelo frontier mucho mayor), cuantizado para hardware local y open-weight bajo Apache 2.0. Muse Spark 1.2 sigue siendo el buque insignia de pesos cerrados de Meta para acceso API en la nube a $1.25/$4.25 por 1M tokens. Glimmer sacrifica algo de capacidad a cambio de libertad de despliegue local. Los pesos abiertos de Muse Spark 1.2 están prometidos para las próximas semanas.

¿Qué hardware necesito? Una sola GPU de consumo con 24 GB de VRAM (RTX 3090, RTX 4090) para la configuración K-Quant-17 GB, o 32 GB (RTX 5090) para la variante K-Quant-Dynamic. Los Mac Apple Silicon con 32 GB+ de memoria unificada (M4 Max, M5 Max) también pueden ejecutar el stack completo. Un portátil típico de 8 GB o 16 GB no puede.

¿Es esto un reemplazo de Llama? Efectivamente sí. Meta retiró la marca Llama con el lanzamiento de Muse Spark en abril de 2026. Glimmer es el primer modelo Apache 2.0 que reemplaza el linaje de Llama — y lleva una licencia más permisiva de la que Llama tuvo jamás. Glimmer es más pequeño que los últimos modelos Llama pero diseñado para un caso de uso específico, no como reemplazo de propósito general.

¿De dónde vienen los benchmarks? Todos los benchmarks publicados son de la evaluación propia de Meta. No existe aún ninguna reproducción independiente por terceros. Toma las cifras como orientativas — el rendimiento agentivo real en tus herramientas y codebases específicos es lo que importa.

¿Y la seguridad? Meta evaluó Glimmer bajo su Advanced AI Scaling Framework y determinó que no alcanza el umbral de "Frontier AI". El riesgo en las categorías química/biológica, cibernética y pérdida de control se calificó como Moderado o inferior. En Siren AgentDojo, una prueba de inyección de prompts, Glimmer muestra una tasa de éxito de ataque del 28.4% con 94.2 de utilidad. Meta recomienda confirmación humana para acciones irreversibles.

Qué hacer

  1. 1 Download Muse Glimmer from Hugging Face and test it on your own hardware with Ollama 0.32.7 or LM Studio
  2. 2 Benchmark Glimmer against Qwen3.6-27B and Gemma4-31B on your specific agentic workloads — Meta's numbers are vendor-reported, not independently verified
  3. 3 Watch for Muse Spark 1.2 open weights — Meta confirmed they're coming 'in the coming weeks'

Herramientas y modelos afectados

No vuelvas a tener que ponerte al día

El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.

Al suscribirte aceptas nuestra Política de privacidad. Cancela cuando quieras.