Sakana Fugu: orquestación multi-agente como modelo
- Qué pasó
- Sakana AI launched Fugu, a multi-agent orchestration model that coordinates frontier models behind a single API — two tiers, OpenAI-compatible, backed by two ICLR 2026 papers.
- Por qué importa
- Fugu Ultra beats GPT 5.5, Opus 4.8, and Gemini 3.1 Pro on SWE Bench Pro and Humanity's Last Exam at $5/$30 per 1M tokens — it's a new category of model that competes on coordination, not parameter count.
- Qué hacer
- Try Fugu in any OpenAI-compatible client as a complement to your stack; don't switch your primary model yet — EU teams should wait for GDPR compliance.
Sakana AI lanzó Fugu el 22 de junio de 2026 — un modelo de orquestación multi-agente que coordina modelos de frontera tras una única API compatible con OpenAI. Fugu Ultra registra puntuaciones que superan a GPT 5.5, Opus 4.8 y Gemini 3.1 Pro en SWE Bench Pro (73.7 vs. 58.6) y Humanity's Last Exam (50.0 vs. 41.4), a $5 por 1M de tokens de entrada y $30 por 1M de tokens de salida. Nuestro veredicto: Watch. Dos artículos de ICLR 2026 respaldan la arquitectura, pero es el primer día — sin historial en producción, sin disponibilidad en la UE y los precios introducen un nuevo modelo mental para el cálculo de costos. Lo probaremos y volveremos con una recomendación.
Qué ocurrió
Sakana AI lanzó Fugu basado en dos artículos de ICLR 2026: TRINITY (un coordinador LLM evolucionado) y Conductor (orquestación de agentes basada en aprendizaje por refuerzo). En lugar de prescribir roles de equipo fijos o flujos de trabajo diseñados manualmente, Fugu aprende a ensamblar agentes dinámicamente desde un pool, asignarles roles de Thinker, Worker o Verifier, y coordinarlos mediante patrones de colaboración que los humanos no diseñarían.
Se lanzan dos niveles:
- Fugu — latencia y calidad equilibradas. Diseñado para programación cotidiana y trabajo interactivo. Puedes configurar qué modelos entran en el pool, excluyendo proveedores específicos para cumplir con requisitos de privacidad.
- Fugu Ultra — pool de agentes más profundo, tiempos de respuesta más largos, optimizado para razonamiento complejo de múltiples pasos. Pool fijo y propietario — no puedes ver qué modelos usó.
Ambos niveles exponen un único endpoint compatible con OpenAI.
Benchmarks que exigen atención
Las puntuaciones de Fugu Ultra en benchmarks rigurosos de ingeniería y razonamiento superan o igualan a los modelos de frontera disponibles públicamente:
| Benchmark | Fugu Ultra | Opus 4.8 | Gemini 3.1 Pro | GPT 5.5 |
|---|---|---|---|---|
| SWE Bench Pro | 73.7 | 69.2 | 54.2 | 58.6 |
| LiveCodeBench | 93.2 | 87.8 | 88.5 | 85.3 |
| Humanity's Last Exam | 50.0 | 49.8 | 44.4 | 41.4 |
| GPQA-D | 95.5 | 92.0 | 94.3 | 93.6 |
Por qué importa
Fugu no es otro LLM — es una nueva categoría. No compite en cantidad de parámetros; compite en coordinación. El modelo aprende qué agentes desplegar para cada subtarea y cómo interpretar sus resultados, produciendo resultados que superan a cualquier modelo individual del pool.
Dos limitaciones importan ahora. Primero, Fugu no está disponible en los estados miembros de la UE/EEE mientras Sakana trabaja en el cumplimiento del GDPR. Segundo, el pool de Fugu Ultra es fijo y propietario — no puedes auditar qué modelos gestionaron tu consulta.
Qué cambia para ti
- Prueba Fugu (no Ultra) primero. El nivel equilibrado te da la experiencia de orquestación sin la mayor latencia y costo de Ultra.
- Mantén tu modelo principal. Usa Fugu como complemento hasta que demuestre su valía en producción.
- Equipos de la UE/EEE: esperad. Sakana bloquea explícitamente el servicio en esas regiones mientras se tramita el cumplimiento del GDPR.
- Atentos a nuestros resultados de pruebas. Volveremos con una recomendación.
Preguntas frecuentes
¿Qué diferencia a Fugu de usar múltiples modelos por tu cuenta? Fugu aprende estrategias de coordinación mediante entrenamiento, no mediante ingeniería manual de prompts — obtienes el beneficio sin la carga de ingeniería.
¿Puedo ver qué modelos subyacentes usó Fugu Ultra? No. La selección y el enrutamiento de modelos son propietarios.
¿Cómo se comparan los precios de Fugu con usar modelos de frontera directamente? Los $5/$30 de Fugu Ultra se comparan favorablemente con los precios directos de las APIs de frontera, especialmente considerando la orquestación multi-modelo tras un único endpoint.
Qué hacer
- 1 Try Fugu in any OpenAI-compatible client — same API, no SDK migration
- 2 Keep your primary model; use Fugu as a complement until it proves itself in production
- 3 Wait for EU/EEA availability if you operate in those regions
- 4 Watch for our test results — we'll return with a recommendation
Herramientas y modelos afectados
No vuelvas a tener que ponerte al día
El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.