Grok Voice Think Fast 2.0 se lanza — Voz a voz más rápido a $0.08/min
- Qué pasó
- SpaceXAI released Grok Voice Think Fast 2.0 — 82.9% AA Quality Index, 0.70s time-to-first-audio, 1.5–2.0× transcription gains, $0.08/min pricing. Grok-Voice-Latest auto-migrates Aug 5.
- Por qué importa
- Voice AI is iterating faster than text models did at the same stage — and there's no clear winner. Grok Voice 2.0 at API-accessible $0.08/min pressures OpenAI's ChatGPT-only voice strategy.
- Qué hacer
- Test Grok Voice 2.0 against your voice agent use case before the Aug 5 cutover. Build model-swappable voice architecture — the leader in August won't be the leader in October.
Grok Voice Think Fast 2.0 de SpaceXAI es el nuevo líder en benchmarks de voz a voz — 82.9% en el Índice de Calidad de Artificial Analysis, 0.70s de tiempo hasta el primer audio y una ganancia de 7.2 puntos sobre v1.0. A $0.08/minuto, tiene un precio competitivo frente a un campo de modelos de voz que está iterando más rápido que los modelos de texto en la misma etapa. La migración automática del 5 de agosto de grok-voice-latest significa que cada usuario de la API de Grok Voice obtiene la actualización sin cambios de configuración — pero también significa que si aún no has probado v2.0, tienes seis días.
Qué pasó
SpaceXAI anunció Grok Voice Think Fast 2.0 el 29 de julio a través del blog de x.ai(se abre en una pestaña nueva). El modelo de voz a voz ofrece resultados en cuatro dimensiones:
Liderazgo en benchmarks. En el Índice de Calidad de Voz a Voz de Artificial Analysis, Grok Voice Think Fast 2.0 obtiene 82.9% — por delante de GPT-Realtime-2.1 (79.1%) y Gemini 3.1 Flash (69.5%). Destacados específicos:
| Métrica | Grok Voice 2.0 | Grok Voice 1.0 | GPT-Realtime-2.1 | Gemini 3.1 Flash |
|---|---|---|---|---|
| Índice de Calidad AA | 82.9% | 75.7% | 79.1% | 69.5% |
| Dinámicas Conversacionales | 95.1% | 77.8% | 95.7% | 74.3% |
| Rendimiento Agéntico (τ-voice) | 56.5% | 52.1% | 45.7% | 37.7% |
| Tiempo hasta Primer Audio | 0.70s | 1.25s | — | 2.98s |
Precisión de transcripción. Supera a los modelos de transcripción dedicados Deepgram Nova 3 y ElevenLabs Scribe v2 por 1.5–2.0× en 24 idiomas. La brecha se amplía a ~10× en entornos ruidosos del mundo real con compresión telefónica — este es un modelo de voz a voz que maneja la transcripción mejor que las herramientas diseñadas específicamente para voz a texto.
Eficiencia de razonamiento. Grok Voice Think Fast 2.0 usa 0.4× los tokens de razonamiento de v1.0 mientras razona en paralelo con el habla. Las llamadas a herramientas se ejecutan antes del final de la primera frase del agente — más ágil, más barato, misma inteligencia.
Migración automática del 5 de agosto. El endpoint grok-voice-latest transiciona de grok-voice-think-fast-1.0 a grok-voice-think-fast-2.0 el 5 de agosto de 2026. No se requiere acción para actualizar. Para quedarte en v1.0, fija grok-voice-think-fast-1.0 antes de esa fecha.
Precios de $0.08/minuto. Precios de API empresarial sin barrera de suscripción — disponible ahora a través de la consola de x.ai.
Por qué importa
La categoría de modelos de voz está donde estaban los modelos de texto a principios de 2025: iteración rápida, precios agresivos y ningún ganador consolidado. Grok Voice 2.0 a $0.08/minuto con capacidad full-duplex accesible por API es un disparo competitivo directo contra los modelos de voz de OpenAI — que actualmente limitan la voz en tiempo real detrás de suscripciones de ChatGPT sin precios de API independientes para full-duplex.
Para desarrolladores que construyen agentes de voz, asistentes de reuniones o IA conversacional en tiempo real: el panorama de modelos se está fragmentando rápidamente. Ahora tienes GPT-Live (solo ChatGPT, sin API), GPT-Transcribe (por lotes, API), GPT-Live-Transcribe (streaming, API) y Grok Voice 2.0 (full-duplex, API, $0.08/min). Cada uno tiene diferentes compromisos de latencia, precios y acceso a API. La elección correcta depende en gran medida de tu caso de uso — y el panorama se verá diferente para octubre.
SpaceXAI también está usando Grok Voice 2.0 en producción en la línea de soporte al cliente de Starlink (+1 888 GO STARLINK), donde las pruebas A/B mostraron ganancias significativas en conversión de ventas y tasas de contención de soporte. Esa es una señal de validación del mundo real — no solo benchmarks.
Qué cambia para ti
- Prueba v2.0 antes del 5 de agosto. Si estás en
grok-voice-latest, el cambio es automático. El tiempo de respuesta más rápido de v2.0 y las frases más cortas cambian el ritmo de la conversación — prueba tu integración antes de que el endpoint cambie. - Evalúa contra tu caso de uso de voz, no solo contra benchmarks. El tiempo hasta el primer audio de 0.70s y la puntuación de rendimiento agéntico de 56.5% importan más para agentes de voz en tiempo real que el índice de calidad general. Ejecuta tus propias pruebas de latencia y finalización de tareas.
- No te ates a un solo modelo de voz todavía. La categoría está evolucionando más rápido que los modelos de texto en la misma etapa. Construye tu pipeline de voz con arquitectura intercambiable de modelos — el líder en agosto no será necesariamente el líder en octubre.
tldr:
- happened: SpaceXAI lanzó Grok Voice Think Fast 2.0 — 82.9% en el Índice de Calidad AA, 0.70s de tiempo hasta el primer audio, ganancias de transcripción de 1.5–2.0×, precios de $0.08/min. Grok-Voice-Latest migra automáticamente el 5 de agosto.
- matters: La IA de voz está iterando más rápido que los modelos de texto en la misma etapa — y no hay un ganador claro. Grok Voice 2.0 a $0.08/min accesible por API presiona la estrategia de voz solo para ChatGPT de OpenAI.
- action: Prueba Grok Voice 2.0 contra tu caso de uso de agente de voz antes del cambio del 5 de agosto. Construye arquitectura de voz intercambiable de modelos — el líder en agosto no será el líder en octubre.
Herramientas y modelos afectados
No vuelvas a tener que ponerte al día
El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.