Grok Voice Think Fast 2.0 se lanza — Voz a voz más rápido a $0.08/min

SpaceXAI logoSpaceXAIFYI30 de julio de 2026Lanzamientos de productos
Qué pasó
SpaceXAI released Grok Voice Think Fast 2.0 — 82.9% AA Quality Index, 0.70s time-to-first-audio, 1.5–2.0× transcription gains, $0.08/min pricing. Grok-Voice-Latest auto-migrates Aug 5.
Por qué importa
Voice AI is iterating faster than text models did at the same stage — and there's no clear winner. Grok Voice 2.0 at API-accessible $0.08/min pressures OpenAI's ChatGPT-only voice strategy.
Qué hacer
Test Grok Voice 2.0 against your voice agent use case before the Aug 5 cutover. Build model-swappable voice architecture — the leader in August won't be the leader in October.

Grok Voice Think Fast 2.0 de SpaceXAI es el nuevo líder en benchmarks de voz a voz — 82.9% en el Índice de Calidad de Artificial Analysis, 0.70s de tiempo hasta el primer audio y una ganancia de 7.2 puntos sobre v1.0. A $0.08/minuto, tiene un precio competitivo frente a un campo de modelos de voz que está iterando más rápido que los modelos de texto en la misma etapa. La migración automática del 5 de agosto de grok-voice-latest significa que cada usuario de la API de Grok Voice obtiene la actualización sin cambios de configuración — pero también significa que si aún no has probado v2.0, tienes seis días.

Qué pasó

SpaceXAI anunció Grok Voice Think Fast 2.0 el 29 de julio a través del blog de x.ai(se abre en una pestaña nueva). El modelo de voz a voz ofrece resultados en cuatro dimensiones:

Liderazgo en benchmarks. En el Índice de Calidad de Voz a Voz de Artificial Analysis, Grok Voice Think Fast 2.0 obtiene 82.9% — por delante de GPT-Realtime-2.1 (79.1%) y Gemini 3.1 Flash (69.5%). Destacados específicos:

MétricaGrok Voice 2.0Grok Voice 1.0GPT-Realtime-2.1Gemini 3.1 Flash
Índice de Calidad AA82.9%75.7%79.1%69.5%
Dinámicas Conversacionales95.1%77.8%95.7%74.3%
Rendimiento Agéntico (τ-voice)56.5%52.1%45.7%37.7%
Tiempo hasta Primer Audio0.70s1.25s2.98s

Precisión de transcripción. Supera a los modelos de transcripción dedicados Deepgram Nova 3 y ElevenLabs Scribe v2 por 1.5–2.0× en 24 idiomas. La brecha se amplía a ~10× en entornos ruidosos del mundo real con compresión telefónica — este es un modelo de voz a voz que maneja la transcripción mejor que las herramientas diseñadas específicamente para voz a texto.

Eficiencia de razonamiento. Grok Voice Think Fast 2.0 usa 0.4× los tokens de razonamiento de v1.0 mientras razona en paralelo con el habla. Las llamadas a herramientas se ejecutan antes del final de la primera frase del agente — más ágil, más barato, misma inteligencia.

Migración automática del 5 de agosto. El endpoint grok-voice-latest transiciona de grok-voice-think-fast-1.0 a grok-voice-think-fast-2.0 el 5 de agosto de 2026. No se requiere acción para actualizar. Para quedarte en v1.0, fija grok-voice-think-fast-1.0 antes de esa fecha.

Precios de $0.08/minuto. Precios de API empresarial sin barrera de suscripción — disponible ahora a través de la consola de x.ai.

Por qué importa

La categoría de modelos de voz está donde estaban los modelos de texto a principios de 2025: iteración rápida, precios agresivos y ningún ganador consolidado. Grok Voice 2.0 a $0.08/minuto con capacidad full-duplex accesible por API es un disparo competitivo directo contra los modelos de voz de OpenAI — que actualmente limitan la voz en tiempo real detrás de suscripciones de ChatGPT sin precios de API independientes para full-duplex.

Para desarrolladores que construyen agentes de voz, asistentes de reuniones o IA conversacional en tiempo real: el panorama de modelos se está fragmentando rápidamente. Ahora tienes GPT-Live (solo ChatGPT, sin API), GPT-Transcribe (por lotes, API), GPT-Live-Transcribe (streaming, API) y Grok Voice 2.0 (full-duplex, API, $0.08/min). Cada uno tiene diferentes compromisos de latencia, precios y acceso a API. La elección correcta depende en gran medida de tu caso de uso — y el panorama se verá diferente para octubre.

SpaceXAI también está usando Grok Voice 2.0 en producción en la línea de soporte al cliente de Starlink (+1 888 GO STARLINK), donde las pruebas A/B mostraron ganancias significativas en conversión de ventas y tasas de contención de soporte. Esa es una señal de validación del mundo real — no solo benchmarks.

Qué cambia para ti

  1. Prueba v2.0 antes del 5 de agosto. Si estás en grok-voice-latest, el cambio es automático. El tiempo de respuesta más rápido de v2.0 y las frases más cortas cambian el ritmo de la conversación — prueba tu integración antes de que el endpoint cambie.
  2. Evalúa contra tu caso de uso de voz, no solo contra benchmarks. El tiempo hasta el primer audio de 0.70s y la puntuación de rendimiento agéntico de 56.5% importan más para agentes de voz en tiempo real que el índice de calidad general. Ejecuta tus propias pruebas de latencia y finalización de tareas.
  3. No te ates a un solo modelo de voz todavía. La categoría está evolucionando más rápido que los modelos de texto en la misma etapa. Construye tu pipeline de voz con arquitectura intercambiable de modelos — el líder en agosto no será necesariamente el líder en octubre.

tldr:

  • happened: SpaceXAI lanzó Grok Voice Think Fast 2.0 — 82.9% en el Índice de Calidad AA, 0.70s de tiempo hasta el primer audio, ganancias de transcripción de 1.5–2.0×, precios de $0.08/min. Grok-Voice-Latest migra automáticamente el 5 de agosto.
  • matters: La IA de voz está iterando más rápido que los modelos de texto en la misma etapa — y no hay un ganador claro. Grok Voice 2.0 a $0.08/min accesible por API presiona la estrategia de voz solo para ChatGPT de OpenAI.
  • action: Prueba Grok Voice 2.0 contra tu caso de uso de agente de voz antes del cambio del 5 de agosto. Construye arquitectura de voz intercambiable de modelos — el líder en agosto no será el líder en octubre.

Herramientas y modelos afectados

No vuelvas a tener que ponerte al día

El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.

Al suscribirte aceptas nuestra Política de privacidad. Cancela cuando quieras.