Grok Voice Think Fast 2.0 est lancé — du speech-to-speech plus rapide à 0,08 $/min

SpaceXAI logoSpaceXAIFYI30 juillet 2026Lancements de produits
Ce qui s’est passé
SpaceXAI released Grok Voice Think Fast 2.0 — 82.9% AA Quality Index, 0.70s time-to-first-audio, 1.5–2.0× transcription gains, $0.08/min pricing. Grok-Voice-Latest auto-migrates Aug 5.
Pourquoi c’est important
Voice AI is iterating faster than text models did at the same stage — and there's no clear winner. Grok Voice 2.0 at API-accessible $0.08/min pressures OpenAI's ChatGPT-only voice strategy.
Que faire
Test Grok Voice 2.0 against your voice agent use case before the Aug 5 cutover. Build model-swappable voice architecture — the leader in August won't be the leader in October.

Grok Voice Think Fast 2.0 de SpaceXAI est le nouveau leader des benchmarks speech-to-speech — 82,9 % sur l'Indice de Qualité d'Artificial Analysis, 0,70 s de temps jusqu'au premier son, et un gain de 7,2 points par rapport à la v1.0. À 0,08 $/minute, il est compétitif face à un marché des modèles vocaux qui itère plus vite que les modèles textuels ne le faisaient au même stade. La migration automatique du 5 août de grok-voice-latest signifie que chaque utilisateur de l'API Grok Voice obtient la mise à niveau sans aucun changement de configuration — mais cela signifie aussi que si vous n'avez pas encore testé la v2.0, il vous reste six jours.

Ce qui s'est passé

SpaceXAI a annoncé Grok Voice Think Fast 2.0 le 29 juillet via le blog x.ai. Le modèle speech-to-speech livre sur quatre dimensions :

Leadership des benchmarks. Sur l'Indice de Qualité Speech-to-Speech d'Artificial Analysis, Grok Voice Think Fast 2.0 obtient 82,9 % — devant GPT-Realtime-2.1 (79,1 %) et Gemini 3.1 Flash (69,5 %). Points saillants :

MétriqueGrok Voice 2.0Grok Voice 1.0GPT-Realtime-2.1Gemini 3.1 Flash
Indice de Qualité AA82,9 %75,7 %79,1 %69,5 %
Dynamique conversationnelle95,1 %77,8 %95,7 %74,3 %
Performance agentique (τ-voice)56,5 %52,1 %45,7 %37,7 %
Temps jusqu'au premier son0,70 s1,25 s2,98 s

Précision de transcription. Surpasse les modèles de transcription dédiés Deepgram Nova 3 et ElevenLabs Scribe v2 d'un facteur 1,5 à 2,0× sur 24 langues. L'écart s'élargit à environ 10× dans des environnements réels bruyants avec compression téléphonique — c'est un modèle speech-to-speech qui gère mieux la transcription que des outils de speech-to-text dédiés.

Efficacité de raisonnement. Grok Voice Think Fast 2.0 utilise 0,4× les tokens de raisonnement de la v1.0 tout en raisonnant en parallèle avec la parole. Les appels d'outils s'exécutent avant la fin de la première phrase de l'agent — plus réactif, moins cher, même intelligence.

Migration automatique du 5 août. Le point de terminaison grok-voice-latest passe de grok-voice-think-fast-1.0 à grok-voice-think-fast-2.0 le 5 août 2026. Aucune action nécessaire pour mettre à niveau. Pour rester sur la v1.0, épinglez grok-voice-think-fast-1.0 avant cette date.

Tarif de 0,08 $/minute. Tarification API entreprise sans barrière d'abonnement — disponible dès maintenant via la console x.ai.

Pourquoi c'est important

La catégorie des modèles vocaux est là où étaient les modèles textuels début 2025 : itération rapide, tarification agressive et aucun gagnant établi. Grok Voice 2.0 à 0,08 $/minute avec une capacité full-duplex accessible par API est un tir direct contre les modèles vocaux d'OpenAI — qui réservent actuellement la voix en temps réel aux abonnements ChatGPT sans tarification API autonome pour le full-duplex.

Pour les développeurs qui construisent des agents vocaux, des assistants de réunion ou de l'IA conversationnelle en temps réel : le paysage des modèles se fragmente rapidement. Vous avez maintenant GPT-Live (ChatGPT uniquement, pas d'API), GPT-Transcribe (batch, API), GPT-Live-Transcribe (streaming, API) et Grok Voice 2.0 (full-duplex, API, 0,08 $/min). Chacun a des compromis différents de latence, de tarification et d'accès API. Le bon choix dépend fortement de votre cas d'usage — et le paysage sera différent d'ici octobre.

SpaceXAI utilise également Grok Voice 2.0 en production sur la ligne de support client Starlink (+1 888 GO STARLINK), où des tests A/B ont montré des gains significatifs en conversion de vente et en taux de résolution autonome. C'est un signal de validation réel — pas seulement des benchmarks.

Ce qui change pour vous

  1. Testez la v2.0 avant le 5 août. Si vous êtes sur grok-voice-latest, le basculement est automatique. Le temps de réponse plus rapide de la v2.0 et ses phrases plus courtes changent le rythme de la conversation — testez votre intégration avant le basculement du point de terminaison.
  2. Benchmarkez par rapport à votre cas d'usage vocal, pas seulement les classements. Le temps jusqu'au premier son de 0,70 s et le score de performance agentique de 56,5 % importent plus pour les agents vocaux en temps réel que l'indice de qualité global. Exécutez vos propres tests de latence et de complétion de tâches.
  3. Ne vous verrouillez pas encore sur un seul modèle vocal. La catégorie évolue plus vite que les modèles textuels ne le faisaient au même stade. Construisez votre pipeline vocal avec une architecture interchangeable — le leader en août ne sera pas nécessairement le leader en octobre.

Outils et modèles concernés

Ne ratez plus jamais une mise à jour

Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.

En vous abonnant, vous acceptez notre Politique de confidentialité. Désabonnement à tout moment.