Grok Voice Think Fast 2.0 veröffentlicht – schnellere Speech-to-Speech zu 0,08 USD/Min.

SpaceXAI logoSpaceXAIFYI30. Juli 2026Produkteinführungen
Was ist passiert
SpaceXAI released Grok Voice Think Fast 2.0 — 82.9% AA Quality Index, 0.70s time-to-first-audio, 1.5–2.0× transcription gains, $0.08/min pricing. Grok-Voice-Latest auto-migrates Aug 5.
Warum es wichtig ist
Voice AI is iterating faster than text models did at the same stage — and there's no clear winner. Grok Voice 2.0 at API-accessible $0.08/min pressures OpenAI's ChatGPT-only voice strategy.
Was zu tun ist
Test Grok Voice 2.0 against your voice agent use case before the Aug 5 cutover. Build model-swappable voice architecture — the leader in August won't be the leader in October.

SpaceXAIs Grok Voice Think Fast 2.0 ist der neue Speech-to-Speech-Benchmark-Spitzenreiter – 82,9 % im Quality Index von Artificial Analysis, 0,70 s Time-to-First-Audio und ein Zugewinn von 7,2 Punkten gegenüber v1.0. Zu 0,08 USD/Minute ist es wettbewerbsfähig bepreist in einem Voice-Model-Feld, das schneller iteriert, als es Textmodelle in derselben Phase taten. Die automatische Migration von grok-voice-latest am 5. August bedeutet, dass jeder Grok-Voice-API-Nutzer das Upgrade ohne Konfigurationsänderungen erhält – aber es bedeutet auch: Wer v2.0 noch nicht getestet hat, hat noch sechs Tage.

Was passiert ist

SpaceXAI kündigte Grok Voice Think Fast 2.0 am 29. Juli über den x.ai-Blog(wird in einem neuen Tab geöffnet) an. Das Speech-to-Speech-Modell liefert in vier Dimensionen:

Benchmark-Führerschaft. Im Speech-to-Speech Quality Index von Artificial Analysis erreicht Grok Voice Think Fast 2.0 82,9 % – vor GPT-Realtime-2.1 (79,1 %) und Gemini 3.1 Flash (69,5 %). Ausgewählte Highlights:

MetrikGrok Voice 2.0Grok Voice 1.0GPT-Realtime-2.1Gemini 3.1 Flash
AA Quality Index82,9 %75,7 %79,1 %69,5 %
Conversational Dynamics95,1 %77,8 %95,7 %74,3 %
Agentic Performance (τ-voice)56,5 %52,1 %45,7 %37,7 %
Time to First Audio0,70 s1,25 s2,98 s

Transkriptionsgenauigkeit. Übertrifft die dedizierten Transkriptionsmodelle Deepgram Nova 3 und ElevenLabs Scribe v2 um das 1,5- bis 2,0-Fache in 24 Sprachen. Der Abstand vergrößert sich auf etwa das 10-Fache in lauten, realen Umgebungen mit Telefoniekompression – dies ist ein Speech-to-Speech-Modell, das Transkription besser beherrscht als speziell dafür entwickelte Speech-to-Text-Tools.

Reasoning-Effizienz. Grok Voice Think Fast 2.0 verbraucht das 0,4-Fache der Reasoning-Tokens von v1.0 und führt Reasoning parallel zur Sprachausgabe durch. Tool-Aufrufe werden noch vor Ende des ersten Satzes des Agenten ausgeführt – schneller, günstiger, gleiche Intelligenz.

Automatische Migration am 5. August. Der grok-voice-latest-Endpunkt wechselt am 5. August 2026 von grok-voice-think-fast-1.0 auf grok-voice-think-fast-2.0. Keine Aktion zum Upgrade erforderlich. Um auf v1.0 zu bleiben, pinnen Sie grok-voice-think-fast-1.0 vor diesem Datum.

0,08 USD/Minute-Preise. Enterprise-API-Preise ohne Abonnement-Hürde – jetzt verfügbar über die x.ai-Konsole.

Warum es zählt

Die Voice-Model-Kategorie ist dort, wo Textmodelle Anfang 2025 waren: schnelle Iteration, aggressive Preise und kein etablierter Gewinner. Grok Voice 2.0 zu 0,08 USD/Minute mit API-zugänglicher Vollduplex-Fähigkeit ist ein gezielter Wettbewerbsschlag gegen die Voice-Modelle von OpenAI – die derzeit Echtzeit-Sprache hinter ChatGPT-Abonnements verstecken, ohne eigenständige API-Preise für Vollduplex.

Für Entwickler, die Voice-Agenten, Meeting-Assistenten oder konversationelle KI in Echtzeit bauen: Die Modelllandschaft fragmentiert sich rasant. Sie haben nun GPT-Live (nur ChatGPT, keine API), GPT-Transcribe (Batch, API), GPT-Live-Transcribe (Streaming, API) und Grok Voice 2.0 (Vollduplex, API, 0,08 USD/Min.). Jedes hat unterschiedliche Latenz-, Preis- und API-Zugangskompromisse. Die richtige Wahl hängt stark vom Anwendungsfall ab – und die Landschaft wird bis Oktober anders aussehen.

SpaceXAI setzt Grok Voice 2.0 zudem produktiv in der Starlink-Kundenbetreuung ein (+1 888 GO STARLINK), wo A/B-Tests signifikante Gewinne bei Verkaufsabschlüssen und Support-Containment-Raten zeigten. Das ist ein reales Validierungssignal – nicht nur Benchmarks.

Was sich für Sie ändert

  1. v2.0 vor dem 5. August testen. Wer grok-voice-latest nutzt, erlebt eine automatische Umstellung. Die schnellere Antwortzeit und kürzeren Sätze von v2.0 verändern das Gesprächstempo – testen Sie Ihre Integration vor dem Endpunkt-Wechsel.
  2. Gegen Ihren Voice-Anwendungsfall benchmarken, nicht nur gegen Leaderboards. Die 0,70 s Time-to-First-Audio und der agentische Leistungswert von 56,5 % zählen für Echtzeit-Voice-Agenten mehr als der Gesamt-Quality-Index. Führen Sie eigene Latenz- und Aufgabenerledigungstests durch.
  3. Noch nicht auf ein einzelnes Voice-Modell festlegen. Die Kategorie entwickelt sich schneller, als Textmodelle es in derselben Phase taten. Bauen Sie Ihre Voice-Pipeline mit modell-austauschbarer Architektur – der Spitzenreiter im August ist nicht zwangsläufig der Spitzenreiter im Oktober.

Betroffene Tools & Modelle

Nie wieder etwas verpassen

Das wöchentliche Delta — nur Urteilsänderungen und dringende Punkte. Kein Füllmaterial.

Mit dem Abonnieren stimmst du unserer Datenschutzerklärung zu. Jederzeit abbestellbar.