Grok Voice Think Fast 2.0 É Lançado — Speech-to-Speech Mais Rápido a $0,08/Min

SpaceXAI logoSpaceXAIFYI30 de julho de 2026Lançamentos de produtos
O que aconteceu
SpaceXAI released Grok Voice Think Fast 2.0 — 82.9% AA Quality Index, 0.70s time-to-first-audio, 1.5–2.0× transcription gains, $0.08/min pricing. Grok-Voice-Latest auto-migrates Aug 5.
Porque é importante
Voice AI is iterating faster than text models did at the same stage — and there's no clear winner. Grok Voice 2.0 at API-accessible $0.08/min pressures OpenAI's ChatGPT-only voice strategy.
O que fazer
Test Grok Voice 2.0 against your voice agent use case before the Aug 5 cutover. Build model-swappable voice architecture — the leader in August won't be the leader in October.

O Grok Voice Think Fast 2.0 da SpaceXAI é o novo líder de benchmark em speech-to-speech — 82,9% no Quality Index da Artificial Analysis, 0,70s de tempo até o primeiro áudio e um ganho de 7,2 pontos sobre a v1.0. A $0,08/minuto, tem preço competitivo em um campo de modelos de voz que está iterando mais rápido do que os modelos de texto na mesma fase. A migração automática do grok-voice-latest em 5 de agosto significa que todo usuário da API Grok Voice recebe a atualização sem nenhuma mudança de configuração — mas também significa que se você ainda não testou a v2.0, tem seis dias.

O Que Aconteceu

A SpaceXAI anunciou o Grok Voice Think Fast 2.0 em 29 de julho via blog x.ai(abre num novo separador). O modelo speech-to-speech entrega resultados em quatro dimensões:

Liderança em benchmarks. No Speech-to-Speech Quality Index da Artificial Analysis, o Grok Voice Think Fast 2.0 marca 82,9% — à frente do GPT-Realtime-2.1 (79,1%) e Gemini 3.1 Flash (69,5%). Destaques específicos:

MétricaGrok Voice 2.0Grok Voice 1.0GPT-Realtime-2.1Gemini 3.1 Flash
AA Quality Index82,9%75,7%79,1%69,5%
Dinâmica Conversacional95,1%77,8%95,7%74,3%
Performance Agentiva (τ-voice)56,5%52,1%45,7%37,7%
Tempo até Primeiro Áudio0,70s1,25s2,98s

Precisão de transcrição. Supera modelos de transcrição dedicados Deepgram Nova 3 e ElevenLabs Scribe v2 por 1,5–2,0× em 24 idiomas. A diferença aumenta para ~10× em ambientes ruidosos do mundo real com compressão de telefonia — este é um modelo speech-to-speech que lida com transcrição melhor do que ferramentas de speech-to-text criadas especificamente para isso.

Eficiência de raciocínio. O Grok Voice Think Fast 2.0 usa 0,4× os tokens de raciocínio da v1.0 enquanto raciocina em paralelo com a fala. Chamadas de ferramentas são executadas antes do fim da primeira frase do agente — mais ágil, mais barato, mesma inteligência.

Migração automática em 5 de agosto. O endpoint grok-voice-latest faz a transição de grok-voice-think-fast-1.0 para grok-voice-think-fast-2.0 em 5 de agosto de 2026. Nenhuma ação necessária para atualizar. Para permanecer na v1.0, fixe grok-voice-think-fast-1.0 antes disso.

Preço de $0,08/minuto. Preços empresariais via API sem barreira de assinatura — disponível agora pelo console x.ai.

Por Que Isso Importa

A categoria de modelos de voz está onde os modelos de texto estavam no início de 2025: iteração rápida, preços agressivos e nenhum vencedor estabelecido. Grok Voice 2.0 a $0,08/minuto com capacidade full-duplex acessível via API é um tiro competitivo direto na linha d'água dos modelos de voz da OpenAI — que atualmente fecham voz em tempo real atrás de assinaturas ChatGPT, sem preços de API autônomos para full-duplex.

Para desenvolvedores que constroem agentes de voz, assistentes de reunião ou IA conversacional em tempo real: o cenário de modelos está se fragmentando rapidamente. Agora você tem GPT-Live (apenas ChatGPT, sem API), GPT-Transcribe (batch, API), GPT-Live-Transcribe (streaming, API) e Grok Voice 2.0 (full-duplex, API, $0,08/min). Cada um tem tradeoffs diferentes de latência, preço e acesso à API. A escolha certa depende fortemente do seu caso de uso — e o cenário estará diferente até outubro.

A SpaceXAI também está usando o Grok Voice 2.0 em produção na linha de suporte ao cliente da Starlink (+1 888 GO STARLINK), onde testes A/B mostraram ganhos significativos em conversão de vendas e taxas de resolução no primeiro contato. É um sinal de validação no mundo real — não apenas benchmarks.

O Que Muda para Você

  1. Teste a v2.0 antes de 5 de agosto. Se você está no grok-voice-latest, a transição é automática. O tempo de resposta mais rápido e frases mais curtas da v2.0 mudam o ritmo da conversa — teste sua integração antes que o endpoint mude.
  2. Faça benchmark contra seu caso de uso de voz, não apenas leaderboards. Os 0,70s de tempo até o primeiro áudio e 56,5% de performance agentiva importam mais para agentes de voz em tempo real do que o índice de qualidade geral. Execute seus próprios testes de latência e conclusão de tarefas.
  3. Não se prenda a um único modelo de voz ainda. A categoria está evoluindo mais rápido do que modelos de texto na mesma fase. Construa seu pipeline de voz com arquitetura que permita trocar de modelo — o líder em agosto não será necessariamente o líder em outubro.

Ferramentas e modelos afetados

Nunca mais precisas de te pôr a par

O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.

Ao subscreveres, aceitas a nossa Política de Privacidade. Cancela a subscrição quando quiseres.