Grok Voice Think Fast 2.0 É Lançado — Speech-to-Speech Mais Rápido a $0,08/Min
- O que aconteceu
- SpaceXAI released Grok Voice Think Fast 2.0 — 82.9% AA Quality Index, 0.70s time-to-first-audio, 1.5–2.0× transcription gains, $0.08/min pricing. Grok-Voice-Latest auto-migrates Aug 5.
- Porque é importante
- Voice AI is iterating faster than text models did at the same stage — and there's no clear winner. Grok Voice 2.0 at API-accessible $0.08/min pressures OpenAI's ChatGPT-only voice strategy.
- O que fazer
- Test Grok Voice 2.0 against your voice agent use case before the Aug 5 cutover. Build model-swappable voice architecture — the leader in August won't be the leader in October.
O Grok Voice Think Fast 2.0 da SpaceXAI é o novo líder de benchmark em speech-to-speech — 82,9% no Quality Index da Artificial Analysis, 0,70s de tempo até o primeiro áudio e um ganho de 7,2 pontos sobre a v1.0. A $0,08/minuto, tem preço competitivo em um campo de modelos de voz que está iterando mais rápido do que os modelos de texto na mesma fase. A migração automática do grok-voice-latest em 5 de agosto significa que todo usuário da API Grok Voice recebe a atualização sem nenhuma mudança de configuração — mas também significa que se você ainda não testou a v2.0, tem seis dias.
O Que Aconteceu
A SpaceXAI anunciou o Grok Voice Think Fast 2.0 em 29 de julho via blog x.ai(abre num novo separador). O modelo speech-to-speech entrega resultados em quatro dimensões:
Liderança em benchmarks. No Speech-to-Speech Quality Index da Artificial Analysis, o Grok Voice Think Fast 2.0 marca 82,9% — à frente do GPT-Realtime-2.1 (79,1%) e Gemini 3.1 Flash (69,5%). Destaques específicos:
| Métrica | Grok Voice 2.0 | Grok Voice 1.0 | GPT-Realtime-2.1 | Gemini 3.1 Flash |
|---|---|---|---|---|
| AA Quality Index | 82,9% | 75,7% | 79,1% | 69,5% |
| Dinâmica Conversacional | 95,1% | 77,8% | 95,7% | 74,3% |
| Performance Agentiva (τ-voice) | 56,5% | 52,1% | 45,7% | 37,7% |
| Tempo até Primeiro Áudio | 0,70s | 1,25s | — | 2,98s |
Precisão de transcrição. Supera modelos de transcrição dedicados Deepgram Nova 3 e ElevenLabs Scribe v2 por 1,5–2,0× em 24 idiomas. A diferença aumenta para ~10× em ambientes ruidosos do mundo real com compressão de telefonia — este é um modelo speech-to-speech que lida com transcrição melhor do que ferramentas de speech-to-text criadas especificamente para isso.
Eficiência de raciocínio. O Grok Voice Think Fast 2.0 usa 0,4× os tokens de raciocínio da v1.0 enquanto raciocina em paralelo com a fala. Chamadas de ferramentas são executadas antes do fim da primeira frase do agente — mais ágil, mais barato, mesma inteligência.
Migração automática em 5 de agosto. O endpoint grok-voice-latest faz a transição de grok-voice-think-fast-1.0 para grok-voice-think-fast-2.0 em 5 de agosto de 2026. Nenhuma ação necessária para atualizar. Para permanecer na v1.0, fixe grok-voice-think-fast-1.0 antes disso.
Preço de $0,08/minuto. Preços empresariais via API sem barreira de assinatura — disponível agora pelo console x.ai.
Por Que Isso Importa
A categoria de modelos de voz está onde os modelos de texto estavam no início de 2025: iteração rápida, preços agressivos e nenhum vencedor estabelecido. Grok Voice 2.0 a $0,08/minuto com capacidade full-duplex acessível via API é um tiro competitivo direto na linha d'água dos modelos de voz da OpenAI — que atualmente fecham voz em tempo real atrás de assinaturas ChatGPT, sem preços de API autônomos para full-duplex.
Para desenvolvedores que constroem agentes de voz, assistentes de reunião ou IA conversacional em tempo real: o cenário de modelos está se fragmentando rapidamente. Agora você tem GPT-Live (apenas ChatGPT, sem API), GPT-Transcribe (batch, API), GPT-Live-Transcribe (streaming, API) e Grok Voice 2.0 (full-duplex, API, $0,08/min). Cada um tem tradeoffs diferentes de latência, preço e acesso à API. A escolha certa depende fortemente do seu caso de uso — e o cenário estará diferente até outubro.
A SpaceXAI também está usando o Grok Voice 2.0 em produção na linha de suporte ao cliente da Starlink (+1 888 GO STARLINK), onde testes A/B mostraram ganhos significativos em conversão de vendas e taxas de resolução no primeiro contato. É um sinal de validação no mundo real — não apenas benchmarks.
O Que Muda para Você
- Teste a v2.0 antes de 5 de agosto. Se você está no
grok-voice-latest, a transição é automática. O tempo de resposta mais rápido e frases mais curtas da v2.0 mudam o ritmo da conversa — teste sua integração antes que o endpoint mude. - Faça benchmark contra seu caso de uso de voz, não apenas leaderboards. Os 0,70s de tempo até o primeiro áudio e 56,5% de performance agentiva importam mais para agentes de voz em tempo real do que o índice de qualidade geral. Execute seus próprios testes de latência e conclusão de tarefas.
- Não se prenda a um único modelo de voz ainda. A categoria está evoluindo mais rápido do que modelos de texto na mesma fase. Construa seu pipeline de voz com arquitetura que permita trocar de modelo — o líder em agosto não será necessariamente o líder em outubro.
Ferramentas e modelos afetados
Nunca mais precisas de te pôr a par
O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.