GPT-Transcribe Substitui o Whisper — 52% Menos Erros, 25% Mais Barato
- O que aconteceu
- OpenAI released GPT-Transcribe (batch) and GPT-Live-Transcribe (streaming) to the API, replacing Whisper with 52% fewer errors at $4.50/1K minutes — a 25% price cut from GPT-4o Transcribe's $6.00.
- Porque é importante
- Context-aware prompting, keyword hints, and language hints fix Whisper's three biggest failure modes — specialized vocabulary, accented speech, and noisy audio — while costing less than the models they replace.
- O que fazer
- If you're on Whisper or GPT-4o Transcribe, migrate — the API shape is the same and accuracy is dramatically better. If you need real-time streaming, GPT-Live-Transcribe is the new default. Stay on gpt-4o-transcribe-diarize if you need speaker labels or timestamps.
A OpenAI acaba de tornar o Whisper obsoleto. Em 28 de julho, a empresa lançou o GPT-Transcribe e o GPT-Live-Transcribe na API — dois modelos de fala para texto que reduzem os erros de transcrição em 52% custando 25% menos que os modelos que substituem.
GPT-Transcribe lida com transcrição de arquivos em lote e assíncrona a $0,0045 por minuto ($4,50 por 1.000 minutos), abaixo dos $0,006 do GPT-4o Transcribe. GPT-Live-Transcribe transmite deltas de transcrição em tempo real a $0,017 por minuto com latência ajustável — feito para legendagem ao vivo, assistentes de reunião e agentes de voz onde a resposta em fração de segundo importa mais que o custo por minuto.
O que aconteceu
A OpenAI lançou ambos os modelos através dos endpoints existentes /v1/audio/transcriptions e da API Realtime. O GPT-Transcribe é voltado para arquivos de áudio completos; o GPT-Live-Transcribe conecta via WebSocket ou WebRTC para streaming contínuo. Nenhum dos modelos substitui os recursos de voz do ChatGPT — este é um lançamento exclusivo da API.
O número principal é uma redução de erro de 52% no Common Voice em 22 idiomas: o GPT-Transcribe marcou 19,27% de taxa de erro de transcrição contra 40,37% do whisper-1 (AlphaSignal(abre num novo separador), 2026). Em benchmarks independentes, o GPT-Transcribe marca 3,31% AA-WER (Artificial Analysis(abre num novo separador), 2026) — uma melhoria de 0,7 ponto percentual sobre o GPT-4o Transcribe.
O que torna esses modelos diferentes do Whisper é a consciência de contexto. Ambos aceitam três tipos de entrada que o ASR tradicional ignora:
| Tipo de entrada | O que faz | Exemplo |
|---|---|---|
| Prompt de texto | Descreve o tópico da gravação e o vocabulário esperado | "Consulta médica sobre sintomas cardíacos" |
| Lista de palavras-chave | Melhora o reconhecimento de termos de domínio específico | ["miocárdio", "troponina", "ecocardiograma"] |
| Dicas de idioma | Melhora a precisão em fala com sotaque ou multilíngue | Falante dominante em espanhol em contexto inglês |
Esses recursos atacam diretamente onde o Whisper falhava de forma mais consistente: terminologia especializada (médica, jurídica, técnica), fala com sotaque e ambientes ruidosos. O benchmark Context Aware ASR da OpenAI mostra que a injeção de contexto aumenta a precisão semântica em 3–6 pontos percentuais.
Por que isso importa
Uma redução de erro de 52% é um salto geracional para fala para texto. Para quem constrói sobre o Whisper — sumarizadores de reunião, analytics de call center, indexação de conteúdo, ferramentas de acessibilidade — esta é uma atualização direta que custa menos e tem desempenho dramaticamente melhor. O mesmo formato de API e endpoint significa que a migração é uma troca de nome de modelo.
O cenário competitivo é direto: estes não são LLMs e não competem em raciocínio ou codificação. Mas para o trabalho específico de transformar áudio em texto, a OpenAI acaba de estabelecer uma nova referência. Os vereditos recommended em ambos os modelos refletem a combinação de ganhos de precisão, preços mais baixos e prompting sensível ao contexto.
As lacunas são reais, no entanto. Nenhum dos modelos suporta diarização de locutor, timestamps no nível de palavra, saída SRT/VTT ou tradução para inglês. Equipes que precisam de identificação de locutor devem continuar no gpt-4o-transcribe-diarize; as que precisam de timestamps ainda usam o whisper-1.
O que muda para você
Se você está no Whisper ou GPT-4o Transcribe, migre. O GPT-Transcribe aceita o mesmo formato de API com custo mais baixo e maior precisão. O nome do modelo muda; sua estrutura de requisição não.
Se você precisa de streaming em tempo real, o GPT-Live-Transcribe é o novo padrão. Custa cerca de 3,8× o custo por minuto do GPT-Transcribe em lote, mas entrega deltas de transcrição em fração de segundo que a legendagem ao vivo e os agentes de voz exigem.
Fique de olho nas lacunas. Sem diarização, sem timestamps, sem SRT/VTT. Esses recursos não desapareceram — apenas foram divididos em caminhos de modelo separados (gpt-4o-transcribe-diarize, whisper-1). Planeje sua migração de acordo com o que seu pipeline realmente precisa.
FAQ
O Whisper está morto? Para a maioria dos novos projetos, sim. A OpenAI está posicionando o GPT-Transcribe como o ponto de partida recomendado, e a redução de erro de 52% no Common Voice torna difícil justificar o Whisper para trabalho novo. No entanto, o whisper-1 permanece disponível para cargas de trabalho que dependem de timestamps de palavra ou tradução para inglês, que os novos modelos não suportam.
Esses modelos funcionam no ChatGPT? Não. O lançamento é exclusivo da API. Os recursos de voz do ChatGPT rodam em modelos separados (GPT-Live-1 e GPT-Live-1 mini). Esses modelos de transcrição são para desenvolvedores construindo seus próprios pipelines de voz.
Como o prompting sensível ao contexto realmente ajuda? Em vez de tratar cada arquivo de áudio como uma folha em branco, você fornece dicas sobre o que está sendo discutido. Uma transcrição médica com dicas de palavras-chave como "troponina" e "miocárdio" reconhecerá esses termos de forma muito mais confiável do que um modelo genérico. A melhoria é mais dramática em áudio de domínio específico onde o Whisper rotineiramente distorcia vocabulário especializado.
O que fazer
- 1 Add context prompts and keyword lists to your requests — the accuracy gain on domain-specific audio is the biggest differentiator from Whisper
- 2 Swap whisper-1 to gpt-transcribe in your transcription endpoint — same API shape, 52% fewer errors, 25% lower cost
- 3 Replace gpt-realtime-whisper with gpt-live-transcribe for live captioning and voice agent pipelines
- 4 Keep gpt-4o-transcribe-diarize if your pipeline depends on speaker labels or word-level timestamps
Ferramentas e modelos afetados
Nunca mais precisas de te pôr a par
O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.