GPT-Transcribe Substitui o Whisper — 52% Menos Erros, 25% Mais Barato

OpenAI logoOpenAIFYI29 de julho de 2026Modelos
O que aconteceu
OpenAI released GPT-Transcribe (batch) and GPT-Live-Transcribe (streaming) to the API, replacing Whisper with 52% fewer errors at $4.50/1K minutes — a 25% price cut from GPT-4o Transcribe's $6.00.
Porque é importante
Context-aware prompting, keyword hints, and language hints fix Whisper's three biggest failure modes — specialized vocabulary, accented speech, and noisy audio — while costing less than the models they replace.
O que fazer
If you're on Whisper or GPT-4o Transcribe, migrate — the API shape is the same and accuracy is dramatically better. If you need real-time streaming, GPT-Live-Transcribe is the new default. Stay on gpt-4o-transcribe-diarize if you need speaker labels or timestamps.

A OpenAI acaba de tornar o Whisper obsoleto. Em 28 de julho, a empresa lançou o GPT-Transcribe e o GPT-Live-Transcribe na API — dois modelos de fala para texto que reduzem os erros de transcrição em 52% custando 25% menos que os modelos que substituem.

GPT-Transcribe lida com transcrição de arquivos em lote e assíncrona a $0,0045 por minuto ($4,50 por 1.000 minutos), abaixo dos $0,006 do GPT-4o Transcribe. GPT-Live-Transcribe transmite deltas de transcrição em tempo real a $0,017 por minuto com latência ajustável — feito para legendagem ao vivo, assistentes de reunião e agentes de voz onde a resposta em fração de segundo importa mais que o custo por minuto.

O que aconteceu

A OpenAI lançou ambos os modelos através dos endpoints existentes /v1/audio/transcriptions e da API Realtime. O GPT-Transcribe é voltado para arquivos de áudio completos; o GPT-Live-Transcribe conecta via WebSocket ou WebRTC para streaming contínuo. Nenhum dos modelos substitui os recursos de voz do ChatGPT — este é um lançamento exclusivo da API.

O número principal é uma redução de erro de 52% no Common Voice em 22 idiomas: o GPT-Transcribe marcou 19,27% de taxa de erro de transcrição contra 40,37% do whisper-1 (AlphaSignal(abre num novo separador), 2026). Em benchmarks independentes, o GPT-Transcribe marca 3,31% AA-WER (Artificial Analysis(abre num novo separador), 2026) — uma melhoria de 0,7 ponto percentual sobre o GPT-4o Transcribe.

O que torna esses modelos diferentes do Whisper é a consciência de contexto. Ambos aceitam três tipos de entrada que o ASR tradicional ignora:

Tipo de entradaO que fazExemplo
Prompt de textoDescreve o tópico da gravação e o vocabulário esperado"Consulta médica sobre sintomas cardíacos"
Lista de palavras-chaveMelhora o reconhecimento de termos de domínio específico["miocárdio", "troponina", "ecocardiograma"]
Dicas de idiomaMelhora a precisão em fala com sotaque ou multilíngueFalante dominante em espanhol em contexto inglês

Esses recursos atacam diretamente onde o Whisper falhava de forma mais consistente: terminologia especializada (médica, jurídica, técnica), fala com sotaque e ambientes ruidosos. O benchmark Context Aware ASR da OpenAI mostra que a injeção de contexto aumenta a precisão semântica em 3–6 pontos percentuais.

Por que isso importa

Uma redução de erro de 52% é um salto geracional para fala para texto. Para quem constrói sobre o Whisper — sumarizadores de reunião, analytics de call center, indexação de conteúdo, ferramentas de acessibilidade — esta é uma atualização direta que custa menos e tem desempenho dramaticamente melhor. O mesmo formato de API e endpoint significa que a migração é uma troca de nome de modelo.

O cenário competitivo é direto: estes não são LLMs e não competem em raciocínio ou codificação. Mas para o trabalho específico de transformar áudio em texto, a OpenAI acaba de estabelecer uma nova referência. Os vereditos recommended em ambos os modelos refletem a combinação de ganhos de precisão, preços mais baixos e prompting sensível ao contexto.

As lacunas são reais, no entanto. Nenhum dos modelos suporta diarização de locutor, timestamps no nível de palavra, saída SRT/VTT ou tradução para inglês. Equipes que precisam de identificação de locutor devem continuar no gpt-4o-transcribe-diarize; as que precisam de timestamps ainda usam o whisper-1.

O que muda para você

Se você está no Whisper ou GPT-4o Transcribe, migre. O GPT-Transcribe aceita o mesmo formato de API com custo mais baixo e maior precisão. O nome do modelo muda; sua estrutura de requisição não.

Se você precisa de streaming em tempo real, o GPT-Live-Transcribe é o novo padrão. Custa cerca de 3,8× o custo por minuto do GPT-Transcribe em lote, mas entrega deltas de transcrição em fração de segundo que a legendagem ao vivo e os agentes de voz exigem.

Fique de olho nas lacunas. Sem diarização, sem timestamps, sem SRT/VTT. Esses recursos não desapareceram — apenas foram divididos em caminhos de modelo separados (gpt-4o-transcribe-diarize, whisper-1). Planeje sua migração de acordo com o que seu pipeline realmente precisa.

FAQ

O Whisper está morto? Para a maioria dos novos projetos, sim. A OpenAI está posicionando o GPT-Transcribe como o ponto de partida recomendado, e a redução de erro de 52% no Common Voice torna difícil justificar o Whisper para trabalho novo. No entanto, o whisper-1 permanece disponível para cargas de trabalho que dependem de timestamps de palavra ou tradução para inglês, que os novos modelos não suportam.

Esses modelos funcionam no ChatGPT? Não. O lançamento é exclusivo da API. Os recursos de voz do ChatGPT rodam em modelos separados (GPT-Live-1 e GPT-Live-1 mini). Esses modelos de transcrição são para desenvolvedores construindo seus próprios pipelines de voz.

Como o prompting sensível ao contexto realmente ajuda? Em vez de tratar cada arquivo de áudio como uma folha em branco, você fornece dicas sobre o que está sendo discutido. Uma transcrição médica com dicas de palavras-chave como "troponina" e "miocárdio" reconhecerá esses termos de forma muito mais confiável do que um modelo genérico. A melhoria é mais dramática em áudio de domínio específico onde o Whisper rotineiramente distorcia vocabulário especializado.

O que fazer

  1. 1 Add context prompts and keyword lists to your requests — the accuracy gain on domain-specific audio is the biggest differentiator from Whisper
  2. 2 Swap whisper-1 to gpt-transcribe in your transcription endpoint — same API shape, 52% fewer errors, 25% lower cost
  3. 3 Replace gpt-realtime-whisper with gpt-live-transcribe for live captioning and voice agent pipelines
  4. 4 Keep gpt-4o-transcribe-diarize if your pipeline depends on speaker labels or word-level timestamps

Ferramentas e modelos afetados

Nunca mais precisas de te pôr a par

O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.

Ao subscreveres, aceitas a nossa Política de Privacidade. Cancela a subscrição quando quiseres.