GPT-Transcribe logo

GPT-Transcribe

OpenAI · Lançado 07/2026

Recomendado

O mais recente modelo de transcrição de fala em lote da OpenAI pontua 3,31% AA-WER a $0,0045/min — 25% mais barato e mensuravelmente mais preciso que seu antecessor gpt-4o-transcribe. Suporta prompts de contexto, dicas de palavras-chave e detecção de idioma em mais de 22 idiomas, tornando-o a melhor opção padrão para transcrição assíncrona de arquivos na plataforma OpenAI. Ressalva: sem diarização ou timestamps em nível de palavra; use gpt-4o-transcribe-diarize para rótulos de falante ou gpt-live-transcribe para necessidades em tempo real. Melhor para desenvolvedores criando transcrição de reuniões, processamento de mídia e interfaces de voz na API da OpenAI.

É adequada para ti?

Bom para

  • Transcrição em lote de alta precisão com 3,31% AA-WER em diversas condições de áudio
  • Transcrição sensível ao contexto via prompts de formato livre, palavras-chave e dicas de idioma para áudio de domínio específico
  • Suporte a mais de 22 idiomas com saída do idioma detectado ao finalizar
  • 25% mais barato que o antecessor gpt-4o-transcribe a $0,0045/min

Não recomendado para

  • Mistura de idiomas, áudio ruidoso ou áudio longo de teleconferências de resultados onde modelos especializados superam
  • Reuniões com múltiplos falantes que exigem diarização de locutor — use gpt-4o-transcribe-diarize
  • Transcrição em streaming em tempo real que exige latência inferior a um segundo — use gpt-live-transcribe

Desempenho por tarefa

Batch file transcription

Excellent

Precisão de alto nível a preço competitivo; melhor da categoria na plataforma OpenAI para cargas de trabalho assíncronas

Realtime turn transcription

Very Good

Forte para transcrição de turnos pós-confirmação com detecção de idioma, mas não projetado para atualizações em streaming ao vivo

Multilingual transcription

Very Good

19,27% TER em 22 idiomas do Common Voice — enorme salto sobre o Whisper, mas fica atrás de modelos multilíngues especializados em mistura de idiomas

Domain-specific audio

Very Good

Prompts de contexto e dicas de palavras-chave melhoram a precisão semântica para 45,2%, mas ainda se beneficia de ajuste fino de domínio

Noisy audio transcription

Very Good

Melhorou em relação ao Whisper em ruído do mundo real, mas 6,10% WER no Earnings22 mostra espaço para melhoria em condições acústicas desafiadoras

Preços

Entrada

$0.0045 / minute

Saída

N/A

Contexto

Per-minute audio billing

Ver preços completos

Testes de desempenho

TestePontuaçãoFonte
AA-WER v23.31% Fonte
AA-AgentTalk WER2.22% Fonte
VoxPopuli-Cleaned-AA WER2.72% Fonte
Earnings22-Cleaned-AA WER6.10% Fonte
Common Voice 22-language TER19.27% Fonte
Context Aware ASR (semantic accuracy)45.2% Fonte

Ainda sem alterações de veredicto

O relógio começa a contar no primeiro dia: as alterações aparecem aqui à medida que o nosso veredicto evolui.

Registo de verificação

  • Preços— Sem alterações

    Agente automatizado

Como avaliamos