GPT-Transcribe logo

GPT-Transcribe

OpenAI · Lanzado jul 2026

Recomendado

El último modelo de speech-to-text por lotes de OpenAI alcanza un 3.31% AA-WER a $0.0045/min — un 25% más barato y mediblemente más preciso que su predecesor gpt-4o-transcribe. Soporta indicaciones de contexto, sugerencias de palabras clave y detección de idioma en más de 22 idiomas, lo que lo convierte en la mejor opción predeterminada para transcripción asíncrona de archivos en la plataforma OpenAI. Limitación: sin diarización ni marcas de tiempo a nivel de palabra; usa gpt-4o-transcribe-diarize para etiquetas de hablante o gpt-live-transcribe para necesidades en tiempo real. Ideal para desarrolladores que construyen transcripción de reuniones, procesamiento de medios e interfaces de voz sobre la API de OpenAI.

¿Es adecuada para ti?

Bueno para

  • Transcripción por lotes de alta precisión con 3.31% AA-WER en diversas condiciones de audio
  • Transcripción consciente del contexto mediante indicaciones de formato libre, palabras clave y sugerencias de idioma para audio de dominio específico
  • Soporte para más de 22 idiomas con salida de idioma detectado al finalizar
  • Un 25% más barato que su predecesor gpt-4o-transcribe a $0.0045/min

No recomendado para

  • Cambio de código multilingüe, audio ruidoso o audio extenso de llamadas de resultados donde modelos especializados rinden mejor
  • Reuniones con múltiples hablantes que requieren diarización de locutor — usa gpt-4o-transcribe-diarize en su lugar
  • Transcripción en tiempo real que requiere latencia inferior al segundo — usa gpt-live-transcribe

Rendimiento por tarea

Transcripción de archivos por lotes

Excellent

Precisión de primer nivel a un precio competitivo; el mejor de su clase en la plataforma OpenAI para cargas de trabajo asíncronas

Transcripción de turnos en tiempo real

Very Good

Sólido para transcripción de turnos post-commit con detección de idioma, pero no diseñado para deltas de transmisión en vivo

Transcripción multilingüe

Very Good

19.27% TER en 22 idiomas de Common Voice — gran salto sobre Whisper pero por detrás de modelos multilingües especializados en cambio de código

Audio de dominio específico

Very Good

Las indicaciones de contexto y las sugerencias de palabras clave mejoran la precisión semántica al 45.2%, pero aún se beneficia del ajuste fino por dominio

Transcripción de audio ruidoso

Very Good

Mejorado respecto a Whisper en ruido del mundo real, pero el 6.10% WER en Earnings22 muestra margen de mejora en condiciones acústicas difíciles

Precios

Entrada

$0.0045 / minute

Salida

N/A

Contexto

Per-minute audio billing

Ver precios completos

Pruebas de rendimiento

PruebaPuntuaciónFuente
AA-WER v23.31% Fuente
AA-AgentTalk WER2.22% Fuente
VoxPopuli-Cleaned-AA WER2.72% Fuente
Earnings22-Cleaned-AA WER6.10% Fuente
Common Voice 22-language TER19.27% Fuente
Context Aware ASR (semantic accuracy)45.2% Fuente

Aún no hay cambios de veredicto

El reloj corre desde el primer día: los cambios aparecerán aquí a medida que evolucione nuestro veredicto.

Registro de verificación

  • Precios— Sin cambios

    Agente automatizado

Cómo evaluamos