GPT-Transcribe sustituye a Whisper — 52% menos errores, 25% más barato

OpenAI logoOpenAIFYI29 de julio de 2026Modelos
Qué pasó
OpenAI released GPT-Transcribe (batch) and GPT-Live-Transcribe (streaming) to the API, replacing Whisper with 52% fewer errors at $4.50/1K minutes — a 25% price cut from GPT-4o Transcribe's $6.00.
Por qué importa
Context-aware prompting, keyword hints, and language hints fix Whisper's three biggest failure modes — specialized vocabulary, accented speech, and noisy audio — while costing less than the models they replace.
Qué hacer
If you're on Whisper or GPT-4o Transcribe, migrate — the API shape is the same and accuracy is dramatically better. If you need real-time streaming, GPT-Live-Transcribe is the new default. Stay on gpt-4o-transcribe-diarize if you need speaker labels or timestamps.

OpenAI acaba de dejar obsoleto a Whisper. El 28 de julio, la compañía lanzó GPT-Transcribe y GPT-Live-Transcribe en la API — dos modelos de voz a texto que reducen los errores de transcripción en un 52% y cuestan un 25% menos que los modelos que reemplazan.

GPT-Transcribe gestiona la transcripción de archivos por lotes y asíncrona a $0.0045 por minuto ($4.50 por cada 1.000 minutos), por debajo de los $0.006 de GPT-4o Transcribe. GPT-Live-Transcribe transmite deltas de transcripción en tiempo real a $0.017 por minuto con latencia ajustable — diseñado para subtitulado en directo, asistentes de reuniones y agentes de voz donde la respuesta en menos de un segundo importa más que el coste por minuto.

Qué ocurrió

OpenAI lanzó ambos modelos a través de los endpoints existentes /v1/audio/transcriptions y Realtime API. GPT-Transcribe está orientado a archivos de audio completos; GPT-Live-Transcribe se conecta mediante WebSocket o WebRTC para streaming continuo. Ninguno de los dos modelos sustituye las funciones de voz de ChatGPT — se trata de un lanzamiento exclusivo para API.

La cifra principal es una reducción de errores del 52% en Common Voice en 22 idiomas: GPT-Transcribe obtuvo una tasa de error de transcripción del 19.27% frente al 40.37% de whisper-1 (AlphaSignal(se abre en una pestaña nueva), 2026). En benchmarks independientes, GPT-Transcribe obtiene un 3.31% AA-WER (Artificial Analysis(se abre en una pestaña nueva), 2026) — una mejora de 0.7 puntos porcentuales respecto a GPT-4o Transcribe.

Lo que diferencia a estos modelos de Whisper es la conciencia contextual. Ambos aceptan tres tipos de entrada que el ASR tradicional ignora:

Tipo de entradaQué haceEjemplo
Indicación de textoDescribe el tema de la grabación y el vocabulario esperado«Conversación médica sobre resultados de resonancia magnética» → reduce errores en terminología especializada
Sugerencias de palabras claveProporciona ortografía y contexto para nombres propios, productos o acrónimos«Snyk, PyTorch, OAuth2» → elimina transcripciones erróneas de jerga técnica y nombres de marca
Pista de idiomaSugiere el idioma esperado para mejorar la precisión y reducir el cambio de códigoes-MX frente a es-ES → se adapta a variantes regionales y acentos

Estas tres capacidades solucionan los tres mayores problemas de Whisper: la incapacidad de manejar vocabulario especializado, habla con acento fuerte y audio ruidoso. Es la primera vez que la API de transcripción de OpenAI es genuinamente consciente del contexto.

Por qué importa

Whisper ha sido el motor de transcripción por defecto para la mayoría de aplicaciones de IA durante tres años. Este lanzamiento lo convierte en tecnología heredada de la noche a la mañana.

Mejor precio, mejor precisión. Los $4.50 por cada 1.000 minutos de GPT-Transcribe representan una reducción del 25% respecto a los $6.00 de GPT-4o Transcribe — y es un 52% más preciso que whisper-1 en Common Voice. Es una mejora de precio-rendimiento en ambos frentes: más barato y mejor.

La conciencia contextual es la característica decisiva. Las indicaciones de texto, las sugerencias de palabras clave y las pistas de idioma diferencian a estos modelos de todos los demás endpoints de ASR. Si realizas transcripciones en dominios especializados (médico, legal, ingeniería), estos modelos te permiten obtener transcripciones de calidad de producción sin posprocesamiento.

El streaming en tiempo real por fin está a la altura. GPT-Live-Transcribe ofrece latencia por debajo del segundo con transcripciones de calidad comparable a las de archivo — un logro técnico que ningún proveedor había alcanzado hasta ahora. La latencia ajustable te permite elegir el equilibrio adecuado entre velocidad y precisión para tu aplicación.

Qué hacer

  1. Migra desde Whisper inmediatamente. La forma de la API es la misma, el precio es más bajo y la precisión es mucho mayor. No hay razón para quedarse.
  2. Si estás en GPT-4o Transcribe, cambia a GPT-Transcribe. $4.50/1K min vs $6.00/1K min con mejor precisión — el mismo caso de uso, simplemente mejor.
  3. Si necesitas streaming en tiempo real, GPT-Live-Transcribe es la nueva opción por defecto. Es el primer endpoint de streaming que iguala la calidad de transcripción por lotes a una latencia inferior al segundo.
  4. Quédate en GPT-4o Transcribe Diarize si necesitas etiquetas de hablante o marcas de tiempo. Ninguno de los nuevos modelos admite diarización ni marcas de tiempo a nivel de palabra — esas capacidades siguen siendo exclusivas del modelo diarize heredado. El roadmap de OpenAI sugiere que estas capacidades podrían llegar en una futura actualización.

Qué hacer

  1. 1 Add context prompts and keyword lists to your requests — the accuracy gain on domain-specific audio is the biggest differentiator from Whisper
  2. 2 Swap whisper-1 to gpt-transcribe in your transcription endpoint — same API shape, 52% fewer errors, 25% lower cost
  3. 3 Replace gpt-realtime-whisper with gpt-live-transcribe for live captioning and voice agent pipelines
  4. 4 Keep gpt-4o-transcribe-diarize if your pipeline depends on speaker labels or word-level timestamps

Herramientas y modelos afectados

No vuelvas a tener que ponerte al día

El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.

Al suscribirte aceptas nuestra Política de privacidad. Cancela cuando quieras.