GPT-Transcribe
OpenAI · Lanzado jul 2026
El último modelo de speech-to-text por lotes de OpenAI alcanza un 3.31% AA-WER a $0.0045/min — un 25% más barato y mediblemente más preciso que su predecesor gpt-4o-transcribe. Soporta indicaciones de contexto, sugerencias de palabras clave y detección de idioma en más de 22 idiomas, lo que lo convierte en la mejor opción predeterminada para transcripción asíncrona de archivos en la plataforma OpenAI. Limitación: sin diarización ni marcas de tiempo a nivel de palabra; usa gpt-4o-transcribe-diarize para etiquetas de hablante o gpt-live-transcribe para necesidades en tiempo real. Ideal para desarrolladores que construyen transcripción de reuniones, procesamiento de medios e interfaces de voz sobre la API de OpenAI.
¿Es adecuada para ti?
Bueno para
- Transcripción por lotes de alta precisión con 3.31% AA-WER en diversas condiciones de audio
- Transcripción consciente del contexto mediante indicaciones de formato libre, palabras clave y sugerencias de idioma para audio de dominio específico
- Soporte para más de 22 idiomas con salida de idioma detectado al finalizar
- Un 25% más barato que su predecesor gpt-4o-transcribe a $0.0045/min
No recomendado para
- Cambio de código multilingüe, audio ruidoso o audio extenso de llamadas de resultados donde modelos especializados rinden mejor
- Reuniones con múltiples hablantes que requieren diarización de locutor — usa gpt-4o-transcribe-diarize en su lugar
- Transcripción en tiempo real que requiere latencia inferior al segundo — usa gpt-live-transcribe
Rendimiento por tarea
Transcripción de archivos por lotes
Precisión de primer nivel a un precio competitivo; el mejor de su clase en la plataforma OpenAI para cargas de trabajo asíncronas
Transcripción de turnos en tiempo real
Sólido para transcripción de turnos post-commit con detección de idioma, pero no diseñado para deltas de transmisión en vivo
Transcripción multilingüe
19.27% TER en 22 idiomas de Common Voice — gran salto sobre Whisper pero por detrás de modelos multilingües especializados en cambio de código
Audio de dominio específico
Las indicaciones de contexto y las sugerencias de palabras clave mejoran la precisión semántica al 45.2%, pero aún se beneficia del ajuste fino por dominio
Transcripción de audio ruidoso
Mejorado respecto a Whisper en ruido del mundo real, pero el 6.10% WER en Earnings22 muestra margen de mejora en condiciones acústicas difíciles
Precios
Entrada
$0.0045 / minute
Salida
N/A
Contexto
Per-minute audio billing
Pruebas de rendimiento
Aún no hay cambios de veredicto
El reloj corre desde el primer día: los cambios aparecerán aquí a medida que evolucione nuestro veredicto.
Fuentes
- OpenAI API — Realtime Transcription Guidejul 2026
- OpenAI Developers on X: GPT-Transcribe + GPT-Live-Transcribe announcementjul 2026
- Artificial Analysis — Speech-to-Text Leaderboardjul 2026
- Artificial Analysis on X: GPT Transcribe benchmarksjul 2026
- GIGAZINE — GPT Transcribe / GPT Live Transcribe Release Coveragejul 2026
- OpenAI Developer Pricing Docsjun 2026
- OpenAI API — GPT Transcribe Model Pagejul 2026
Registro de verificación
- Precios— Sin cambios
Agente automatizado