GPT-Transcribe
OpenAI · Sorti juil. 2026
Le dernier modèle speech-to-text en batch d'OpenAI obtient 3,31 % AA-WER à 0,0045 $/min — 25 % moins cher et mesurablement plus précis que son prédécesseur gpt-4o-transcribe. Il prend en charge les invites contextuelles, les suggestions de mots-clés et la détection de langue sur plus de 22 langues, ce qui en fait le meilleur choix par défaut pour la transcription asynchrone de fichiers sur la plateforme OpenAI. Réserve : pas de diarisation ni d'horodatage au niveau des mots ; utilisez gpt-4o-transcribe-diarize pour l'identification des locuteurs ou gpt-live-transcribe pour les besoins en temps réel. Idéal pour les développeurs qui construisent des pipelines de transcription de réunions, de traitement média et d'interfaces vocales sur l'API OpenAI.
Est-ce fait pour vous ?
Recommandé pour
- Transcription batch de haute précision avec 3,31 % AA-WER dans des conditions audio variées
- Transcription sensible au contexte via des invites libres, mots-clés et indications de langue pour l'audio spécifique à un domaine
- Support de 22+ langues avec sortie de la langue détectée à la fin de la transcription
- 25 % moins cher que son prédécesseur gpt-4o-transcribe à 0,0045 $/min
Déconseillé pour
- Alternance de code multilingue, audio bruité ou audio long de type résultats financiers où les modèles spécialisés surpassent
- Réunions multi-locuteurs nécessitant une diarisation — utilisez gpt-4o-transcribe-diarize à la place
- Transcription en streaming temps réel nécessitant une latence inférieure à la seconde — utilisez gpt-live-transcribe
Performances par tâche
Transcription de fichiers en batch
Précision de premier ordre à un prix compétitif ; meilleur de sa catégorie sur la plateforme OpenAI pour les workloads asynchrones
Transcription en temps réel
Solide pour la transcription post-engagement avec détection de langue, mais pas conçu pour les deltas de streaming en direct
Transcription multilingue
19,27 % TER sur 22 langues Common Voice — énorme progrès par rapport à Whisper mais en retrait des modèles multilingues spécialisés sur l'alternance de code
Audio spécifique à un domaine
Les invites contextuelles et les suggestions de mots-clés améliorent la précision sémantique à 45,2 %, mais bénéficient encore d'un fine-tuning de domaine
Transcription audio bruité
Amélioré par rapport à Whisper sur le bruit réel, mais 6,10 % WER sur Earnings22 montre une marge de progression sur les conditions acoustiques difficiles
Tarifs
Entrée
$0.0045 / minute
Sortie
N/A
Contexte
Per-minute audio billing
Tests de performance
Aucun changement de verdict pour l’instant
L’horloge tourne dès le premier jour : les changements apparaîtront ici à mesure que notre verdict évolue.
Sources
- OpenAI API — Realtime Transcription Guidejuil. 2026
- OpenAI Developers on X: GPT-Transcribe + GPT-Live-Transcribe announcementjuil. 2026
- Artificial Analysis — Speech-to-Text Leaderboardjuil. 2026
- Artificial Analysis on X: GPT Transcribe benchmarksjuil. 2026
- GIGAZINE — GPT Transcribe / GPT Live Transcribe Release Coveragejuil. 2026
- OpenAI Developer Pricing Docsjuin 2026
- OpenAI API — GPT Transcribe Model Pagejuil. 2026
Journal de vérification
- Tarifs— Aucun changement
Agent automatisé