GPT-Transcribe remplace Whisper — 52 % d'erreurs en moins, 25 % moins cher

OpenAI logoOpenAIFYI29 juillet 2026Modèles
Ce qui s’est passé
OpenAI released GPT-Transcribe (batch) and GPT-Live-Transcribe (streaming) to the API, replacing Whisper with 52% fewer errors at $4.50/1K minutes — a 25% price cut from GPT-4o Transcribe's $6.00.
Pourquoi c’est important
Context-aware prompting, keyword hints, and language hints fix Whisper's three biggest failure modes — specialized vocabulary, accented speech, and noisy audio — while costing less than the models they replace.
Que faire
If you're on Whisper or GPT-4o Transcribe, migrate — the API shape is the same and accuracy is dramatically better. If you need real-time streaming, GPT-Live-Transcribe is the new default. Stay on gpt-4o-transcribe-diarize if you need speaker labels or timestamps.

OpenAI vient de rendre Whisper obsolète. Le 28 juillet, l'entreprise a livré GPT-Transcribe et GPT-Live-Transcribe via l'API — deux modèles de speech-to-text qui réduisent les erreurs de transcription de 52 % tout en coûtant 25 % de moins que les modèles qu'ils remplacent.

GPT-Transcribe gère la transcription par lots et asynchrone de fichiers à 0,0045 $ par minute (4,50 $ pour 1 000 minutes), contre 0,006 $ pour GPT-4o Transcribe. GPT-Live-Transcribe diffuse des deltas de transcription en temps réel à 0,017 $ par minute avec une latence ajustable — conçu pour le sous-titrage en direct, les assistants de réunion et les agents vocaux où une réponse en moins d'une seconde prime sur le coût par minute.

Ce qui s'est passé

OpenAI a publié les deux modèles via les endpoints existants /v1/audio/transcriptions et l'API Realtime. GPT-Transcribe cible les fichiers audio terminés ; GPT-Live-Transcribe se connecte via WebSocket ou WebRTC pour une diffusion continue. Aucun des deux modèles ne remplace les fonctionnalités vocales de ChatGPT — il s'agit d'un lancement exclusivement API.

Le chiffre phare est une réduction des erreurs de 52 % sur Common Voice dans 22 langues : GPT-Transcribe a obtenu un taux d'erreur de transcription de 19,27 % contre 40,37 % pour whisper-1 (AlphaSignal(s’ouvre dans un nouvel onglet), 2026). Sur les benchmarks indépendants, GPT-Transcribe obtient 3,31 % AA-WER (Artificial Analysis(s’ouvre dans un nouvel onglet), 2026) — une amélioration de 0,7 point de pourcentage par rapport à GPT-4o Transcribe.

Ce qui distingue ces modèles de Whisper, c'est la compréhension contextuelle. Les deux acceptent trois types d'entrées que l'ASR traditionnel ignore :

Type d'entréeFonctionExemple
Prompt textuelDécrit le sujet de l'enregistrement pour désambiguïser les homophones« Conférence médicale sur les maladies cardiovasculaires »
Indices de mots-clésListes de termes de vocabulaire spécialisés probablesNoms de médicaments, jargon juridique, noms de produits
Indications linguistiquesSpécifie la langue ou le dialecte attendu« français québécois » ou « espagnol d'Argentine »

Ces entrées corrigent les trois plus grandes défaillances de Whisper : le vocabulaire spécialisé, la confusion des accents et l'audio bruyant.

Domaines où GPT-Live-Transcribe excelle

Le mode streaming apporte deux capacités que l'ASR traditionnel ne peut pas offrir :

  1. Mises à jour de configuration en milieu de session. Changez de prompt ou de liste de mots-clés pendant que l'audio continue de streamer — la correction de cours en milieu de réunion sans redémarrer la session.
  2. Latence ajustable. Trade-off vitesse contre précision par paramètre, pas par architecture.

Le compromis : environ 3,8× le coût par minute du mode batch. Si vous traitez des fichiers préenregistrés, GPT-Transcribe est le meilleur choix économique. Si les utilisateurs regardent les sous-titres en temps réel, GPT-Live-Transcribe est désormais le chemin par défaut.

Ce qu'il faut faire

Si vous êtes sur Whisper ou GPT-4o Transcribe : migrez. La forme de l'API est identique, les prix sont plus bas et la précision est mesurablement meilleure. Si vous avez besoin de diarisation ou d'horodatages au niveau des mots, restez sur gpt-4o-transcribe-diarize — ces fonctionnalités ne sont pas encore disponibles sur les nouveaux modèles.

Pour les cas d'usage en streaming : GPT-Live-Transcribe via WebSocket est le nouveau standard. La diffusion delta par delta et le prompting en milieu de session repoussent les limites de ce qui est possible en transcription en direct.

Résultat net : Whisper a bien servi, mais c'est un modèle 2022. GPT-Transcribe est le successeur légitime — meilleur sur tous les axes qui comptent, pour moins d'argent.

Que faire

  1. 1 Add context prompts and keyword lists to your requests — the accuracy gain on domain-specific audio is the biggest differentiator from Whisper
  2. 2 Swap whisper-1 to gpt-transcribe in your transcription endpoint — same API shape, 52% fewer errors, 25% lower cost
  3. 3 Replace gpt-realtime-whisper with gpt-live-transcribe for live captioning and voice agent pipelines
  4. 4 Keep gpt-4o-transcribe-diarize if your pipeline depends on speaker labels or word-level timestamps

Outils et modèles concernés

Ne ratez plus jamais une mise à jour

Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.

En vous abonnant, vous acceptez notre Politique de confidentialité. Désabonnement à tout moment.