GPT-Transcribe logo

GPT-Transcribe

OpenAI · Sorti juil. 2026

Recommandé

Le dernier modèle speech-to-text en batch d'OpenAI obtient 3,31 % AA-WER à 0,0045 $/min — 25 % moins cher et mesurablement plus précis que son prédécesseur gpt-4o-transcribe. Il prend en charge les invites contextuelles, les suggestions de mots-clés et la détection de langue sur plus de 22 langues, ce qui en fait le meilleur choix par défaut pour la transcription asynchrone de fichiers sur la plateforme OpenAI. Réserve : pas de diarisation ni d'horodatage au niveau des mots ; utilisez gpt-4o-transcribe-diarize pour l'identification des locuteurs ou gpt-live-transcribe pour les besoins en temps réel. Idéal pour les développeurs qui construisent des pipelines de transcription de réunions, de traitement média et d'interfaces vocales sur l'API OpenAI.

Est-ce fait pour vous ?

Recommandé pour

  • Transcription batch de haute précision avec 3,31 % AA-WER dans des conditions audio variées
  • Transcription sensible au contexte via des invites libres, mots-clés et indications de langue pour l'audio spécifique à un domaine
  • Support de 22+ langues avec sortie de la langue détectée à la fin de la transcription
  • 25 % moins cher que son prédécesseur gpt-4o-transcribe à 0,0045 $/min

Déconseillé pour

  • Alternance de code multilingue, audio bruité ou audio long de type résultats financiers où les modèles spécialisés surpassent
  • Réunions multi-locuteurs nécessitant une diarisation — utilisez gpt-4o-transcribe-diarize à la place
  • Transcription en streaming temps réel nécessitant une latence inférieure à la seconde — utilisez gpt-live-transcribe

Performances par tâche

Transcription de fichiers en batch

Excellent

Précision de premier ordre à un prix compétitif ; meilleur de sa catégorie sur la plateforme OpenAI pour les workloads asynchrones

Transcription en temps réel

Very Good

Solide pour la transcription post-engagement avec détection de langue, mais pas conçu pour les deltas de streaming en direct

Transcription multilingue

Very Good

19,27 % TER sur 22 langues Common Voice — énorme progrès par rapport à Whisper mais en retrait des modèles multilingues spécialisés sur l'alternance de code

Audio spécifique à un domaine

Very Good

Les invites contextuelles et les suggestions de mots-clés améliorent la précision sémantique à 45,2 %, mais bénéficient encore d'un fine-tuning de domaine

Transcription audio bruité

Very Good

Amélioré par rapport à Whisper sur le bruit réel, mais 6,10 % WER sur Earnings22 montre une marge de progression sur les conditions acoustiques difficiles

Tarifs

Entrée

$0.0045 / minute

Sortie

N/A

Contexte

Per-minute audio billing

Voir tous les tarifs

Tests de performance

TestScoreSource
AA-WER v23.31% Source
AA-AgentTalk WER2.22% Source
VoxPopuli-Cleaned-AA WER2.72% Source
Earnings22-Cleaned-AA WER6.10% Source
Common Voice 22-language TER19.27% Source
Context Aware ASR (semantic accuracy)45.2% Source

Aucun changement de verdict pour l’instant

L’horloge tourne dès le premier jour : les changements apparaîtront ici à mesure que notre verdict évolue.

Journal de vérification

  • Tarifs— Aucun changement

    Agent automatisé

Comment nous évaluons