GPT-Transcribe logo

GPT-Transcribe

OpenAI · Veröffentlicht Juli 2026

Empfohlen

OpenAIs neuestes Batch-Speech-to-Text-Modell erreicht 3,31 % AA-WER bei 0,0045 $/Min. — 25 % günstiger und messbar genauer als sein gpt-4o-transcribe-Vorgänger. Es unterstützt Kontext-Prompting, Keyword-Hinweise und Spracherkennung in über 22 Sprachen und ist damit der beste Standard für asynchrone Dateitranskription auf der OpenAI-Plattform. Einschränkung: keine Diarisierung oder wortgenaue Zeitstempel; nutzen Sie gpt-4o-transcribe-diarize für Sprecherlabels oder gpt-live-transcribe für Echtzeitanforderungen. Am besten für Entwickler, die Meeting-Transkription, Medienverarbeitung und Sprachschnittstellen auf der OpenAI API aufbauen.

Ist es das Richtige für dich?

Gut für

  • Hochgenaue Batch-Transkription mit 3,31 % AA-WER über diverse Audiobedingungen hinweg
  • Kontextbewusste Transkription durch Freitext-Prompts, Keywords und Sprachhinweise für domänenspezifisches Audio
  • Unterstützung für über 22 Sprachen mit Ausgabe der erkannten Sprache bei Abschluss
  • 25 % günstiger als der Vorgänger gpt-4o-transcribe zu 0,0045 $/Min.

Nicht geeignet für

  • Mehrsprachiges Code-Switching, verrauschtes Audio oder lange Earnings-Call-Aufnahmen, bei denen spezialisierte Modelle besser abschneiden
  • Meetings mit mehreren Sprechern, die Sprecherdiarisierung erfordern — nutzen Sie stattdessen gpt-4o-transcribe-diarize
  • Echtzeit-Streaming-Transkription mit Subsekunden-Latenz — nutzen Sie gpt-live-transcribe

Leistung nach Aufgabe

Batch file transcription

Excellent

Erstklassige Genauigkeit zu einem wettbewerbsfähigen Preis; branchenbeste auf der OpenAI-Plattform für asynchrone Workloads

Realtime turn transcription

Very Good

Stark für Post-Commit-Turn-Transkription mit Spracherkennung, aber nicht für Live-Streaming-Deltas konzipiert

Multilingual transcription

Very Good

19,27 % TER über 22 Common-Voice-Sprachen — großer Sprung gegenüber Whisper, bleibt aber bei Code-Switching hinter spezialisierten mehrsprachigen Modellen zurück

Domain-specific audio (medical, legal, technical)

Very Good

Kontext-Prompts und Keyword-Hinweise verbessern die semantische Genauigkeit auf 45,2 %, profitieren aber dennoch von Domänen-Fine-Tuning

Noisy audio transcription

Very Good

Verbessert gegenüber Whisper bei realem Umgebungslärm, aber 6,10 % WER auf Earnings22 zeigt Verbesserungspotenzial bei schwierigen akustischen Bedingungen

Preise

Eingabe

$0.0045 / minute

Ausgabe

N/A

Kontext

Per-minute audio billing

Alle Preise ansehen

Benchmarks

BenchmarkWertQuelle
AA-WER v23.31% Quelle
AA-AgentTalk WER2.22% Quelle
VoxPopuli-Cleaned-AA WER2.72% Quelle
Earnings22-Cleaned-AA WER6.10% Quelle
Common Voice 22-language TER19.27% Quelle
Context Aware ASR (semantic accuracy)45.2% Quelle

Noch keine Urteilsänderungen

Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.

Prüfprotokoll

  • Preise— Keine Änderungen

    Automatisierter Agent

Wie wir bewerten