GPT-Transcribe
OpenAI · Veröffentlicht Juli 2026
OpenAIs neuestes Batch-Speech-to-Text-Modell erreicht 3,31 % AA-WER bei 0,0045 $/Min. — 25 % günstiger und messbar genauer als sein gpt-4o-transcribe-Vorgänger. Es unterstützt Kontext-Prompting, Keyword-Hinweise und Spracherkennung in über 22 Sprachen und ist damit der beste Standard für asynchrone Dateitranskription auf der OpenAI-Plattform. Einschränkung: keine Diarisierung oder wortgenaue Zeitstempel; nutzen Sie gpt-4o-transcribe-diarize für Sprecherlabels oder gpt-live-transcribe für Echtzeitanforderungen. Am besten für Entwickler, die Meeting-Transkription, Medienverarbeitung und Sprachschnittstellen auf der OpenAI API aufbauen.
Ist es das Richtige für dich?
Gut für
- Hochgenaue Batch-Transkription mit 3,31 % AA-WER über diverse Audiobedingungen hinweg
- Kontextbewusste Transkription durch Freitext-Prompts, Keywords und Sprachhinweise für domänenspezifisches Audio
- Unterstützung für über 22 Sprachen mit Ausgabe der erkannten Sprache bei Abschluss
- 25 % günstiger als der Vorgänger gpt-4o-transcribe zu 0,0045 $/Min.
Nicht geeignet für
- Mehrsprachiges Code-Switching, verrauschtes Audio oder lange Earnings-Call-Aufnahmen, bei denen spezialisierte Modelle besser abschneiden
- Meetings mit mehreren Sprechern, die Sprecherdiarisierung erfordern — nutzen Sie stattdessen gpt-4o-transcribe-diarize
- Echtzeit-Streaming-Transkription mit Subsekunden-Latenz — nutzen Sie gpt-live-transcribe
Leistung nach Aufgabe
Batch file transcription
Erstklassige Genauigkeit zu einem wettbewerbsfähigen Preis; branchenbeste auf der OpenAI-Plattform für asynchrone Workloads
Realtime turn transcription
Stark für Post-Commit-Turn-Transkription mit Spracherkennung, aber nicht für Live-Streaming-Deltas konzipiert
Multilingual transcription
19,27 % TER über 22 Common-Voice-Sprachen — großer Sprung gegenüber Whisper, bleibt aber bei Code-Switching hinter spezialisierten mehrsprachigen Modellen zurück
Domain-specific audio (medical, legal, technical)
Kontext-Prompts und Keyword-Hinweise verbessern die semantische Genauigkeit auf 45,2 %, profitieren aber dennoch von Domänen-Fine-Tuning
Noisy audio transcription
Verbessert gegenüber Whisper bei realem Umgebungslärm, aber 6,10 % WER auf Earnings22 zeigt Verbesserungspotenzial bei schwierigen akustischen Bedingungen
Preise
Eingabe
$0.0045 / minute
Ausgabe
N/A
Kontext
Per-minute audio billing
Benchmarks
Noch keine Urteilsänderungen
Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.
Quellen
- OpenAI API — Realtime Transcription GuideJuli 2026
- OpenAI Developers on X: GPT-Transcribe + GPT-Live-Transcribe announcementJuli 2026
- Artificial Analysis — Speech-to-Text LeaderboardJuli 2026
- Artificial Analysis on X: GPT Transcribe benchmarksJuli 2026
- GIGAZINE — GPT Transcribe / GPT Live Transcribe Release CoverageJuli 2026
- OpenAI Developer Pricing DocsJuni 2026
- OpenAI API — GPT Transcribe Model PageJuli 2026
Prüfprotokoll
- Preise— Keine Änderungen
Automatisierter Agent