GPT-Transcribe löst Whisper ab — 52 % weniger Fehler, 25 % günstiger
- Was ist passiert
- OpenAI released GPT-Transcribe (batch) and GPT-Live-Transcribe (streaming) to the API, replacing Whisper with 52% fewer errors at $4.50/1K minutes — a 25% price cut from GPT-4o Transcribe's $6.00.
- Warum es wichtig ist
- Context-aware prompting, keyword hints, and language hints fix Whisper's three biggest failure modes — specialized vocabulary, accented speech, and noisy audio — while costing less than the models they replace.
- Was zu tun ist
- If you're on Whisper or GPT-4o Transcribe, migrate — the API shape is the same and accuracy is dramatically better. If you need real-time streaming, GPT-Live-Transcribe is the new default. Stay on gpt-4o-transcribe-diarize if you need speaker labels or timestamps.
OpenAI hat Whisper gerade obsolet gemacht. Am 28. Juli brachte das Unternehmen GPT-Transcribe und GPT-Live-Transcribe in die API — zwei Speech-to-Text-Modelle, die Transkriptionsfehler um 52 % reduzieren und gleichzeitig 25 % weniger kosten als die Modelle, die sie ersetzen.
GPT-Transcribe verarbeitet Batch- und asynchrone Dateitranskription zu 0,0045 $ pro Minute (4,50 $ pro 1.000 Minuten), statt GPT-4o Transcribes 0,006 $. GPT-Live-Transcribe streamt Echtzeit-Transkript-Deltas zu 0,017 $ pro Minute mit einstellbarer Latenz — entwickelt für Live-Untertitelung, Meeting-Assistenten und Voice-Agenten, bei denen Reaktionen unter einer Sekunde wichtiger sind als die Kosten pro Minute.
Was passiert ist
OpenAI veröffentlichte beide Modelle über die bestehenden /v1/audio/transcriptions- und Realtime-API-Endpunkte. GPT-Transcribe zielt auf abgeschlossene Audiodateien; GPT-Live-Transcribe verbindet sich via WebSocket oder WebRTC für kontinuierliches Streaming. Keines der Modelle ersetzt die Sprachfunktionen von ChatGPT — dies ist ein reiner API-Launch.
Die Headline-Zahl ist eine 52-prozentige Fehlerreduktion bei Common Voice über 22 Sprachen: GPT-Transcribe erreichte eine Transkriptionsfehlerrate von 19,27 % gegenüber 40,37 % bei whisper-1 (AlphaSignal(wird in einem neuen Tab geöffnet), 2026). In unabhängigen Benchmarks erzielt GPT-Transcribe 3,31 % AA-WER (Artificial Analysis(wird in einem neuen Tab geöffnet), 2026) — eine Verbesserung um 0,7 Prozentpunkte gegenüber GPT-4o Transcribe.
Was diese Modelle von Whisper unterscheidet, ist Kontextbewusstsein. Beide akzeptieren drei Arten von Eingaben, die traditionelles ASR ignoriert:
| Eingabetyp | Funktion | Beispiel |
|---|---|---|
| Text-Prompt | Beschreibt Thema und erwartetes Vokabular der Aufnahme | „Ärztliche Konsultation zu kardiologischen Symptomen" |
| Keyword-Boosting | Liste von Begriffen, die im Transkript zu erwarten oder zu priorisieren sind | „Atorvastatin, Myokardinfarkt, Troponin" |
| Sprachhinweis | Teilt dem Modell die wahrscheinlichste Sprache der Audiodatei mit | „de" für Deutsch, „zh" für Chinesisch |
Das Ergebnis ist eine drastisch höhere Genauigkeit bei Fachvokabular, Akzenten und lauten Umgebungen — genau den Szenarien, in denen Whisper traditionell versagte.
Warum es wichtig ist
Whisper war OpenAIs Flaggschiff-STT-Modell seit 2022. GPT-Transcribe ersetzt es nicht nur, sondern erreicht Quantensprünge in der Genauigkeit und adressiert zugleich die drei größten Schwachstellen von Whisper:
- Fachvokabular: Medizinische, rechtliche und technische Audioinhalte, die Whisper verwirrten, werden durch Keyword- und Prompt-Hinweise jetzt genau transkribiert.
- Akzente und Dialekte: Sprachhinweise ermöglichen es dem Modell, die wahrscheinliche Sprache und den Akzent zu kennen, bevor es mit der Transkription beginnt.
- Laute Umgebungen: Kontextbewusste Verarbeitung filtert Hintergrundgeräusche effektiver als die generische Pipeline von Whisper.
Und das alles zu einem niedrigeren Preis. GPT-Transcribes Preis von 4,50 $/1K Minuten liegt 25 % unter dem von GPT-4o Transcribe (6,00 $/1K Minuten) und ist damit die kostengünstigste hochpräzise STT-Option, die OpenAI je angeboten hat.
GPT-Live-Transcribe adressiert eine andere Nische: Live-Untertitelung, Meeting-Assistenten und Voice-Agenten, bei denen Reaktionen unter einer Sekunde nicht verhandelbar sind. Zu 17 $/1K Minuten ist es eine Premium-Option, aber der einstellbare Latenzbereich und das Streaming-Transkriptformat machen es zum ersten brauchbaren Live-STT-Modell von OpenAI, das nicht auf Kompromisse bei der Genauigkeit angewiesen ist.
Was zu tun ist
- Wenn Sie Whisper oder GPT-4o Transcribe verwenden, migrieren Sie. GPT-Transcribe verwendet dieselben API-Endpunkte, sodass die Migration ein Drop-in ist — Sie erhalten eine messbar bessere Genauigkeit zu einem niedrigeren Preis.
- Wenn Sie Echtzeit-Streaming benötigen, evaluieren Sie GPT-Live-Transcribe. Die einstellbare Latenz und das Streaming-Transkript-Format machen es zum neuen Standard für Voice-Agenten und Live-Untertitelung.
- Bleiben Sie bei gpt-4o-transcribe-diarize, wenn Sie Sprecherlabels oder Wort-Timestamps benötigen. GPT-Transcribe und GPT-Live-Transcribe unterstützen keine Diarisierung oder Wort-Timestamps — gpt-4o-transcribe-diarize bleibt die Option für diese Funktionen.
Was zu tun ist
- 1 Add context prompts and keyword lists to your requests — the accuracy gain on domain-specific audio is the biggest differentiator from Whisper
- 2 Swap whisper-1 to gpt-transcribe in your transcription endpoint — same API shape, 52% fewer errors, 25% lower cost
- 3 Replace gpt-realtime-whisper with gpt-live-transcribe for live captioning and voice agent pipelines
- 4 Keep gpt-4o-transcribe-diarize if your pipeline depends on speaker labels or word-level timestamps
Betroffene Tools & Modelle
Nie wieder etwas verpassen
Das wöchentliche Delta — nur Urteilsänderungen und dringende Punkte. Kein Füllmaterial.