GPT-Transcribe löst Whisper ab — 52 % weniger Fehler, 25 % günstiger

OpenAI logoOpenAIFYI29. Juli 2026Modelle
Was ist passiert
OpenAI released GPT-Transcribe (batch) and GPT-Live-Transcribe (streaming) to the API, replacing Whisper with 52% fewer errors at $4.50/1K minutes — a 25% price cut from GPT-4o Transcribe's $6.00.
Warum es wichtig ist
Context-aware prompting, keyword hints, and language hints fix Whisper's three biggest failure modes — specialized vocabulary, accented speech, and noisy audio — while costing less than the models they replace.
Was zu tun ist
If you're on Whisper or GPT-4o Transcribe, migrate — the API shape is the same and accuracy is dramatically better. If you need real-time streaming, GPT-Live-Transcribe is the new default. Stay on gpt-4o-transcribe-diarize if you need speaker labels or timestamps.

OpenAI hat Whisper gerade obsolet gemacht. Am 28. Juli brachte das Unternehmen GPT-Transcribe und GPT-Live-Transcribe in die API — zwei Speech-to-Text-Modelle, die Transkriptionsfehler um 52 % reduzieren und gleichzeitig 25 % weniger kosten als die Modelle, die sie ersetzen.

GPT-Transcribe verarbeitet Batch- und asynchrone Dateitranskription zu 0,0045 $ pro Minute (4,50 $ pro 1.000 Minuten), statt GPT-4o Transcribes 0,006 $. GPT-Live-Transcribe streamt Echtzeit-Transkript-Deltas zu 0,017 $ pro Minute mit einstellbarer Latenz — entwickelt für Live-Untertitelung, Meeting-Assistenten und Voice-Agenten, bei denen Reaktionen unter einer Sekunde wichtiger sind als die Kosten pro Minute.

Was passiert ist

OpenAI veröffentlichte beide Modelle über die bestehenden /v1/audio/transcriptions- und Realtime-API-Endpunkte. GPT-Transcribe zielt auf abgeschlossene Audiodateien; GPT-Live-Transcribe verbindet sich via WebSocket oder WebRTC für kontinuierliches Streaming. Keines der Modelle ersetzt die Sprachfunktionen von ChatGPT — dies ist ein reiner API-Launch.

Die Headline-Zahl ist eine 52-prozentige Fehlerreduktion bei Common Voice über 22 Sprachen: GPT-Transcribe erreichte eine Transkriptionsfehlerrate von 19,27 % gegenüber 40,37 % bei whisper-1 (AlphaSignal(wird in einem neuen Tab geöffnet), 2026). In unabhängigen Benchmarks erzielt GPT-Transcribe 3,31 % AA-WER (Artificial Analysis(wird in einem neuen Tab geöffnet), 2026) — eine Verbesserung um 0,7 Prozentpunkte gegenüber GPT-4o Transcribe.

Was diese Modelle von Whisper unterscheidet, ist Kontextbewusstsein. Beide akzeptieren drei Arten von Eingaben, die traditionelles ASR ignoriert:

EingabetypFunktionBeispiel
Text-PromptBeschreibt Thema und erwartetes Vokabular der Aufnahme„Ärztliche Konsultation zu kardiologischen Symptomen"
Keyword-BoostingListe von Begriffen, die im Transkript zu erwarten oder zu priorisieren sind„Atorvastatin, Myokardinfarkt, Troponin"
SprachhinweisTeilt dem Modell die wahrscheinlichste Sprache der Audiodatei mit„de" für Deutsch, „zh" für Chinesisch

Das Ergebnis ist eine drastisch höhere Genauigkeit bei Fachvokabular, Akzenten und lauten Umgebungen — genau den Szenarien, in denen Whisper traditionell versagte.

Warum es wichtig ist

Whisper war OpenAIs Flaggschiff-STT-Modell seit 2022. GPT-Transcribe ersetzt es nicht nur, sondern erreicht Quantensprünge in der Genauigkeit und adressiert zugleich die drei größten Schwachstellen von Whisper:

  1. Fachvokabular: Medizinische, rechtliche und technische Audioinhalte, die Whisper verwirrten, werden durch Keyword- und Prompt-Hinweise jetzt genau transkribiert.
  2. Akzente und Dialekte: Sprachhinweise ermöglichen es dem Modell, die wahrscheinliche Sprache und den Akzent zu kennen, bevor es mit der Transkription beginnt.
  3. Laute Umgebungen: Kontextbewusste Verarbeitung filtert Hintergrundgeräusche effektiver als die generische Pipeline von Whisper.

Und das alles zu einem niedrigeren Preis. GPT-Transcribes Preis von 4,50 $/1K Minuten liegt 25 % unter dem von GPT-4o Transcribe (6,00 $/1K Minuten) und ist damit die kostengünstigste hochpräzise STT-Option, die OpenAI je angeboten hat.

GPT-Live-Transcribe adressiert eine andere Nische: Live-Untertitelung, Meeting-Assistenten und Voice-Agenten, bei denen Reaktionen unter einer Sekunde nicht verhandelbar sind. Zu 17 $/1K Minuten ist es eine Premium-Option, aber der einstellbare Latenzbereich und das Streaming-Transkriptformat machen es zum ersten brauchbaren Live-STT-Modell von OpenAI, das nicht auf Kompromisse bei der Genauigkeit angewiesen ist.

Was zu tun ist

  1. Wenn Sie Whisper oder GPT-4o Transcribe verwenden, migrieren Sie. GPT-Transcribe verwendet dieselben API-Endpunkte, sodass die Migration ein Drop-in ist — Sie erhalten eine messbar bessere Genauigkeit zu einem niedrigeren Preis.
  2. Wenn Sie Echtzeit-Streaming benötigen, evaluieren Sie GPT-Live-Transcribe. Die einstellbare Latenz und das Streaming-Transkript-Format machen es zum neuen Standard für Voice-Agenten und Live-Untertitelung.
  3. Bleiben Sie bei gpt-4o-transcribe-diarize, wenn Sie Sprecherlabels oder Wort-Timestamps benötigen. GPT-Transcribe und GPT-Live-Transcribe unterstützen keine Diarisierung oder Wort-Timestamps — gpt-4o-transcribe-diarize bleibt die Option für diese Funktionen.

Was zu tun ist

  1. 1 Add context prompts and keyword lists to your requests — the accuracy gain on domain-specific audio is the biggest differentiator from Whisper
  2. 2 Swap whisper-1 to gpt-transcribe in your transcription endpoint — same API shape, 52% fewer errors, 25% lower cost
  3. 3 Replace gpt-realtime-whisper with gpt-live-transcribe for live captioning and voice agent pipelines
  4. 4 Keep gpt-4o-transcribe-diarize if your pipeline depends on speaker labels or word-level timestamps

Betroffene Tools & Modelle

Nie wieder etwas verpassen

Das wöchentliche Delta — nur Urteilsänderungen und dringende Punkte. Kein Füllmaterial.

Mit dem Abonnieren stimmst du unserer Datenschutzerklärung zu. Jederzeit abbestellbar.