DeepSeek V4 GA — Liang Wenfeng setzt Berichten zufolge auf AGI statt Profit

DeepSeek logoDeepSeekWichtig2. August 2026Modelle
Was ist passiert
DeepSeek V4's official release launched in mid-July with Pro (1.6T/49B active, $0.435/$0.87 per 1M tokens) and Flash (284B/13B, $0.14/$0.28). An unconfirmed investor transcript published by Tencent Tech and analyzed by HelloChinaTech reportedly reveals an AGI-first strategy from founder Liang Wenfeng.
Warum es wichtig ist
Per the unconfirmed transcript, the most strategically significant Chinese AI founder statement of 2026 landed alongside a near-frontier open-weight model at commodity pricing. Liang's reported message: China trails the US by 6–18 months, compute is the only bottleneck, and DeepSeek will keep its strongest models open-source at cost-recovery pricing.
Was zu tun ist
Update your API model field from deepseek-chat to deepseek-v4-flash before the July 24 15:59 UTC cutoff. Evaluate Pro vs. Flash — Flash for high-throughput at $0.28/M output, Pro for heavy reasoning at $0.87/M.

Urteil: DeepSeek hat gerade zwei Dinge gleichzeitig getan — ein Frontier-nahes Modell zu Commodity-Preisen ausgeliefert und das vielleicht strategisch bedeutsamste Statement eines chinesischen KI-Gruenders 2026 veroeffentlicht — wobei das Transkript von DeepSeek nicht bestaetigt ist.

Am 19. Juli ging DeepSeek V4 mit zwei Varianten in GA: Pro (1,6T gesamt, 49B aktiv) und Flash (284B gesamt, 13B aktiv), beide MIT-lizenziert mit 1M-Token-Kontextfenster. Das Modell ist der staerkste verfuegbare Open-Weight-Coding-Release — SWE-bench Verified 80,6% bei Pro und 79,0% bei Flash, wobei Pro 3.206 Elo auf Codeforces erreicht. Zu $0,435/$0,87 pro Million Tokens liefert V4 Pro Frontier-nahe Leistung zu etwa 1/57 von Fable 5's Output-Kosten.

In derselben Woche legte ein fast 4-stuendiges Investoren-Transkript von Gruender Liang Wenfeng — transkribiert von Tencent Tech und analysiert von HelloChinaTech — Berichten zufolge DeepSeeks Strategie mit ungewoehnlicher Direktheit dar: AGI ist das einzige Ziel, Open Source ist dauerhaft, und Chinas KI-Rueckstand zu den USA schrumpft auf eine einzige Variable. DeepSeek hat den Bericht nicht bestaetigt.

Was passiert ist

Der Launch. DeepSeek V4 GA wurde am 19. Juli in zwei Varianten ausgeliefert. Pro aktiviert 49B von 1,6T Parametern pro Token; Flash aktiviert 13B von 284B. Beide nutzen eine hybride Attention-Architektur, die Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA) kombiniert und die Single-Token-Inferenz-FLOPs auf 27% von V3.2's Kosten senkt sowie den KV-Cache auf 10% verkleinert (DeepSeek V4 Pro Model Card(wird in einem neuen Tab geöffnet), 2026).

Preise. DeepSeeks offizielle API-Raten: V4 Pro zu $0,435/M Input (Cache Miss) und $0,87/M Output; V4 Flash zu $0,14/M Input und $0,28/M Output (DeepSeek API Docs(wird in einem neuen Tab geöffnet), 2026). Cache-Hit-Input sinkt auf $0,003625/M fuer Pro und $0,0028/M fuer Flash. Beide bieten ein 1M-Token-Kontextfenster mit 384K Max-Output, unterstuetzen Thinking- und Non-Thinking-Modi und nutzen OpenAI-kompatible Endpunkte.

ModellOutput-Preis / 1M Tokens
DeepSeek V4 Flash$0,28
DeepSeek V4 Pro$0,87
GPT-5.6 Sol$30
Claude Fable 5$50

Abschaltung der Legacy-Endpunkte. Die deepseek-chat- und deepseek-reasoner-Endpunkte werden heute, am 24. Juli um 15:59 UTC, dauerhaft abgeschaltet (DeepSeek API Docs(wird in einem neuen Tab geöffnet), 2026). Wechseln Sie zu deepseek-v4-flash (Non-Thinking- oder Thinking-Modus) oder deepseek-v4-pro fuer intensiveres Reasoning. Ihre base_url bleibt gleich — nur das model-Feld aendert sich.

Das Liang Wenfeng-Transkript

In einem kursierenden 118-Punkte-Investoren-Transkript, veroeffentlicht von Tencent Tech und analysiert von HelloChinaTech, behandelte DeepSeeks Gruender AGI-Strategie, Chip-Versorgung, Preise, Team-Bindung und die $7,4-Milliarden-Finanzierungsrunde des Unternehmens mit ungewoehnlicher Offenheit. DeepSeek hat den Bericht nicht bestaetigt.

Zur US-China-Luecke: Laut dem Transkript soll Liang gesagt haben: "Alle Unterschiede, die wir sehen, einschliesslich Talent, Modellfaehigkeit und Anwendungen, lassen sich auf Unterschiede in den Compute-Ressourcen zurueckfuehren" (HelloChinaTech(wird in einem neuen Tab geöffnet), 2026). Liang schaetzte, dass China 6 bis 18 Monate hinter den USA liegt, wobei sich der gesamte Rueckstand auf verfuegbare Rechenleistung reduziert — nicht Talent, nicht Ehrgeiz, nicht Strategie.

Zum Scaling: Laut dem Transkript soll Liang gesagt haben: "Wir glauben an Scaling. Groesser ist immer besser. Was uns vom Scaling abhaelt, ist Compute, nicht der Wille. Wir trainieren ein Modell in dieser Groesse nicht, weil es ausreicht, sondern weil das alles ist, was unsere Ressourcen erlauben."

Zu Huawei: Laut dem Transkript soll Liang behauptet haben, dass der Ascend 950 "Super-Node Nvidia GB200 und GB300 in Leistung und Preis vollstaendig ersetzen kann", und ein 4:1-Chip-Verhaeltnis postuliert. Er legte offen, dass DeepSeek bereits auf einem eigenen Compiler-Stack namens TileLang laeuft: "Wir sind kaum noch von Nvidias Oekosystem abhaengig" (HelloChinaTech(wird in einem neuen Tab geöffnet), 2026).

Zu Open Source: Laut dem Transkript soll Liang gesagt haben: "Unser staerkstes Modell wird wahrscheinlich ebenfalls Open Source sein. Ich kann nicht erkennen, welchen Nutzen Closed Source bringt." Er nannte ByteDance als Beispiel: "Ihr Modell ist Closed Source. Was ist der Vorteil? Ich sehe keinen."

Zu Preisen: Laut dem Transkript soll Liang eine einfache Formel beschrieben haben — Ausruestung kaufen, Kosten in 10 Monaten amortisieren. "Ich koennte den Preis um die Haelfte oder das Doppelte erhoehen, und der Token-Verbrauch wuerde sich kaum aendern" (HelloChinaTech(wird in einem neuen Tab geöffnet), 2026). Das Unternehmen entscheidet sich dagegen.

Zu AGI vs. Profit: Laut dem Transkript soll Liang gesagt haben: "Zurueckhaltung ist eine Strategie. Manchmal gibst du einige Dinge auf, um mehr von anderen zu gewinnen." Liang positionierte DeepSeeks schmalere kommerzielle Ambition als bewusste Entscheidung, um die Wahrscheinlichkeit zu maximieren, AGI zu erreichen. Er legte zudem offen, dass die Finanzierungsrunde das Bindung-Risiko "erheblich entlastet" habe, indem sie grosse Aktienoptions-Zuteilungen fuer Forscher finanzierte.

Warum es wichtig ist

Der V4-Launch und Liangs Transkript landen in einer Woche, in der Kimi K3 Open Weights verfuegbar sind, Claude Opus 5 bei Providern durchsickert und Washington aktiv Sanktionen gegen chinesische KI-Modelle erwaegt. Falls bestaetigt, ist Liangs Botschaft eine direkte Widerlegung des Sanktions-Narrativs: Chinas KI-Faehigkeit ist real, sie ist Open-Weight, sie ist guenstig, und die Compute-Luecke ist der einzige Engpass.

Fuer Entwickler verschiebt die Oekonomie das gesamte Kostenmodell fuer hochdurchsatzfaehige Agent-Pipelines. V4 Pro zu $0,87/M macht Batch-Inferenz, agentisches Coding und RAG-Pipelines dramatisch guenstiger als jede westliche Frontier-API. Die MIT-Lizenz bedeutet, dass Self-Hosting legal und praktikabel ist.

Fuer die Branche kursiert nun das vielleicht strategisch bedeutsamste Statement eines chinesischen KI-Gruenders 2026 — falls bestaetigt. Es wird monatelang in Politikdebatten, Investment-Memos und Wettbewerbsstrategie-Decks zitiert werden.

Was sich fuer Sie aendert

1. Migrieren Sie Ihre API-Aufrufe sofort. Die Legacy-Endpunkte deepseek-chat und deepseek-reasoner werden heute, am 24. Juli um 15:59 UTC, abgeschaltet. Aktualisieren Sie das model-Feld in Ihren API-Aufrufen auf deepseek-v4-flash (oder deepseek-v4-pro fuer intensives Reasoning). Ihre base_url bleibt gleich.

2. Evaluieren Sie Pro vs. Flash fuer Ihre Workload. Flash liefert Pro-nahe Qualitaet zu etwa einem Drittel der Kosten fuer hochdurchsatzfaehige Aufgaben — Chat, Klassifikation, einfache Code-Vervollstaendigung. Pro ist fuer Tiefe gebaut: Aufgaben, die mehr als ~2.000 Reasoning-Tokens vor der Antwortgenerierung benoetigen. Testen Sie beide mit Ihrer eigenen Workload; der CoT-Stilwechsel (GA verwendet "I'm"/"I'll" statt "Let me") bestaetigt, dass Sie auf der neuen Version sind.

3. Erwaegen Sie Self-Hosting. Beide Modelle sind MIT-lizenziert mit Weights auf Hugging Face. Fuer regulierte Workloads oder datenresidenzsensible Deployments eliminiert Self-Hosting die Token-Kosten und haelt Daten von DeepSeeks China-gehosteter API fern.

FAQ

Wann funktionieren die Legacy-Endpunkte nicht mehr? 24. Juli 2026 um 15:59 UTC — heute. Danach geben deepseek-chat und deepseek-reasoner Fehler zurueck. Wechseln Sie jetzt zu deepseek-v4-flash oder deepseek-v4-pro.

Sollte ich V4 Pro oder V4 Flash nutzen? Flash fuer hochdurchsatzfaehige Aufgaben mit niedriger Latenz (Chat, Klassifikation, einfache Code-Vervollstaendigung) zu $0,28/M Output. Pro fuer intensives Reasoning — komplexes Coding, mehrschrittige Agent-Aufgaben, Mathematik — zu $0,87/M Output. Wenn Ihre Aufgabe mehr als ~2.000 Reasoning-Tokens vor der Antwort benoetigt, beginnen Sie mit Pro.

Ist DeepSeek V4 Open Source? Ja — beide Varianten sind MIT-lizenziert mit Weights auf Hugging Face. Sie koennen sie ohne Einschraenkung herunterladen, modifizieren und selbst hosten. Die API ist Pay-per-Token zu den oben genannten Flatrates.

Was zu tun ist

  1. 1 Migrate your API calls immediately: update the model field from deepseek-chat or deepseek-reasoner to deepseek-v4-flash before the July 24 15:59 UTC cutoff
  2. 2 Evaluate Pro vs. Flash for your workload — Flash for high-throughput chat and classification at $0.28/M output, Pro for complex coding and multi-step reasoning at $0.87/M
  3. 3 Consider self-hosting: both models are MIT-licensed on Hugging Face, eliminating per-token costs for regulated or data-sensitive workloads

Betroffene Tools & Modelle

Nie wieder etwas verpassen

Das wöchentliche Delta — nur Urteilsänderungen und dringende Punkte. Kein Füllmaterial.

Mit dem Abonnieren stimmst du unserer Datenschutzerklärung zu. Jederzeit abbestellbar.