DeepSeek V4 en GA — Liang Wenfeng miserait sur l'AGI plutôt que sur le profit
- Ce qui s’est passé
- DeepSeek V4's official release launched in mid-July with Pro (1.6T/49B active, $0.435/$0.87 per 1M tokens) and Flash (284B/13B, $0.14/$0.28). An unconfirmed investor transcript published by Tencent Tech and analyzed by HelloChinaTech reportedly reveals an AGI-first strategy from founder Liang Wenfeng.
- Pourquoi c’est important
- Per the unconfirmed transcript, the most strategically significant Chinese AI founder statement of 2026 landed alongside a near-frontier open-weight model at commodity pricing. Liang's reported message: China trails the US by 6–18 months, compute is the only bottleneck, and DeepSeek will keep its strongest models open-source at cost-recovery pricing.
- Que faire
- Update your API model field from deepseek-chat to deepseek-v4-flash before the July 24 15:59 UTC cutoff. Evaluate Pro vs. Flash — Flash for high-throughput at $0.28/M output, Pro for heavy reasoning at $0.87/M.
Verdict : DeepSeek vient d'accomplir deux choses à la fois — livrer un modèle quasi de pointe à un tarif défiant toute concurrence, et publier ce qui pourrait être la déclaration de fondateur chinois la plus stratégiquement significative de 2026 — bien que la transcription reste non confirmée par DeepSeek.
Le 19 juillet, DeepSeek V4 est passé en disponibilité générale avec deux variantes : Pro (1 600 Md au total, 49 Md actifs) et Flash (284 Md au total, 13 Md actifs), toutes deux sous licence MIT avec une fenêtre de contexte d'un million de tokens. Ce modèle est la meilleure version à poids ouverts disponible pour le codage — SWE-bench Verified à 80,6 % pour Pro et 79,0 % pour Flash, Pro atteignant 3 206 Elo sur Codeforces. À 0,435 $/0,87 $ par million de tokens, V4 Pro offre des capacités quasi de pointe pour environ 1/57ᵉ du coût de sortie de Fable 5.
La même semaine, une transcription d'investisseur de près de 4 heures du fondateur Liang Wenfeng — retranscrite par Tencent Tech et analysée par HelloChinaTech — aurait exposé la stratégie de DeepSeek avec une franchise inhabituelle : l'AGI est le seul objectif, l'open source est permanent, et l'écart de la Chine avec les États-Unis en IA se réduit à une seule variable. DeepSeek n'a pas confirmé ces propos.
Ce qui s'est passé
Le lancement. DeepSeek V4 GA est sorti en deux variantes le 19 juillet. Pro active 49 Md de paramètres sur 1 600 Md par token ; Flash active 13 Md sur 284 Md. Les deux utilisent une architecture d'attention hybride combinant l'Attention Sparse Compressée (CSA) et l'Attention Fortement Compressée (HCA) qui réduit les FLOPs d'inférence par token à 27 % du coût de V3.2 et compresse le cache KV à 10 % (Fiche technique DeepSeek V4 Pro(s’ouvre dans un nouvel onglet), 2026).
Les tarifs. Les tarifs officiels de l'API DeepSeek : V4 Pro à 0,435 $/M en entrée (cache manqué) et 0,87 $/M en sortie ; V4 Flash à 0,14 $/M en entrée et 0,28 $/M en sortie (Documentation API DeepSeek(s’ouvre dans un nouvel onglet), 2026). L'entrée avec cache atteint 0,003625 $/M pour Pro et 0,0028 $/M pour Flash. Les deux offrent une fenêtre de contexte d'un million de tokens avec 384 K tokens de sortie maximale, supportent les modes avec et sans raisonnement, et utilisent des points de terminaison compatibles OpenAI.
| Modèle | Prix de sortie / 1M tokens |
|---|---|
| DeepSeek V4 Flash | 0,28 $ |
| DeepSeek V4 Pro | 0,87 $ |
| GPT-5.6 Sol | 30 $ |
| Claude Fable 5 | 50 $ |
Fin de vie des anciens points de terminaison. Les points de terminaison deepseek-chat et deepseek-reasoner seront définitivement arrêtés aujourd'hui, le 24 juillet à 15 h 59 UTC (Documentation API DeepSeek(s’ouvre dans un nouvel onglet), 2026). Passez à deepseek-v4-flash (mode sans ou avec raisonnement) ou deepseek-v4-pro pour un raisonnement plus lourd. Votre base_url reste la même — seul le champ model change.
La transcription de Liang Wenfeng
Dans une transcription d'investisseur de 118 points publiée par Tencent Tech et analysée par HelloChinaTech, le fondateur de DeepSeek a couvert la stratégie AGI, l'approvisionnement en puces, les tarifs, la rétention des talents et la levée de fonds de 7,4 Md$ de l'entreprise avec une franchise inhabituelle. DeepSeek n'a pas confirmé ces propos.
Sur l'écart États-Unis-Chine : D'après la transcription, Liang aurait déclaré : « Toutes les différences que nous observons, y compris les talents, les capacités des modèles et les applications, peuvent être attribuées aux différences de ressources de calcul » (HelloChinaTech(s’ouvre dans un nouvel onglet), 2026). Liang estimerait que la Chine accuse un retard de 6 à 18 mois sur les États-Unis, l'intégralité du déficit se résumant au calcul utilisable — ni le talent, ni l'ambition, ni la stratégie.
Sur le scaling : D'après la transcription, Liang aurait déclaré : « Nous croyons au scaling. Plus grand est toujours meilleur. Ce qui nous empêche de scaler, c'est le calcul, pas l'envie. Nous entraînons un modèle à cette taille non pas parce que c'est suffisant, mais parce que c'est tout ce que nos ressources permettent. »
Sur Huawei : D'après la transcription, Liang aurait affirmé que le « super-nœud » Ascend 950 « peut remplacer entièrement les Nvidia GB200 et GB300 en performance et en prix », en avançant un ratio de 4 pour 1. Il aurait révélé que DeepSeek fonctionne déjà sur une pile de compilation maison appelée TileLang : « Nous ne dépendons quasiment plus de l'écosystème Nvidia » (HelloChinaTech(s’ouvre dans un nouvel onglet), 2026).
Sur l'open source : D'après la transcription, Liang aurait déclaré : « Notre modèle le plus puissant sera probablement aussi en open source. Je ne vois pas ce que le closed source apporte de bon. » Il aurait cité ByteDance en exemple : « Leur modèle est closed source. Quel en est l'avantage ? Je n'en vois aucun. »
Sur les tarifs : D'après la transcription, Liang aurait décrit une formule simple — acheter l'équipement, récupérer le coût en 10 mois. « Je pourrais augmenter le prix de moitié, ou le doubler, et la consommation de tokens ne changerait quasiment pas » (HelloChinaTech(s’ouvre dans un nouvel onglet), 2026). L'entreprise choisit de ne pas le faire.
Sur l'AGI contre le profit : D'après la transcription, Liang aurait déclaré : « La retenue est une stratégie. Parfois, vous renoncez à certaines choses pour en gagner d'autres. » Liang positionnerait l'ambition commerciale plus restreinte de DeepSeek comme un choix délibéré pour maximiser la probabilité d'atteindre l'AGI. Il aurait également révélé que la levée de fonds a « substantiellement soulagé » le risque de rétention en finançant d'importantes attributions d'options pour les chercheurs.
Pourquoi c'est important
Le lancement de V4 et la transcription de Liang atterrissent dans une semaine où les poids ouverts de Kimi K3 sont disponibles, où Claude Opus 5 fuit chez les fournisseurs, et où Washington envisage activement des sanctions sur les modèles d'IA chinois. S'il est confirmé, le message de Liang est une réfutation directe du narratif des sanctions : la capacité de l'IA chinoise est réelle, elle est en poids ouverts, elle est bon marché, et l'écart de calcul est le seul goulot d'étranglement.
Pour les développeurs, l'économie bouleverse tout le modèle de coût des pipelines agentiques à haut débit. V4 Pro à 0,87 $/M rend l'inférence par lots, le codage agentique et les pipelines RAG radicalement moins chers que n'importe quelle API de pointe occidentale. La licence MIT signifie que l'auto-hébergement est légal et pratique.
Pour l'industrie, ce qui pourrait être la déclaration de fondateur chinois la plus stratégiquement significative de 2026 — si elle est confirmée — circule désormais. Elle sera citée dans les débats politiques, les notes d'investissement et les présentations stratégiques pendant des mois.
Ce qui change pour vous
1. Migrez vos appels API immédiatement. Les anciens points de terminaison deepseek-chat et deepseek-reasoner sont arrêtés aujourd'hui, le 24 juillet à 15 h 59 UTC. Mettez à jour le champ model dans vos appels API vers deepseek-v4-flash (ou deepseek-v4-pro pour le raisonnement lourd). Votre base_url reste la même.
2. Évaluez Pro vs Flash pour votre charge de travail. Flash offre une qualité quasi-Pro à environ un tiers du coût pour les tâches à haut débit — chat, classification, complétion de code simple. Pro est conçu pour la profondeur : les tâches nécessitant plus d'environ 2 000 tokens de raisonnement avant de générer une réponse. Testez les deux sur votre propre charge de travail ; le changement de style CoT (la version GA utilise « Je »/« Je vais » au lieu de « Laissez-moi ») confirme que vous êtes sur la nouvelle version.
3. Envisagez l'auto-hébergement. Les deux modèles sont sous licence MIT avec les poids disponibles sur Hugging Face. Pour les charges de travail réglementées ou les déploiements soumis à des contraintes de résidence des données, l'auto-hébergement élimine les coûts par token et garde les données hors de l'API hébergée en Chine par DeepSeek.
FAQ
Quand les anciens points de terminaison cesseront-ils de fonctionner ? Le 24 juillet 2026 à 15 h 59 UTC — aujourd'hui. Après cela, deepseek-chat et deepseek-reasoner retourneront des erreurs. Passez à deepseek-v4-flash ou deepseek-v4-pro dès maintenant.
Dois-je utiliser V4 Pro ou V4 Flash ? Flash pour les tâches à haut débit et faible latence (chat, classification, complétion de code simple) à 0,28 $/M en sortie. Pro pour le raisonnement lourd — codage complexe, tâches agentiques multi-étapes, mathématiques — à 0,87 $/M en sortie. Si votre tâche nécessite plus d'environ 2 000 tokens de raisonnement avant de répondre, commencez par Pro.
DeepSeek V4 est-il open source ? Oui — les deux variantes sont sous licence MIT avec les poids disponibles sur Hugging Face. Vous pouvez télécharger, modifier et auto-héberger sans restriction. L'API est en paiement par token aux tarifs forfaitaires indiqués ci-dessus.
Que faire
- 1 Migrate your API calls immediately: update the model field from deepseek-chat or deepseek-reasoner to deepseek-v4-flash before the July 24 15:59 UTC cutoff
- 2 Evaluate Pro vs. Flash for your workload — Flash for high-throughput chat and classification at $0.28/M output, Pro for complex coding and multi-step reasoning at $0.87/M
- 3 Consider self-hosting: both models are MIT-licensed on Hugging Face, eliminating per-token costs for regulated or data-sensitive workloads
Outils et modèles concernés
Ne ratez plus jamais une mise à jour
Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.