DeepSeek V4 GA — Liang Wenfeng Supostamente Aposta em AGI Antes de Lucro
- O que aconteceu
- DeepSeek V4's official release launched in mid-July with Pro (1.6T/49B active, $0.435/$0.87 per 1M tokens) and Flash (284B/13B, $0.14/$0.28). An unconfirmed investor transcript published by Tencent Tech and analyzed by HelloChinaTech reportedly reveals an AGI-first strategy from founder Liang Wenfeng.
- Porque é importante
- Per the unconfirmed transcript, the most strategically significant Chinese AI founder statement of 2026 landed alongside a near-frontier open-weight model at commodity pricing. Liang's reported message: China trails the US by 6–18 months, compute is the only bottleneck, and DeepSeek will keep its strongest models open-source at cost-recovery pricing.
- O que fazer
- Update your API model field from deepseek-chat to deepseek-v4-flash before the July 24 15:59 UTC cutoff. Evaluate Pro vs. Flash — Flash for high-throughput at $0.28/M output, Pro for heavy reasoning at $0.87/M.
Veredito: A DeepSeek acabou de fazer duas coisas ao mesmo tempo — lançou um modelo quase-fronteira a preço de commodity e publicou o que pode ser a declaração mais estrategicamente significativa de um fundador chinês de IA em 2026 — embora a transcrição não tenha sido confirmada pela DeepSeek.
Em 19 de julho, o DeepSeek V4 entrou em GA com duas variantes: Pro (1,6T total, 49B ativos) e Flash (284B total, 13B ativos), ambas com licença MIT e janela de contexto de 1M tokens. O modelo é o lançamento de código com pesos abertos mais forte disponível — SWE-bench Verified 80,6% no Pro e 79,0% no Flash, com o Pro marcando 3.206 Elo no Codeforces. A $0,435/$0,87 por milhão de tokens, o V4 Pro entrega capacidade quase-fronteira a aproximadamente 1/57 do custo de saída do Fable 5.
Na mesma semana, uma transcrição de investidor de quase 4 horas do fundador Liang Wenfeng — transcrita pelo Tencent Tech e analisada pelo HelloChinaTech — supostamente expôs a estratégia da DeepSeek com franqueza incomum: AGI é o único objetivo, open-source é permanente, e a lacuna de IA da China com os EUA se reduz a uma única variável. A DeepSeek não confirmou o registro.
O que aconteceu
O lançamento. O DeepSeek V4 GA foi lançado em duas variantes em 19 de julho. O Pro ativa 49B de 1,6T parâmetros por token; o Flash ativa 13B de 284B. Ambos usam uma arquitetura de atenção híbrida combinando Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA) que reduz os FLOPs de inferência por token a 27% do custo do V3.2 e encolhe o KV cache para 10% (DeepSeek V4 Pro Model Card(abre num novo separador), 2026).
Preços. Taxas oficiais da API da DeepSeek: V4 Pro a $0,435/M input (cache miss) e $0,87/M output; V4 Flash a $0,14/M input e $0,28/M output (DeepSeek API Docs(abre num novo separador), 2026). Input com cache hit cai para $0,003625/M no Pro e $0,0028/M no Flash. Ambos oferecem janela de contexto de 1M tokens com 384K de output máximo, suportam modos thinking e non-thinking, e usam endpoints compatíveis com OpenAI.
| Modelo | Preço de output / 1M tokens |
|---|---|
| DeepSeek V4 Flash | $0,28 |
| DeepSeek V4 Pro | $0,87 |
| GPT-5.6 Sol | $30 |
| Claude Fable 5 | $50 |
Aposentadoria dos endpoints legados. Os endpoints deepseek-chat e deepseek-reasoner serão desligados permanentemente hoje, 24 de julho às 15:59 UTC (DeepSeek API Docs(abre num novo separador), 2026). Mude para deepseek-v4-flash (modo non-thinking ou thinking) ou deepseek-v4-pro para reasoning pesado. Seu base_url permanece o mesmo — apenas o campo model muda.
A transcrição de Liang Wenfeng
Em uma transcrição de investidor de 118 itens publicada pelo Tencent Tech e analisada pelo HelloChinaTech, o fundador da DeepSeek cobriu estratégia de AGI, suprimento de chips, preços, retenção de equipe e o aporte de $7,4B da empresa com franqueza incomum. A DeepSeek não confirmou o registro.
Sobre a lacuna EUA-China: Segundo a transcrição, Liang teria dito: "Todas as diferenças que vemos, incluindo talento, capacidade de modelo e aplicações, podem ser atribuídas a diferenças em recursos de computação" (HelloChinaTech(abre num novo separador), 2026). Liang estimou que a China está de 6 a 18 meses atrás dos EUA, com todo o déficit se reduzindo a compute utilizável — não talento, não ambição, não estratégia.
Sobre scaling: Segundo a transcrição, Liang teria dito: "Nós acreditamos em scaling. Maior é sempre melhor. O que nos impede de escalar é compute, não desejo. Treinamos um modelo deste tamanho não porque é suficiente, mas porque é tudo que nossos recursos permitem."
Sobre a Huawei: Segundo a transcrição, Liang teria afirmado que o "super-node Ascend 950 pode substituir totalmente Nvidia GB200 e GB300 em performance e preço", alegando uma proporção de 4:1 em chips. Ele revelou que a DeepSeek já roda em um stack de compilador próprio chamado TileLang: "Nós já quase não dependemos do ecossistema da Nvidia" (HelloChinaTech(abre num novo separador), 2026).
Sobre open-source: Segundo a transcrição, Liang teria dito: "Nosso modelo mais forte provavelmente também será open-source. Não consigo ver que benefício o closed-source traz." Ele citou a ByteDance como exemplo: "O modelo deles é closed-source. Qual é o benefício? Não vejo nenhum."
Sobre preços: Segundo a transcrição, Liang teria descrito uma fórmula simples — comprar equipamento, recuperar o custo em 10 meses. "Eu poderia aumentar o preço pela metade, ou dobrá-lo, e o consumo de tokens quase não mudaria" (HelloChinaTech(abre num novo separador), 2026). A empresa escolhe não fazer isso.
Sobre AGI vs lucro: Segundo a transcrição, Liang teria dito: "Contenção é uma estratégia. Às vezes você abre mão de algumas coisas para ganhar mais de outras." Liang posicionou a ambição comercial mais estreita da DeepSeek como uma escolha deliberada para maximizar a probabilidade de alcançar AGI. Ele também revelou que o aporte "substancialmente aliviou" o risco de retenção ao financiar grandes outorgas de opções para pesquisadores.
Por que isso importa
O lançamento do V4 e a transcrição de Liang chegam em uma semana em que os pesos abertos do Kimi K3 estão disponíveis, o Claude Opus 5 está vazando em provedores, e Washington está ativamente considerando sanções a modelos chineses de IA. Se confirmada, a mensagem de Liang é uma réplica direta à narrativa de sanções: a capacidade de IA da China é real, é de pesos abertos, é barata, e a lacuna de compute é o único gargalo.
Para desenvolvedores, a economia desloca todo o modelo de custo para pipelines de agentes de alto throughput. O V4 Pro a $0,87/M torna inferência em lote, codificação agêntica e pipelines RAG dramaticamente mais baratos que qualquer API de fronteira ocidental. A licença MIT significa que self-hosting é legal e prático.
Para a indústria, o que pode ser a declaração mais estrategicamente significativa de um fundador chinês de IA em 2026 — se confirmada — está agora circulando. Será citada em debates de política, memorandos de investimento e decks de estratégia competitiva por meses.
O que muda para você
1. Migre suas chamadas de API imediatamente. Os endpoints legados deepseek-chat e deepseek-reasoner serão desligados hoje, 24 de julho às 15:59 UTC. Atualize o campo model nas suas chamadas de API para deepseek-v4-flash (ou deepseek-v4-pro para reasoning pesado). Seu base_url permanece o mesmo.
2. Avalie Pro vs. Flash para sua carga de trabalho. O Flash entrega qualidade quase-Pro a aproximadamente um terço do custo para tarefas de alto throughput — chat, classificação, completação simples de código. O Pro é feito para profundidade: tarefas que exigem mais de ~2.000 tokens de reasoning antes de gerar uma resposta. Teste ambos na sua carga de trabalho; a mudança de estilo de CoT (GA usa "I'm"/"I'll" em vez de "Let me") confirma que você está na nova versão.
3. Considere self-hosting. Ambos os modelos têm licença MIT com pesos no Hugging Face. Para workloads regulados ou implantações sensíveis a residência de dados, self-hosting elimina custos por token e mantém os dados fora da API hospedada na China da DeepSeek.
FAQ
Quando os endpoints legados param de funcionar? 24 de julho de 2026 às 15:59 UTC — hoje. Depois disso, deepseek-chat e deepseek-reasoner retornarão erros. Mude para deepseek-v4-flash ou deepseek-v4-pro agora.
Devo usar V4 Pro ou V4 Flash? Flash para tarefas de alto throughput e baixa latência (chat, classificação, completação simples de código) a $0,28/M output. Pro para reasoning pesado — código complexo, tarefas de agente multi-etapa, matemática — a $0,87/M output. Se sua tarefa precisa de mais de ~2.000 tokens de reasoning antes de responder, comece com o Pro.
O DeepSeek V4 é open-source? Sim — ambas as variantes têm licença MIT com pesos no Hugging Face. Você pode baixar, modificar e fazer self-host sem restrições. A API é pay-per-token nas taxas fixas mostradas acima.
O que fazer
- 1 Migrate your API calls immediately: update the model field from deepseek-chat or deepseek-reasoner to deepseek-v4-flash before the July 24 15:59 UTC cutoff
- 2 Evaluate Pro vs. Flash for your workload — Flash for high-throughput chat and classification at $0.28/M output, Pro for complex coding and multi-step reasoning at $0.87/M
- 3 Consider self-hosting: both models are MIT-licensed on Hugging Face, eliminating per-token costs for regulated or data-sensitive workloads
Ferramentas e modelos afetados
Nunca mais precisas de te pôr a par
O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.