DeepSeek V4 GA — Liang Wenfeng Supostamente Aposta em AGI Antes de Lucro

DeepSeek logoDeepSeekImportante2 de agosto de 2026Modelos
O que aconteceu
DeepSeek V4's official release launched in mid-July with Pro (1.6T/49B active, $0.435/$0.87 per 1M tokens) and Flash (284B/13B, $0.14/$0.28). An unconfirmed investor transcript published by Tencent Tech and analyzed by HelloChinaTech reportedly reveals an AGI-first strategy from founder Liang Wenfeng.
Porque é importante
Per the unconfirmed transcript, the most strategically significant Chinese AI founder statement of 2026 landed alongside a near-frontier open-weight model at commodity pricing. Liang's reported message: China trails the US by 6–18 months, compute is the only bottleneck, and DeepSeek will keep its strongest models open-source at cost-recovery pricing.
O que fazer
Update your API model field from deepseek-chat to deepseek-v4-flash before the July 24 15:59 UTC cutoff. Evaluate Pro vs. Flash — Flash for high-throughput at $0.28/M output, Pro for heavy reasoning at $0.87/M.

Veredito: A DeepSeek acabou de fazer duas coisas ao mesmo tempo — lançou um modelo quase-fronteira a preço de commodity e publicou o que pode ser a declaração mais estrategicamente significativa de um fundador chinês de IA em 2026 — embora a transcrição não tenha sido confirmada pela DeepSeek.

Em 19 de julho, o DeepSeek V4 entrou em GA com duas variantes: Pro (1,6T total, 49B ativos) e Flash (284B total, 13B ativos), ambas com licença MIT e janela de contexto de 1M tokens. O modelo é o lançamento de código com pesos abertos mais forte disponível — SWE-bench Verified 80,6% no Pro e 79,0% no Flash, com o Pro marcando 3.206 Elo no Codeforces. A $0,435/$0,87 por milhão de tokens, o V4 Pro entrega capacidade quase-fronteira a aproximadamente 1/57 do custo de saída do Fable 5.

Na mesma semana, uma transcrição de investidor de quase 4 horas do fundador Liang Wenfeng — transcrita pelo Tencent Tech e analisada pelo HelloChinaTech — supostamente expôs a estratégia da DeepSeek com franqueza incomum: AGI é o único objetivo, open-source é permanente, e a lacuna de IA da China com os EUA se reduz a uma única variável. A DeepSeek não confirmou o registro.

O que aconteceu

O lançamento. O DeepSeek V4 GA foi lançado em duas variantes em 19 de julho. O Pro ativa 49B de 1,6T parâmetros por token; o Flash ativa 13B de 284B. Ambos usam uma arquitetura de atenção híbrida combinando Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA) que reduz os FLOPs de inferência por token a 27% do custo do V3.2 e encolhe o KV cache para 10% (DeepSeek V4 Pro Model Card(abre num novo separador), 2026).

Preços. Taxas oficiais da API da DeepSeek: V4 Pro a $0,435/M input (cache miss) e $0,87/M output; V4 Flash a $0,14/M input e $0,28/M output (DeepSeek API Docs(abre num novo separador), 2026). Input com cache hit cai para $0,003625/M no Pro e $0,0028/M no Flash. Ambos oferecem janela de contexto de 1M tokens com 384K de output máximo, suportam modos thinking e non-thinking, e usam endpoints compatíveis com OpenAI.

ModeloPreço de output / 1M tokens
DeepSeek V4 Flash$0,28
DeepSeek V4 Pro$0,87
GPT-5.6 Sol$30
Claude Fable 5$50

Aposentadoria dos endpoints legados. Os endpoints deepseek-chat e deepseek-reasoner serão desligados permanentemente hoje, 24 de julho às 15:59 UTC (DeepSeek API Docs(abre num novo separador), 2026). Mude para deepseek-v4-flash (modo non-thinking ou thinking) ou deepseek-v4-pro para reasoning pesado. Seu base_url permanece o mesmo — apenas o campo model muda.

A transcrição de Liang Wenfeng

Em uma transcrição de investidor de 118 itens publicada pelo Tencent Tech e analisada pelo HelloChinaTech, o fundador da DeepSeek cobriu estratégia de AGI, suprimento de chips, preços, retenção de equipe e o aporte de $7,4B da empresa com franqueza incomum. A DeepSeek não confirmou o registro.

Sobre a lacuna EUA-China: Segundo a transcrição, Liang teria dito: "Todas as diferenças que vemos, incluindo talento, capacidade de modelo e aplicações, podem ser atribuídas a diferenças em recursos de computação" (HelloChinaTech(abre num novo separador), 2026). Liang estimou que a China está de 6 a 18 meses atrás dos EUA, com todo o déficit se reduzindo a compute utilizável — não talento, não ambição, não estratégia.

Sobre scaling: Segundo a transcrição, Liang teria dito: "Nós acreditamos em scaling. Maior é sempre melhor. O que nos impede de escalar é compute, não desejo. Treinamos um modelo deste tamanho não porque é suficiente, mas porque é tudo que nossos recursos permitem."

Sobre a Huawei: Segundo a transcrição, Liang teria afirmado que o "super-node Ascend 950 pode substituir totalmente Nvidia GB200 e GB300 em performance e preço", alegando uma proporção de 4:1 em chips. Ele revelou que a DeepSeek já roda em um stack de compilador próprio chamado TileLang: "Nós já quase não dependemos do ecossistema da Nvidia" (HelloChinaTech(abre num novo separador), 2026).

Sobre open-source: Segundo a transcrição, Liang teria dito: "Nosso modelo mais forte provavelmente também será open-source. Não consigo ver que benefício o closed-source traz." Ele citou a ByteDance como exemplo: "O modelo deles é closed-source. Qual é o benefício? Não vejo nenhum."

Sobre preços: Segundo a transcrição, Liang teria descrito uma fórmula simples — comprar equipamento, recuperar o custo em 10 meses. "Eu poderia aumentar o preço pela metade, ou dobrá-lo, e o consumo de tokens quase não mudaria" (HelloChinaTech(abre num novo separador), 2026). A empresa escolhe não fazer isso.

Sobre AGI vs lucro: Segundo a transcrição, Liang teria dito: "Contenção é uma estratégia. Às vezes você abre mão de algumas coisas para ganhar mais de outras." Liang posicionou a ambição comercial mais estreita da DeepSeek como uma escolha deliberada para maximizar a probabilidade de alcançar AGI. Ele também revelou que o aporte "substancialmente aliviou" o risco de retenção ao financiar grandes outorgas de opções para pesquisadores.

Por que isso importa

O lançamento do V4 e a transcrição de Liang chegam em uma semana em que os pesos abertos do Kimi K3 estão disponíveis, o Claude Opus 5 está vazando em provedores, e Washington está ativamente considerando sanções a modelos chineses de IA. Se confirmada, a mensagem de Liang é uma réplica direta à narrativa de sanções: a capacidade de IA da China é real, é de pesos abertos, é barata, e a lacuna de compute é o único gargalo.

Para desenvolvedores, a economia desloca todo o modelo de custo para pipelines de agentes de alto throughput. O V4 Pro a $0,87/M torna inferência em lote, codificação agêntica e pipelines RAG dramaticamente mais baratos que qualquer API de fronteira ocidental. A licença MIT significa que self-hosting é legal e prático.

Para a indústria, o que pode ser a declaração mais estrategicamente significativa de um fundador chinês de IA em 2026 — se confirmada — está agora circulando. Será citada em debates de política, memorandos de investimento e decks de estratégia competitiva por meses.

O que muda para você

1. Migre suas chamadas de API imediatamente. Os endpoints legados deepseek-chat e deepseek-reasoner serão desligados hoje, 24 de julho às 15:59 UTC. Atualize o campo model nas suas chamadas de API para deepseek-v4-flash (ou deepseek-v4-pro para reasoning pesado). Seu base_url permanece o mesmo.

2. Avalie Pro vs. Flash para sua carga de trabalho. O Flash entrega qualidade quase-Pro a aproximadamente um terço do custo para tarefas de alto throughput — chat, classificação, completação simples de código. O Pro é feito para profundidade: tarefas que exigem mais de ~2.000 tokens de reasoning antes de gerar uma resposta. Teste ambos na sua carga de trabalho; a mudança de estilo de CoT (GA usa "I'm"/"I'll" em vez de "Let me") confirma que você está na nova versão.

3. Considere self-hosting. Ambos os modelos têm licença MIT com pesos no Hugging Face. Para workloads regulados ou implantações sensíveis a residência de dados, self-hosting elimina custos por token e mantém os dados fora da API hospedada na China da DeepSeek.

FAQ

Quando os endpoints legados param de funcionar? 24 de julho de 2026 às 15:59 UTC — hoje. Depois disso, deepseek-chat e deepseek-reasoner retornarão erros. Mude para deepseek-v4-flash ou deepseek-v4-pro agora.

Devo usar V4 Pro ou V4 Flash? Flash para tarefas de alto throughput e baixa latência (chat, classificação, completação simples de código) a $0,28/M output. Pro para reasoning pesado — código complexo, tarefas de agente multi-etapa, matemática — a $0,87/M output. Se sua tarefa precisa de mais de ~2.000 tokens de reasoning antes de responder, comece com o Pro.

O DeepSeek V4 é open-source? Sim — ambas as variantes têm licença MIT com pesos no Hugging Face. Você pode baixar, modificar e fazer self-host sem restrições. A API é pay-per-token nas taxas fixas mostradas acima.

O que fazer

  1. 1 Migrate your API calls immediately: update the model field from deepseek-chat or deepseek-reasoner to deepseek-v4-flash before the July 24 15:59 UTC cutoff
  2. 2 Evaluate Pro vs. Flash for your workload — Flash for high-throughput chat and classification at $0.28/M output, Pro for complex coding and multi-step reasoning at $0.87/M
  3. 3 Consider self-hosting: both models are MIT-licensed on Hugging Face, eliminating per-token costs for regulated or data-sensitive workloads

Ferramentas e modelos afetados

Nunca mais precisas de te pôr a par

O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.

Ao subscreveres, aceitas a nossa Política de Privacidade. Cancela a subscrição quando quiseres.