DeepSeek V4 GA — Liang Wenfeng Supuestamente Apuesta por AGI sobre Ganancia

DeepSeek logoDeepSeekImportante2 de agosto de 2026Modelos
Qué pasó
DeepSeek V4's official release launched in mid-July with Pro (1.6T/49B active, $0.435/$0.87 per 1M tokens) and Flash (284B/13B, $0.14/$0.28). An unconfirmed investor transcript published by Tencent Tech and analyzed by HelloChinaTech reportedly reveals an AGI-first strategy from founder Liang Wenfeng.
Por qué importa
Per the unconfirmed transcript, the most strategically significant Chinese AI founder statement of 2026 landed alongside a near-frontier open-weight model at commodity pricing. Liang's reported message: China trails the US by 6–18 months, compute is the only bottleneck, and DeepSeek will keep its strongest models open-source at cost-recovery pricing.
Qué hacer
Update your API model field from deepseek-chat to deepseek-v4-flash before the July 24 15:59 UTC cutoff. Evaluate Pro vs. Flash — Flash for high-throughput at $0.28/M output, Pro for heavy reasoning at $0.87/M.

Veredicto: DeepSeek acaba de hacer dos cosas a la vez — lanzó un modelo casi frontera a precios ultracompetitivos, y publicó lo que podría ser la declaración de fundador de IA china más estratégicamente significativa de 2026 — aunque la transcripción sigue sin ser confirmada por DeepSeek.

El 19 de julio, DeepSeek V4 alcanzó GA con dos variantes: Pro (1.6T total, 49B activos) y Flash (284B total, 13B activos), ambas con licencia MIT y una ventana de contexto de 1M tokens. El modelo es el lanzamiento de codificación de pesos abiertos más fuerte disponible — SWE-bench Verified 80.6% en Pro y 79.0% en Flash, con Pro alcanzando 3,206 Elo en Codeforces. A $0.435/$0.87 por millón de tokens, V4 Pro ofrece capacidad casi frontera a aproximadamente 1/57 del costo de salida de Fable 5.

La misma semana, una transcripción de inversionistas de casi 4 horas del fundador Liang Wenfeng — transcrita por Tencent Tech y analizada por HelloChinaTech — supuestamente expuso la estrategia de DeepSeek con una franqueza inusual: AGI es el único objetivo, el código abierto es permanente, y la brecha de IA de China con EE.UU. colapsa a una sola variable. DeepSeek no ha confirmado la veracidad de la transcripción.

Qué pasó

El lanzamiento. DeepSeek V4 GA se lanzó en dos variantes el 19 de julio. Pro activa 49B de 1.6T parámetros por token; Flash activa 13B de 284B. Ambas usan una arquitectura de atención híbrida que combina Compressed Sparse Attention (CSA) y Heavily Compressed Attention (HCA) que reduce los FLOPs de inferencia por token único al 27% del costo de V3.2 y comprime el KV cache al 10% (DeepSeek V4 Pro Model Card(se abre en una pestaña nueva), 2026).

Precios. Tarifas oficiales de la API de DeepSeek: V4 Pro a $0.435/M entrada (cache miss) y $0.87/M salida; V4 Flash a $0.14/M entrada y $0.28/M salida (DeepSeek API Docs(se abre en una pestaña nueva), 2026). La entrada con cache hit baja a $0.003625/M para Pro y $0.0028/M para Flash. Ambas ofrecen una ventana de contexto de 1M tokens con 384K de salida máxima, soportan modos de pensamiento y no pensamiento, y usan endpoints compatibles con OpenAI.

ModeloPrecio de salida / 1M tokens
DeepSeek V4 Flash$0.28
DeepSeek V4 Pro$0.87
GPT-5.6 Sol$30
Claude Fable 5$50

Retiro de endpoints legacy. Los endpoints deepseek-chat y deepseek-reasoner se apagan permanentemente hoy, 24 de julio a las 15:59 UTC (DeepSeek API Docs(se abre en una pestaña nueva), 2026). Cambia a deepseek-v4-flash (modo sin pensamiento o con pensamiento) o deepseek-v4-pro para razonamiento más pesado. Tu base_url sigue igual — solo cambia el campo model.

La transcripción de Liang Wenfeng

En una transcripción circulada de 118 ítems para inversionistas publicada por Tencent Tech y analizada por HelloChinaTech, el fundador de DeepSeek cubrió estrategia AGI, suministro de chips, precios, retención de equipo y la recaudación de $7.4B de la empresa con una franqueza inusual. DeepSeek no ha confirmado la veracidad de la transcripción.

Sobre la brecha EE.UU.-China: Según la transcripción, Liang supuestamente dijo: "Todas las diferencias que vemos, incluyendo talento, capacidad de modelo y aplicaciones, pueden atribuirse a diferencias en recursos de cómputo" (HelloChinaTech(se abre en una pestaña nueva), 2026). Liang estimó que China va de 6 a 18 meses por detrás de EE.UU., con todo el déficit colapsando al cómputo utilizable — no talento, no ambición, no estrategia.

Sobre el escalado: Según la transcripción, Liang supuestamente dijo: "Creemos en el escalado. Más grande siempre es mejor. Lo que nos detiene de escalar es el cómputo, no el deseo. Entrenamos un modelo de este tamaño no porque sea suficiente, sino porque eso es todo lo que nuestros recursos permiten."

Sobre Huawei: Según la transcripción, Liang supuestamente afirmó que el "super-nodo Ascend 950 puede reemplazar completamente a Nvidia GB200 y GB300 en rendimiento y precio," afirmando una proporción de chips de 4:1. Reveló que DeepSeek ya corre sobre una pila de compilador personalizada llamada TileLang: "Ya casi no dependemos del ecosistema de Nvidia" (HelloChinaTech(se abre en una pestaña nueva), 2026).

Sobre el código abierto: Según la transcripción, Liang supuestamente dijo: "Nuestro modelo más fuerte probablemente también será de código abierto. No puedo ver qué bien hace el código cerrado." Citó a ByteDance como su ejemplo: "Su modelo es de código cerrado. ¿Cuál es el beneficio? No veo ninguno."

Sobre los precios: Según la transcripción, Liang supuestamente describió una fórmula simple — comprar equipo, recuperar el costo en 10 meses. "Podría aumentar el precio en un 50%, o duplicarlo, y el consumo de tokens apenas cambiaría" (HelloChinaTech(se abre en una pestaña nueva), 2026). La empresa elige no hacerlo.

Sobre AGI vs ganancia: Según la transcripción, Liang supuestamente dijo: "La contención es una estrategia. A veces renuncias a algunas cosas para ganar más de otras." Liang posicionó la ambición comercial más estrecha de DeepSeek como una elección deliberada para maximizar la probabilidad de alcanzar AGI. También reveló que la recaudación "alivió sustancialmente" el riesgo de retención al financiar grandes concesiones de opciones para investigadores.

Por qué importa

El lanzamiento de V4 y la transcripción de Liang aterrizan en una semana donde los pesos abiertos de Kimi K3 están disponibles, Claude Opus 5 se está filtrando en múltiples proveedores, y Washington está sopesando activamente sanciones sobre modelos de IA chinos. De confirmarse, el mensaje de Liang es una refutación directa a la narrativa de sanciones: la capacidad de IA de China es real, es de pesos abiertos, es barata, y la brecha de cómputo es el único cuello de botella.

Para desarrolladores, la economía cambia todo el modelo de costo para pipelines de agentes de alto rendimiento. V4 Pro a $0.87/M hace que la inferencia por lotes, la codificación agéntica y los pipelines RAG sean dramáticamente más baratos que cualquier API de frontera occidental. La licencia MIT significa que el autoalojamiento es legal y práctico.

Para la industria, lo que podría ser la declaración de fundador de IA china más estratégicamente significativa de 2026 — de confirmarse — está ahora circulando. Será citada en debates de política, memorandos de inversión y decks de estrategia competitiva durante meses.

Qué cambia para ti

1. Migra tus llamadas de API inmediatamente. Los endpoints legacy deepseek-chat y deepseek-reasoner se retiran hoy, 24 de julio a las 15:59 UTC. Actualiza el campo model en tus llamadas de API a deepseek-v4-flash (o deepseek-v4-pro para razonamiento pesado). Tu base_url sigue igual.

2. Evalúa Pro vs. Flash para tu carga de trabajo. Flash ofrece calidad casi Pro a aproximadamente un tercio del costo para tareas de alto rendimiento — chat, clasificación, autocompletado de código simple. Pro está diseñado para profundidad: tareas que requieren más de ~2,000 tokens de razonamiento antes de generar una respuesta. Prueba ambas en tu propia carga de trabajo; el cambio de estilo CoT (GA usa "I'm"/"I'll" en lugar de "Let me") confirma que estás en la nueva versión.

3. Considera el autoalojamiento. Ambos modelos tienen licencia MIT con pesos en Hugging Face. Para cargas de trabajo reguladas o despliegues sensibles a residencia de datos, el autoalojamiento elimina los costos por token y mantiene los datos fuera de la API alojada en China de DeepSeek.

FAQ

¿Cuándo dejan de funcionar los endpoints legacy? 24 de julio de 2026 a las 15:59 UTC — hoy. Después de eso, deepseek-chat y deepseek-reasoner devolverán errores. Cambia a deepseek-v4-flash o deepseek-v4-pro ahora.

¿Debo usar V4 Pro o V4 Flash? Flash para tareas de alto rendimiento y baja latencia (chat, clasificación, autocompletado de código simple) a $0.28/M de salida. Pro para razonamiento pesado — codificación compleja, tareas de agente multi-paso, matemáticas — a $0.87/M de salida. Si tu tarea necesita más de ~2,000 tokens de razonamiento antes de responder, empieza con Pro.

¿Es DeepSeek V4 de código abierto? Sí — ambas variantes tienen licencia MIT con pesos en Hugging Face. Puedes descargar, modificar y autoalojar sin restricción. La API es de pago por token a las tarifas planas mostradas arriba.

Qué hacer

  1. 1 Migrate your API calls immediately: update the model field from deepseek-chat or deepseek-reasoner to deepseek-v4-flash before the July 24 15:59 UTC cutoff
  2. 2 Evaluate Pro vs. Flash for your workload — Flash for high-throughput chat and classification at $0.28/M output, Pro for complex coding and multi-step reasoning at $0.87/M
  3. 3 Consider self-hosting: both models are MIT-licensed on Hugging Face, eliminating per-token costs for regulated or data-sensitive workloads

Herramientas y modelos afectados

No vuelvas a tener que ponerte al día

El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.

Al suscribirte aceptas nuestra Política de privacidad. Cancela cuando quieras.