Kimi K3 Lidera o Arena WebDev a $3/$15, Pesos Abertos em 27 de Julho
- O que aconteceu
- Moonshot AI launched Kimi K3, a 2.8T open-weight MoE model that beat Claude Fable 5 for #1 on Arena Code WebDev (1679) at $3/$15 per 1M tokens.
- Porque é importante
- It's the third Chinese frontier-competitive open-weight model this month — Hy3, GLM-5.2, and now K3 — while Google's Gemini 3.5 Pro was confirmed 'months behind' the same day, making the open-weight frontier a genuine challenge to US closed models.
- O que fazer
- Watch the July 27 weight release, and if K3 ships open as promised, evaluate it for coding workloads where Fable 5's $10/$50 pricing is unsustainable — K3 at $3/$15 with 90%+ cache-hit rates sets a new cost baseline.
O Kimi K3 é o maior modelo de pesos abertos já lançado — e seu primeiro feito é superar o Claude Fable 5 pelo primeiro lugar no Arena Code WebDev com um custo três vezes menor.
A Moonshot AI lançou o modelo Mixture-of-Experts de 2,8 trilhões de parâmetros em 16 de julho de 2026, com preço fixo de $3/$15 por milhão de tokens (Moonshot AI, 2026). O acesso via API já está disponível no app Kimi, Kimi Code e através de um endpoint compatível com OpenAI. Os pesos abertos estão prometidos para 27 de julho — se entregues, o K3 será o maior modelo baixável por uma margem de quase 3x sobre o próximo maior lançamento de pesos abertos.
O que o Kimi K3 entrega
O K3 marcou 1679 no Arena Code WebDev — o primeiro lugar, à frente tanto do Fable 5 quanto do GPT-5.6 Sol X-High em tarefas de codificação front-end (LMSYS Arena, 2026). No índice de inteligência mais amplo da Artificial Analysis, ele alcança 57 — comparável ao Claude Opus 4.8 e GPT-5.5, embora ainda atrás do Fable 5 e do Sol nos benchmarks de raciocínio geral.
Dois novos componentes arquitetônicos separam o K3 de seu antecessor, o Kimi K2: Kimi Delta Attention (KDA), um mecanismo híbrido de atenção linear, e Attention Residuals (AttnRes). Juntos, eles proporcionam cerca de 2,5x mais eficiência de escalonamento. O MoE de 896 especialistas ativa apenas 16 especialistas por token, mantendo os custos de inferência baixos (Moonshot AI, 2026).
| Modelo | Preço de Entrada | Preço de Saída | Arena WebDev | Pesos |
|---|---|---|---|---|
| Kimi K3 | $3 / 1M | $15 / 1M | 1679 (#1) | 27 Jul (prometido) |
| Claude Fable 5 | $10 / 1M | $50 / 1M | #2 | Fechado |
| GPT-5.6 Sol | $5 / 1M | $30 / 1M | #3 | Fechado |
A Moonshot está descontinuando sua linha de modelos mais antigos junto com o lançamento: K2.5 e a série legada moonshot-v1 fecham para novos usuários, com descontinuação total em 31 de agosto (Moonshot AI, 2026).
Por que isso importa
Este é o terceiro modelo chinês de pesos abertos a entrar em território competitivo de fronteira em 30 dias. A Tencent lançou o Hy3 em 6 de julho com licenciamento Apache 2.0 e forte capacidade de tool-calling. A Z.ai lançou o GLM-5.2 em 13 de junho sob licença MIT com contexto de 1M tokens. Agora o K3 chega com a primeira colocação no Arena WebDev e a maior contagem de parâmetros já lançada abertamente.
O timing é brutal para o Google. No mesmo dia em que o K3 foi lançado, a Bloomberg confirmou que o Gemini 3.5 Pro está "meses atrasado" em relação às metas internas — o modelo dos EUA que deveria fornecer uma terceira opção de fronteira ao lado da Anthropic e OpenAI ainda não está disponível ao público (Bloomberg, 2026).
A Moonshot também estaria levantando novo capital com avaliação de $31,5 bilhões — um salto substancial em relação à sua rodada anterior, embora o valor de $4,3B da Série C de janeiro de 2026 seja difícil de verificar independentemente (Reuters, 2026). Essa é a trajetória normalmente reservada para laboratórios que lançam modelos de fronteira fechados. A mensagem é clara: modelos de pesos abertos estão atraindo investimento em escala de fronteira.
A ressalva: o K3 não lidera em raciocínio geral. O Fable 5 e o GPT-5.6 Sol ainda mantêm vantagem em benchmarks de execução precisa e analítica (Moonshot AI, 2026). Trata-se de uma aposta em codificação e eficiência de custo, não uma reivindicação da coroa geral da fronteira. E os pesos ainda não podem ser baixados — todos os flagships anteriores do Kimi de fato entregaram pesos abertos, mas até 27 de julho é uma promessa, não um fato.
O que muda para você
Se você está pagando os preços de $10/$50 apenas com créditos do Fable 5 para cargas de codificação, o K3 redefine a linha de base de custo. O modelo reporta taxas de cache-hit acima de 90% em tarefas de codificação, com entrada em cache caindo para $0,30 por milhão de tokens (Moonshot AI, 2026). Para uma equipe rodando pipelines pesados de codificação diariamente, a diferença de custo não é marginal — é a diferença entre um fluxo de trabalho sustentável e um racionado.
O acesso a pesos abertos, se entregue no prazo, também significa implantação auto-hospedada para equipes com infraestrutura de GPU suficiente (64+ aceleradores). Sem dependência de API, sem limites de taxa, sem dados saindo da sua infraestrutura. Recomendamos avaliar o K3 junto com o GLM-5.2 e Hy3 assim que todos os três estiverem baixáveis.
O preço com cache-hit é a vantagem oculta aqui. A $0,30 por milhão de tokens para entrada em cache, passagens repetidas de codificação — relendo a mesma base de código entre iterações — tornam-se dramaticamente mais baratas. A arquitetura do K3 foi projetada para esse padrão, e as taxas de 90%+ de cache-hit que a Moonshot reporta em cargas de codificação sugerem que funciona como pretendido.
Perguntas frequentes
O Kimi K3 é realmente melhor que o Fable 5?
Em codificação front-end e desenvolvimento web, sim — lidera o Arena WebDev por uma margem mensurável (1679 contra a pontuação do Fable 5). Em raciocínio geral, execução precisa e benchmarks de cibersegurança, não — o Fable 5 e o GPT-5.6 Sol ainda mantêm a vantagem. Pense no K3 como um especialista em codificação e eficiência, não um substituto geral de fronteira.
Quando posso baixar os pesos?
A Moonshot promete o lançamento de pesos abertos até 27 de julho. Todos os flagships anteriores do Kimi (K1.5, K2, K2.5) entregaram pesos, então o histórico respalda a afirmação. Até lá, o K3 está disponível apenas via API através da plataforma Kimi e endpoints compatíveis com OpenAI.
Como o K3 se compara ao GLM-5.2 e Hy3?
O K3 é maior — 2,8T parâmetros contra 295B do Hy3 (21B ativos) — e pontua mais alto no Arena WebDev. O Hy3 vence em licenciamento permissivo Apache 2.0 e requisitos mais baixos de auto-hospedagem. O GLM-5.2 tem a vantagem da licença MIT e um histórico mais longo. Todos os três são de pesos abertos e licenciados permissivamente, tornando esta janela de 30 dias sem precedentes no cenário de modelos abertos.
O que fazer
- 1 Evaluate Kimi K3 on your coding benchmarks once weights ship July 27 — at $3/$15 with 90%+ cache-hit rates, it resets the cost baseline for heavy coding workloads.
- 2 If self-hosting, budget for 64+ accelerators — K3's 2.8T MoE architecture demands serious GPU resources.
Ferramentas e modelos afetados
Nunca mais precisas de te pôr a par
O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.