Kimi K3 Lidera o Arena WebDev a $3/$15, Pesos Abertos em 27 de Julho

Moonshot AI logoMoonshot AIImportante17 de julho de 2026Modelos
O que aconteceu
Moonshot AI launched Kimi K3, a 2.8T open-weight MoE model that beat Claude Fable 5 for #1 on Arena Code WebDev (1679) at $3/$15 per 1M tokens.
Porque é importante
It's the third Chinese frontier-competitive open-weight model this month — Hy3, GLM-5.2, and now K3 — while Google's Gemini 3.5 Pro was confirmed 'months behind' the same day, making the open-weight frontier a genuine challenge to US closed models.
O que fazer
Watch the July 27 weight release, and if K3 ships open as promised, evaluate it for coding workloads where Fable 5's $10/$50 pricing is unsustainable — K3 at $3/$15 with 90%+ cache-hit rates sets a new cost baseline.

O Kimi K3 é o maior modelo de pesos abertos já lançado — e seu primeiro feito é superar o Claude Fable 5 pelo primeiro lugar no Arena Code WebDev com um custo três vezes menor.

A Moonshot AI lançou o modelo Mixture-of-Experts de 2,8 trilhões de parâmetros em 16 de julho de 2026, com preço fixo de $3/$15 por milhão de tokens (Moonshot AI, 2026). O acesso via API já está disponível no app Kimi, Kimi Code e através de um endpoint compatível com OpenAI. Os pesos abertos estão prometidos para 27 de julho — se entregues, o K3 será o maior modelo baixável por uma margem de quase 3x sobre o próximo maior lançamento de pesos abertos.

O que o Kimi K3 entrega

O K3 marcou 1679 no Arena Code WebDev — o primeiro lugar, à frente tanto do Fable 5 quanto do GPT-5.6 Sol X-High em tarefas de codificação front-end (LMSYS Arena, 2026). No índice de inteligência mais amplo da Artificial Analysis, ele alcança 57 — comparável ao Claude Opus 4.8 e GPT-5.5, embora ainda atrás do Fable 5 e do Sol nos benchmarks de raciocínio geral.

Dois novos componentes arquitetônicos separam o K3 de seu antecessor, o Kimi K2: Kimi Delta Attention (KDA), um mecanismo híbrido de atenção linear, e Attention Residuals (AttnRes). Juntos, eles proporcionam cerca de 2,5x mais eficiência de escalonamento. O MoE de 896 especialistas ativa apenas 16 especialistas por token, mantendo os custos de inferência baixos (Moonshot AI, 2026).

ModeloPreço de EntradaPreço de SaídaArena WebDevPesos
Kimi K3$3 / 1M$15 / 1M1679 (#1)27 Jul (prometido)
Claude Fable 5$10 / 1M$50 / 1M#2Fechado
GPT-5.6 Sol$5 / 1M$30 / 1M#3Fechado

A Moonshot está descontinuando sua linha de modelos mais antigos junto com o lançamento: K2.5 e a série legada moonshot-v1 fecham para novos usuários, com descontinuação total em 31 de agosto (Moonshot AI, 2026).

Por que isso importa

Este é o terceiro modelo chinês de pesos abertos a entrar em território competitivo de fronteira em 30 dias. A Tencent lançou o Hy3 em 6 de julho com licenciamento Apache 2.0 e forte capacidade de tool-calling. A Z.ai lançou o GLM-5.2 em 13 de junho sob licença MIT com contexto de 1M tokens. Agora o K3 chega com a primeira colocação no Arena WebDev e a maior contagem de parâmetros já lançada abertamente.

O timing é brutal para o Google. No mesmo dia em que o K3 foi lançado, a Bloomberg confirmou que o Gemini 3.5 Pro está "meses atrasado" em relação às metas internas — o modelo dos EUA que deveria fornecer uma terceira opção de fronteira ao lado da Anthropic e OpenAI ainda não está disponível ao público (Bloomberg, 2026).

A Moonshot também estaria levantando novo capital com avaliação de $31,5 bilhões — um salto substancial em relação à sua rodada anterior, embora o valor de $4,3B da Série C de janeiro de 2026 seja difícil de verificar independentemente (Reuters, 2026). Essa é a trajetória normalmente reservada para laboratórios que lançam modelos de fronteira fechados. A mensagem é clara: modelos de pesos abertos estão atraindo investimento em escala de fronteira.

A ressalva: o K3 não lidera em raciocínio geral. O Fable 5 e o GPT-5.6 Sol ainda mantêm vantagem em benchmarks de execução precisa e analítica (Moonshot AI, 2026). Trata-se de uma aposta em codificação e eficiência de custo, não uma reivindicação da coroa geral da fronteira. E os pesos ainda não podem ser baixados — todos os flagships anteriores do Kimi de fato entregaram pesos abertos, mas até 27 de julho é uma promessa, não um fato.

O que muda para você

Se você está pagando os preços de $10/$50 apenas com créditos do Fable 5 para cargas de codificação, o K3 redefine a linha de base de custo. O modelo reporta taxas de cache-hit acima de 90% em tarefas de codificação, com entrada em cache caindo para $0,30 por milhão de tokens (Moonshot AI, 2026). Para uma equipe rodando pipelines pesados de codificação diariamente, a diferença de custo não é marginal — é a diferença entre um fluxo de trabalho sustentável e um racionado.

O acesso a pesos abertos, se entregue no prazo, também significa implantação auto-hospedada para equipes com infraestrutura de GPU suficiente (64+ aceleradores). Sem dependência de API, sem limites de taxa, sem dados saindo da sua infraestrutura. Recomendamos avaliar o K3 junto com o GLM-5.2 e Hy3 assim que todos os três estiverem baixáveis.

O preço com cache-hit é a vantagem oculta aqui. A $0,30 por milhão de tokens para entrada em cache, passagens repetidas de codificação — relendo a mesma base de código entre iterações — tornam-se dramaticamente mais baratas. A arquitetura do K3 foi projetada para esse padrão, e as taxas de 90%+ de cache-hit que a Moonshot reporta em cargas de codificação sugerem que funciona como pretendido.

Perguntas frequentes

O Kimi K3 é realmente melhor que o Fable 5?

Em codificação front-end e desenvolvimento web, sim — lidera o Arena WebDev por uma margem mensurável (1679 contra a pontuação do Fable 5). Em raciocínio geral, execução precisa e benchmarks de cibersegurança, não — o Fable 5 e o GPT-5.6 Sol ainda mantêm a vantagem. Pense no K3 como um especialista em codificação e eficiência, não um substituto geral de fronteira.

Quando posso baixar os pesos?

A Moonshot promete o lançamento de pesos abertos até 27 de julho. Todos os flagships anteriores do Kimi (K1.5, K2, K2.5) entregaram pesos, então o histórico respalda a afirmação. Até lá, o K3 está disponível apenas via API através da plataforma Kimi e endpoints compatíveis com OpenAI.

Como o K3 se compara ao GLM-5.2 e Hy3?

O K3 é maior — 2,8T parâmetros contra 295B do Hy3 (21B ativos) — e pontua mais alto no Arena WebDev. O Hy3 vence em licenciamento permissivo Apache 2.0 e requisitos mais baixos de auto-hospedagem. O GLM-5.2 tem a vantagem da licença MIT e um histórico mais longo. Todos os três são de pesos abertos e licenciados permissivamente, tornando esta janela de 30 dias sem precedentes no cenário de modelos abertos.

O que fazer

  1. 1 Evaluate Kimi K3 on your coding benchmarks once weights ship July 27 — at $3/$15 with 90%+ cache-hit rates, it resets the cost baseline for heavy coding workloads.
  2. 2 If self-hosting, budget for 64+ accelerators — K3's 2.8T MoE architecture demands serious GPU resources.

Ferramentas e modelos afetados

Nunca mais precisas de te pôr a par

O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.

Ao subscreveres, aceitas a nossa Política de Privacidade. Cancela a subscrição quando quiseres.