H

Hy3

Tencent · Lançado 07/2026

Condicional

Modelo agêntico MoE de pesos abertos Apache 2.0 (295B total, 21B ativos) com forte confiabilidade em chamadas de ferramentas e comportamento anti-alucinação, mas a codificação fica atrás do GLM-5.2 e o self-hosting exige 8+ GPUs. Nível gratuito no OpenRouter até 21 de julho — depois $0,20/$0,80 por 1M de tokens. Ideal para agentes de programação self-hosted e trabalho com documentos de contexto longo, onde licenciamento permissivo importa mais do que pontuações absolutas em benchmarks.

É adequada para ti?

Bom para

  • Codificação agêntica com chamadas de ferramentas estáveis em várias scaffolds — precisão SWE-Bench dentro de 4% entre CodeBuddy, Cline e KiloCode
  • Implantações self-hosted sob Apache 2.0 — sem dependência de API, uso comercial permissivo, variante FP8 disponível para menor pegada de memória
  • Processamento de documentos de contexto longo (256K) com treino anti-alucinação — taxa de alucinação caiu de 12,5% para 5,4% nas avaliações internas
  • Supera o GLM-5.1 em testes cegos de especialistas (2,67/4 vs 2,51/4) — mais forte em fluxos de frontend, CI/CD, dados/armazenamento

Não recomendado para

  • Benchmarks de codificação (SWE-Bench Verified 78,0) ficam atrás do GLM-5.2 (84,2) e Claude Sonnet 5 — não é a escolha para excelência pura em código
  • Custo do self-hosting — 295B parâmetros totais exigem 8 GPUs (H20-3e no mínimo); o nível gratuito do OpenRouter termina em 21 jul 2026

Desempenho por tarefa

Fluxos de trabalho agênticos

Very Good

Estabilidade de chamada de ferramentas em várias scaffolds, variância independente da scaffold dentro de 4%

Raciocínio

Very Good

GPQA Diamond 90,4, USAMO 72,0, IMOAnswerBench 90,0 — competitivo com modelos maiores

Geração de código

Very Good

SWE-Bench Verified 78,0 — forte para um modelo aberto mas fica atrás do GLM-5.2 em 6,2 pontos

Tarefas de contexto longo

Very Good

Contexto de 256K, MRCR diálogo longo 75,1%, melhorias anti-alucinação

Preços

Entrada

$0.20 / 1M

Saída

$0.80 / 1M

Contexto

256K tokens

Ver preços completos

Testes de desempenho

TestePontuaçãoFonte
SWE-Bench Verified78.0 Fonte
SWE-Bench Multilingual75.8 Fonte
Terminal-Bench 2.171.7 Fonte
GPQA Diamond90.4 Fonte
USAMO 202672.0 Fonte
IMOAnswerBench90.0 Fonte
HLE (with tools)53.2 Fonte

Ainda sem alterações de veredicto

O relógio começa a contar no primeiro dia: as alterações aparecem aqui à medida que o nosso veredicto evolui.

Registo de verificação

  • Preços— Sem alterações

    Agente automatizado

  • Preços— Sem alterações

    Agente automatizado

  • Perfil— Sem alterações

    Importado no lançamento

  • Preços— Sem alterações

    Importado no lançamento

Como avaliamos