H

Hy3

Tencent · Lançado 07/2026

Condicional

Modelo agêntico MoE de pesos abertos Apache 2.0 (295B total, 21B ativos) com forte confiabilidade em chamadas de ferramentas e comportamento anti-alucinação, mas a codificação fica atrás do GLM-5.2 e o self-hosting exige 8+ GPUs. Nível gratuito no OpenRouter até 21 de julho — depois $0,20/$0,80 por 1M de tokens. Ideal para agentes de programação self-hosted e trabalho com documentos de contexto longo, onde licenciamento permissivo importa mais do que pontuações absolutas em benchmarks.

É adequada para ti?

Bom para

  • Codificação agêntica com chamadas de ferramentas estáveis em várias scaffolds — precisão SWE-Bench dentro de 4% entre CodeBuddy, Cline e KiloCode
  • Implantações self-hosted sob Apache 2.0 — sem dependência de API, uso comercial permissivo, variante FP8 disponível para menor pegada de memória
  • Processamento de documentos de contexto longo (256K) com treino anti-alucinação — taxa de alucinação caiu de 12,5% para 5,4% nas avaliações internas
  • Supera o GLM-5.1 em testes cegos de especialistas (2,67/4 vs 2,51/4) — mais forte em fluxos de frontend, CI/CD, dados/armazenamento

Não recomendado para

  • Benchmarks de codificação (SWE-Bench Verified 78,0) ficam atrás do GLM-5.2 (84,2) e Claude Sonnet 5 — não é a escolha para excelência pura em código
  • Custo do self-hosting — 295B parâmetros totais exigem 8 GPUs (H20-3e no mínimo); o nível gratuito do OpenRouter termina em 21 jul 2026

Desempenho por tarefa

Raciocínio

Very Good

GPQA Diamond 90,4, USAMO 72,0, IMOAnswerBench 90,0 — competitivo com modelos maiores

Geração de código

Very Good

SWE-Bench Verified 78,0 — forte para um modelo aberto mas fica atrás do GLM-5.2 em 6,2 pontos

Fluxos de trabalho agênticos

Very Good

Estabilidade de chamada de ferramentas em várias scaffolds, variância independente da scaffold dentro de 4%

Tarefas de contexto longo

Very Good

Contexto de 256K, MRCR diálogo longo 75,1%, melhorias anti-alucinação

Preços

Entrada

$0.20 / 1M

Saída

$0.80 / 1M

Contexto

256K tokens

Ver preços completos

Testes de desempenho

TestePontuaçãoFonte
SWE-Bench Verified78.0 Fonte
SWE-Bench Multilingual75.8 Fonte
Terminal-Bench 2.171.7 Fonte
GPQA Diamond90.4 Fonte
USAMO 202672.0 Fonte
IMOAnswerBench90.0 Fonte
HLE (with tools)53.2 Fonte

Ainda sem alterações de veredicto

O relógio começa a contar no primeiro dia: as alterações aparecem aqui à medida que o nosso veredicto evolui.

Registo de verificação

  • Preços— Sem alterações

    Agente automatizado

  • Preços— Sem alterações

    Agente automatizado

  • Preços— Sem alterações

    Agente automatizado

  • Preços— Sem alterações

    Agente automatizado

  • Perfil— Sem alterações

    Importado no lançamento

  • Preços— Sem alterações

    Importado no lançamento

Como avaliamos