H

Hy3

Tencent · Sorti juil. 2026

Conditionnel

Modèle agentique MoE à poids ouverts sous licence Apache 2.0 (295B total, 21B actifs) avec une fiabilité solide en appel d'outils et un bon comportement anti-hallucination, mais le codage est en retrait par rapport à GLM-5.2 et l'auto-hébergement exige 8 GPU ou plus. Niveau gratuit sur OpenRouter jusqu'au 21 juillet — ensuite 0,20 $/0,80 $ par million de tokens. Idéal pour les agents de codage auto-hébergés et le travail documentaire longue durée où la licence permissive prime sur les scores absolus de benchmarks.

Est-ce fait pour vous ?

Recommandé pour

  • Codage agentique avec appels d'outils stables à travers les scaffoldings — précision SWE-Bench à 4% près entre CodeBuddy, Cline et KiloCode
  • Déploiements auto-hébergés sous Apache 2.0 — pas de dépendance API, usage commercial permissif, variante FP8 disponible
  • Traitement documentaire en contexte long (256K) avec entraînement anti-hallucination — taux d'hallucination passé de 12,5% à 5,4%
  • Surpasse GLM-5.1 aux tests aveugles d'experts (2,67/4 vs 2,51/4) — plus fort en frontend, CI/CD, workflows données/stockage

Déconseillé pour

  • Les benchmarks de codage (SWE-Bench Verified 78,0) sont derrière GLM-5.2 (84,2) et Claude Sonnet 5 — pas le choix pour l'excellence pure en codage
  • Coût d'auto-hébergement — 295B paramètres totaux nécessitent 8 GPU (H20-3e minimum) ; le niveau gratuit OpenRouter se termine le 21 juillet 2026

Performances par tâche

Workflows agentiques

Very Good

Stabilité des appels d'outils à travers les scaffoldings, variance inférieure à 4%

Raisonnement

Very Good

GPQA Diamond 90,4, USAMO 72,0, IMOAnswerBench 90,0 — compétitif avec les modèles plus grands

Génération de code

Very Good

SWE-Bench Verified 78,0 — solide pour un modèle ouvert mais 6,2 points derrière GLM-5.2

Tâches en contexte long

Very Good

Contexte 256K, MRCR dialogue long 75,1%, améliorations anti-hallucination

Tarifs

Entrée

$0.20 / 1M

Sortie

$0.80 / 1M

Contexte

256K tokens

Voir tous les tarifs

Tests de performance

TestScoreSource
SWE-Bench Verified78.0 Source
SWE-Bench Multilingual75.8 Source
Terminal-Bench 2.171.7 Source
GPQA Diamond90.4 Source
USAMO 202672.0 Source
IMOAnswerBench90.0 Source
HLE (with tools)53.2 Source

Aucun changement de verdict pour l’instant

L’horloge tourne dès le premier jour : les changements apparaîtront ici à mesure que notre verdict évolue.

Journal de vérification

  • Tarifs— Aucun changement

    Agent automatisé

  • Tarifs— Aucun changement

    Agent automatisé

  • Profil— Aucun changement

    Importé au lancement

  • Tarifs— Aucun changement

    Importé au lancement

Comment nous évaluons