H

Hy3

Tencent · Veröffentlicht Juli 2026

Bedingt

Apache-2.0-Open-Weight-MoE-agentisches Modell (295B gesamt, 21B aktiv) mit starker Tool-Calling-Zuverlaessigkeit und Anti-Halluzinations-Verhalten, aber Coding bleibt hinter GLM-5.2 zurueck und Self-Hosting erfordert 8+ GPUs. Kostenlose OpenRouter-Stufe bis 21. Juli — danach $0,20/$0,80 pro 1M Tokens. Am besten fuer selbst gehostete Coding-Agenten und Langkontext-Dokumentarbeit, bei der freizuegige Lizenzierung mehr zaehlt als absolute Benchmark-Ergebnisse.

Ist es das Richtige für dich?

Gut für

  • Agentisches Coding mit stabilem Tool-Calling über Scaffoldings hinweg — SWE-Bench-Genauigkeit innerhalb von 4 % über CodeBuddy, Cline und KiloCode
  • Selbst gehostete Deployments unter Apache 2.0 — keine API-Abhängigkeit, freizügige kommerzielle Nutzung, FP8-Variante für geringeren Speicherbedarf verfügbar
  • Langkontext-Dokumentverarbeitung (256K) mit Anti-Halluzinations-Training — Halluzinationsrate fiel in internen Tests von 12,5 % auf 5,4 %
  • Schlägt GLM-5.1 in verblindeten Experten-Tests (2,67/4 vs. 2,51/4) — am stärksten in Frontend-, CI/CD- und Daten-/Storage-Workflows

Nicht geeignet für

  • Coding-Benchmarks (SWE-Bench Verified 78,0) liegen hinter GLM-5.2 (84,2) und Claude Sonnet 5 — nicht die Wahl für reine Coding-Exzellenz
  • Selbst-Hosting-Kosten — 295B Gesamtparameter brauchen 8 GPUs (H20-3e Minimum); kostenlose OpenRouter-Stufe endet am 21. Juli 2026

Leistung nach Aufgabe

Agentische Workflows

Very Good

Tool-Call-Stabilität über Scaffoldings hinweg, scaffold-agnostische Varianz innerhalb von 4 %

Reasoning

Very Good

GPQA Diamond 90,4, USAMO 72,0, IMOAnswerBench 90,0 — wettbewerbsfähig mit größeren Modellen

Codegenerierung

Very Good

SWE-Bench Verified 78,0 — stark für ein offenes Modell, liegt aber 6,2 Punkte hinter GLM-5.2

Langkontext-Aufgaben

Very Good

256K Kontext, MRCR Long-Dialogue 75,1 %, Anti-Halluzinations-Verbesserungen

Preise

Eingabe

$0.20 / 1M

Ausgabe

$0.80 / 1M

Kontext

256K tokens

Alle Preise ansehen

Benchmarks

BenchmarkWertQuelle
SWE-Bench Verified78.0 Quelle
SWE-Bench Multilingual75.8 Quelle
Terminal-Bench 2.171.7 Quelle
GPQA Diamond90.4 Quelle
USAMO 202672.0 Quelle
IMOAnswerBench90.0 Quelle
HLE (with tools)53.2 Quelle

Noch keine Urteilsänderungen

Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.

Prüfprotokoll

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Profil— Keine Änderungen

    Beim Start importiert

  • Preise— Keine Änderungen

    Beim Start importiert

Wie wir bewerten