G

GLM-5.3

Z.ai · Veröffentlicht Aug. 2026

Bedingt

GLM-5.3 ist Z.ais neuestes Open-Weight-Modell für Coding und Cyber-Abwehr — dieselbe Basis wie GLM-5.2, jeder Zugewinn aus dem Post-Training. Aber die Schlagzeilen-Zahlen stammen weiterhin vom Hersteller, die Open Weights werden wegen neu aufgetretener Sicherheitsfähigkeiten rund 2 Wochen zurückgehalten, und die Preise pro Token sind unveröffentlicht. Greifen Sie jetzt zu für defensive Sicherheit und agentische Automatisierung; warten Sie auf die Gewichte und unabhängige Audits, bevor Sie standardisieren.

Ist es das Richtige für dich?

Gut für

  • Defensive Cybersicherheit — CyberGym 84,5 %, bestes veröffentlichtes Ergebnis, vor Mythos 5 (83,8 %) und GPT-5.6 Sol (83,6 %)
  • Coding mit langem Horizont — DeepSWE v1.1 66,9 % (von 46,2 %), Terminal-Bench 3.0 28,3 (sechsfach über 4,6)
  • Agentische Automatisierung — AutomationBench v1.0.6 springt 26,2→48,2 (+84 %); SAO-Reinforcement-Learning treibt die Langhorizont-Zugewinne
  • Self-Hoster, die die Open-Weight-Übernahme planen — nutzt die GLM-5.2-Basis wieder, Gewichte für rund 2 Wochen zurückgestellt

Nicht geeignet für

  • Tiefe offensive Exploitation — ExploitBench 54,4 % liegt weiter hinter Mythos 5 (78,0 %) und GPT-5.6 Sol (76,5 %)
  • Sofortiges Self-Hosting — Gewichte rund 2 Wochen für Sicherheitshärtung zurückgehalten; Z.ais erste cybermotivierte Gewichtsverzögerung
  • Teams, die veröffentlichte Preise pro Token oder Vision brauchen — keine GLM-5.3-Zeile in Z.ais Preistabelle; keine multimodale Fähigkeit angekündigt

Leistung nach Aufgabe

Defensive security (CyberGym)

Excellent

84,5 % bei CyberGym — bestes veröffentlichtes Ergebnis, vor der geschlossenen Frontier; herstellerberichtet, nicht unabhängig geprüft

Long-horizon software engineering (DeepSWE v1.1)

Very Good

66,9 % bei DeepSWE v1.1, gegenüber 46,2 % — ein Sprung um 20 Punkte, wobei die Zahl von Z.ai stammt

Terminal/CLI coding (Terminal-Bench 3.0)

Very Good

28,3 bei Terminal-Bench 3.0, sechsfach über GLM-5.2s 4,6; gleichauf mit der Frontier bei Terminal-Bench 2.1 (88,2 vs. 88,8)

Deep exploitation (ExploitBench)

Fair

54,4 % bei ExploitBench, mehr als eine Verdopplung gegenüber GLM-5.2 (24,4 %), liegt aber weiterhin um über 20 Punkte hinter der geschlossenen Frontier

Vision / multimodal

Poor

Beim Launch keine Vision-Fähigkeit angekündigt oder gebenchmarkt

Preise

Eingabe

N/A (rate not yet published)

Ausgabe

N/A (rate not yet published)

Kontext

1M context

Alle Preise ansehen

Benchmarks

BenchmarkWertQuelle
CyberGym84.5% Quelle
DeepSWE v1.166.9% Quelle
Terminal-Bench 3.028.3 Quelle
Terminal-Bench 2.188.2 Quelle
ExploitBench54.4% Quelle
ExploitGym (2h / 6h tasks)105 / 130 Quelle

Noch keine Urteilsänderungen

Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.

Prüfprotokoll

Noch keine Prüfungen

Wir haben für diesen Eintrag noch keine Prüfung erfasst. Sobald eine Prüfung läuft, erscheint ihr Verlauf hier.

Wie wir bewerten