G

GLM-5.3

Z.ai · Sorti août 2026

Conditionnel

GLM-5.3 est le dernier modèle de codage et de cyberdéfense à poids ouverts de Z.ai — la même base que GLM-5.2, chaque gain venant du post-entraînement. Mais les chiffres clés sont encore exécutés par le fournisseur, les poids ouverts sont retenus ~2 semaines en raison d'une capacité de sécurité émergente, et le tarif par token n'est pas publié. Tournez-vous dès maintenant vers la sécurité défensive et l'automatisation agentique ; attendez les poids et les audits indépendants avant de standardiser.

Est-ce fait pour vous ?

Recommandé pour

  • Cybersécurité défensive — CyberGym 84,5 %, meilleur résultat publié, devant Mythos 5 (83,8 %) et GPT-5.6 Sol (83,6 %)
  • Codage de longue haleine — DeepSWE v1.1 66,9 % (contre 46,2 %), Terminal-Bench 3.0 à 28,3 (six fois plus que 4,6)
  • Automatisation agentique — AutomationBench v1.0.6 passe de 26,2→48,2 (+84 %) ; l'apprentissage par renforcement SAO est à l'origine des gains de longue haleine
  • Auto-hébergeurs prévoyant une adoption des poids ouverts — réutilise la base GLM-5.2, poids prévus dans ~2 semaines

Déconseillé pour

  • Exploitation offensive profonde — ExploitBench 54,4 %, reste derrière Mythos 5 (78,0 %) et GPT-5.6 Sol (76,5 %)
  • Auto-hébergement immédiat — poids retenus ~2 semaines pour le durcissement de sécurité ; le premier retard de poids à motivation cyber de Z.ai
  • Les équipes ayant besoin d'un tarif par token publié ou de la vision — aucune ligne GLM-5.3 dans le tableau tarifaire de Z.ai ; aucune capacité multimodale annoncée

Performances par tâche

Defensive security (CyberGym)

Excellent

84,5 % sur CyberGym — meilleur résultat publié, devant la frontière fermée ; rapporté par le fournisseur, non audité indépendamment

Long-horizon software engineering (DeepSWE v1.1)

Very Good

66,9 % sur DeepSWE v1.1, contre 46,2 % — un bond de 20 points, bien que le chiffre soit exécuté par Z.ai

Terminal/CLI coding (Terminal-Bench 3.0)

Very Good

28,3 sur Terminal-Bench 3.0, six fois plus que les 4,6 de GLM-5.2 ; au niveau de la frontière sur Terminal-Bench 2.1 (88,2 contre 88,8)

Deep exploitation (ExploitBench)

Fair

54,4 % sur ExploitBench, plus du double de GLM-5.2 (24,4 %), mais reste derrière la frontière fermée de plus de 20 points

Vision / multimodal

Poor

Aucune capacité de vision annoncée ni benchmarkée au lancement

Tarifs

Entrée

N/A (rate not yet published)

Sortie

N/A (rate not yet published)

Contexte

1M context

Voir tous les tarifs

Tests de performance

TestScoreSource
CyberGym84.5% Source
DeepSWE v1.166.9% Source
Terminal-Bench 3.028.3 Source
Terminal-Bench 2.188.2 Source
ExploitBench54.4% Source
ExploitGym (2h / 6h tasks)105 / 130 Source

Aucun changement de verdict pour l’instant

L’horloge tourne dès le premier jour : les changements apparaîtront ici à mesure que notre verdict évolue.

Journal de vérification

Aucune vérification pour le moment

Nous n’avons pas encore enregistré de vérification pour cette entrée. Dès qu’une vérification s’exécute, son historique apparaît ici.

Comment nous évaluons