GLM-5.3
Z.ai · Sorti août 2026
GLM-5.3 est le dernier modèle de codage et de cyberdéfense à poids ouverts de Z.ai — la même base que GLM-5.2, chaque gain venant du post-entraînement. Mais les chiffres clés sont encore exécutés par le fournisseur, les poids ouverts sont retenus ~2 semaines en raison d'une capacité de sécurité émergente, et le tarif par token n'est pas publié. Tournez-vous dès maintenant vers la sécurité défensive et l'automatisation agentique ; attendez les poids et les audits indépendants avant de standardiser.
Est-ce fait pour vous ?
Recommandé pour
- Cybersécurité défensive — CyberGym 84,5 %, meilleur résultat publié, devant Mythos 5 (83,8 %) et GPT-5.6 Sol (83,6 %)
- Codage de longue haleine — DeepSWE v1.1 66,9 % (contre 46,2 %), Terminal-Bench 3.0 à 28,3 (six fois plus que 4,6)
- Automatisation agentique — AutomationBench v1.0.6 passe de 26,2→48,2 (+84 %) ; l'apprentissage par renforcement SAO est à l'origine des gains de longue haleine
- Auto-hébergeurs prévoyant une adoption des poids ouverts — réutilise la base GLM-5.2, poids prévus dans ~2 semaines
Déconseillé pour
- Exploitation offensive profonde — ExploitBench 54,4 %, reste derrière Mythos 5 (78,0 %) et GPT-5.6 Sol (76,5 %)
- Auto-hébergement immédiat — poids retenus ~2 semaines pour le durcissement de sécurité ; le premier retard de poids à motivation cyber de Z.ai
- Les équipes ayant besoin d'un tarif par token publié ou de la vision — aucune ligne GLM-5.3 dans le tableau tarifaire de Z.ai ; aucune capacité multimodale annoncée
Performances par tâche
Defensive security (CyberGym)
84,5 % sur CyberGym — meilleur résultat publié, devant la frontière fermée ; rapporté par le fournisseur, non audité indépendamment
Long-horizon software engineering (DeepSWE v1.1)
66,9 % sur DeepSWE v1.1, contre 46,2 % — un bond de 20 points, bien que le chiffre soit exécuté par Z.ai
Terminal/CLI coding (Terminal-Bench 3.0)
28,3 sur Terminal-Bench 3.0, six fois plus que les 4,6 de GLM-5.2 ; au niveau de la frontière sur Terminal-Bench 2.1 (88,2 contre 88,8)
Deep exploitation (ExploitBench)
54,4 % sur ExploitBench, plus du double de GLM-5.2 (24,4 %), mais reste derrière la frontière fermée de plus de 20 points
Vision / multimodal
Aucune capacité de vision annoncée ni benchmarkée au lancement
Tarifs
Entrée
N/A (rate not yet published)
Sortie
N/A (rate not yet published)
Contexte
1M context
Tests de performance
Aucun changement de verdict pour l’instant
L’horloge tourne dès le premier jour : les changements apparaîtront ici à mesure que notre verdict évolue.
Sources
- Digital Applied — GLM-5.3 post-training launchaoût 2026
- FelloAI — GLM 5.3: Benchmarks, Pricing and the Held-Back Weightsaoût 2026
- Z.ai — Pricing Overview (official docs)août 2026
- OfficeChai — Z.AI Releases GLM 5.3août 2026
- Axios — China's Z.ai holds GLM 5.3 release over hacking risksaoût 2026
- Unite.AI — Z.ai Launches GLM-5.3août 2026
- The Agent Report — GLM-5.3: Post-Training Aloneaoût 2026
- Kingy AI — GLM-5.3 specs and the missing pricing rowaoût 2026
- byteiota — GLM-5.3: Open-Weight Coding SOTA and Emergent Cyber Riskaoût 2026
Journal de vérification
Aucune vérification pour le moment
Nous n’avons pas encore enregistré de vérification pour cette entrée. Dès qu’une vérification s’exécute, son historique apparaît ici.