GLM-5.3 : le modèle de Z.ai en tête de CyberGym, poids dans deux semaines
- Ce qui s’est passé
- Z.ai released GLM-5.3, post-trained on the same base as GLM-5.2, with a more-than-6× Terminal-Bench 3.0 jump and CyberGym SOTA.
- Pourquoi c’est important
- It leads CyberGym at 84.5%, ahead of Mythos 5 and GPT-5.6 Sol — a sharper open-weight frontier on coding and security.
- Que faire
- Test via GLM Coding Plan or ZCode now; open weights land in about two weeks after safety review.
GLM-5.3 est le premier modèle à poids ouverts à mener CyberGym — et il devance le Mythos 5 d'Anthropic et le GPT-5.6 Sol d'OpenAI pour y parvenir. C'est l'essentiel. Le hic : les poids ne sont pas livrés aujourd'hui — ils sont prévus dans environ deux semaines, sous réserve d'une évaluation de sécurité et d'un durcissement. (Tous les chiffres ici sont ceux de Z.ai, obtenus via le harnais de test Claude Code ; nous ne les avons pas reproduits de manière indépendante.)
Ce qui s'est passé
Z.ai a publié GLM-5.3 comme une mise à jour de post-entraînement uniquement, sur le même modèle de base que GLM-5.2. « Mettre à l'échelle le post-entraînement est tout ce que nous avons fait », selon Z.ai. Ce n'est pas un nouveau modèle — c'est ce qu'un mois de RL à environnement mis à l'échelle a produit.
| Benchmark | GLM-5.2 | GLM-5.3 | Où il se situe |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | SOTA open source |
| Agents' Last Exam | 23,8 % | 28,5 % | — |
| CyberGym | — | 84,5 % | Devant Mythos 5 (83,8 %), GPT-5.6 Sol (83,6 %) |
| ExploitBench | 24,4 % | 54,4 % | Reste derrière Mythos 5 (78,0 %), GPT-5.6 Sol (76,5 %) |
Z.ai indique que le modèle a trouvé 2 436 vulnérabilités dans 269 projets — dont 1 097 critiques ou élevées, certaines remontant à 1981.
Pourquoi c'est important
La capacité cyber est la partie à surveiller. GLM-5.3 est le premier modèle à poids ouverts à mener CyberGym, et le fait de plus que doubler sur ExploitBench (24,4 % à 54,4 %) est le gain le plus important précisément là où la frontière fermée est la plus en avance — il reste derrière Mythos 5 et GPT-5.6 Sol, mais il comble une grande partie de cet écart en un seul cycle de post-entraînement.
Pour le monde des poids ouverts, cela aiguise la frontière à la fois sur le codage et la sécurité. Mais « open » est une promesse à mèche de deux semaines, pas un fait aujourd'hui : pour l'instant, le seul moyen d'accéder à GLM-5.3 passe par le GLM Coding Plan (utilisable dans ZCode, Claude Code, OpenCode).
Ce qui change pour vous
- Vous ne pouvez pas encore l'exécuter localement. Les poids arrivent sur Hugging Face dans environ deux semaines, après l'évaluation de sécurité et le durcissement.
- Une rupture de compatibilité est livrée aujourd'hui.
thinking.type: "disabled"n'est plus pris en charge — définissezthinking.typesur"enabled"et utilisezreasoning_effort(low/high/max). - Testez-le dès maintenant via le GLM Coding Plan ou ZCode si vous voulez la capacité avant la publication des poids.
FAQ
GLM-5.3 est-il vraiment à poids ouverts aujourd'hui ? Non. Les poids sont prévus dans environ deux semaines, sous réserve d'une évaluation de sécurité et d'un durcissement. D'ici là, il n'est accessible que via le GLM Coding Plan et ZCode.
S'agit-il d'un nouveau modèle ? Non — c'est un post-entraînement sur la même base que GLM-5.2. Les gains proviennent uniquement de la mise à l'échelle du post-entraînement, ce qui rend le bond de Terminal-Bench 3.0 de 4,6 % à 28,3 % notable.
Que dois-je changer si je migre depuis GLM-5.2 ? Définissez thinking.type sur "enabled" et ajoutez reasoning_effort (low/high/max). thinking.type: "disabled" ne fonctionne plus.
En résumé : la frontière à poids ouverts vient de s'aiguiser à la fois sur le codage et la sécurité — mais les poids réels sont une promesse à deux semaines, pas quelque chose que vous pouvez télécharger aujourd'hui.
Que faire
- 1 Watch for GLM-5.3 weights on Hugging Face in about two weeks (gated on safety evaluation and hardening).
- 2 Test now via GLM Coding Plan or ZCode — note thinking.type: "disabled" is gone — set it to "enabled" and use reasoning_effort.
Outils et modèles concernés
Ne ratez plus jamais une mise à jour
Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.