GLM-5.3: el modelo de Z.ai lidera CyberGym; pesos en dos semanas
- Qué pasó
- Z.ai released GLM-5.3, post-trained on the same base as GLM-5.2, with a more-than-6× Terminal-Bench 3.0 jump and CyberGym SOTA.
- Por qué importa
- It leads CyberGym at 84.5%, ahead of Mythos 5 and GPT-5.6 Sol — a sharper open-weight frontier on coding and security.
- Qué hacer
- Test via GLM Coding Plan or ZCode now; open weights land in about two weeks after safety review.
GLM-5.3 es el primer modelo de pesos abiertos en liderar CyberGym, y para lograrlo supera a Mythos 5 de Anthropic y a GPT-5.6 Sol de OpenAI. Ese es el titular. La letra pequeña: los pesos no se publican hoy; están programados para dentro de unas dos semanas, condicionados a la evaluación de seguridad y al endurecimiento. (Todas las cifras de aquí son del propio Z.ai, ejecutadas con el harness de Claude Code; no las hemos reproducido de forma independiente.)
Qué pasó
Z.ai lanzó GLM-5.3 como una actualización de solo post-entrenamiento sobre el mismo modelo base que GLM-5.2. Según Z.ai, "lo único que hicimos fue escalar el post-entrenamiento". No es un modelo nuevo: es lo que consiguió un mes de RL escalado por entorno.
| Benchmark | GLM-5.2 | GLM-5.3 | Dónde queda |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | SOTA de código abierto |
| Agents' Last Exam | 23.8% | 28.5% | — |
| CyberGym | — | 84.5% | Por delante de Mythos 5 (83.8%), GPT-5.6 Sol (83.6%) |
| ExploitBench | 24.4% | 54.4% | Aún por detrás de Mythos 5 (78.0%), GPT-5.6 Sol (76.5%) |
Z.ai afirma que el modelo encontró 2,436 vulnerabilidades en 269 proyectos: 1,097 críticas o altas, algunas de 1981.
Por qué importa
La capacidad cibernética es la parte a vigilar. GLM-5.3 es el primer modelo de pesos abiertos en encabezar CyberGym, y el más que duplicado en ExploitBench (de 24.4% a 54.4%) es la mayor ganancia justo donde la frontera cerrada está más adelantada: sigue por detrás de Mythos 5 y GPT-5.6 Sol, pero cierra buena parte de esa brecha en una sola pasada de post-entrenamiento.
Para el mundo de los pesos abiertos, esto afina la frontera tanto en codificación como en seguridad. Pero "abierto" es una promesa con mecha de dos semanas, no un hecho hoy: por ahora, la única forma de acceder a GLM-5.3 es a través del GLM Coding Plan (utilizable en ZCode, Claude Code, OpenCode).
Qué cambia para ti
- Aún no puedes ejecutarlo localmente. Los pesos llegan a Hugging Face en unas dos semanas, tras la revisión de seguridad y el endurecimiento.
- Hoy se publica un cambio que rompe compatibilidad.
thinking.type: "disabled"ya no es compatible: configurathinking.typeen"enabled"y usareasoning_effort(low/high/max). - Pruébalo ya a través del GLM Coding Plan o ZCode si quieres la capacidad antes de que caigan los pesos.
FAQ
¿GLM-5.3 tiene pesos abiertos de verdad hoy? No. Los pesos están programados para dentro de unas dos semanas, condicionados a la evaluación de seguridad y al endurecimiento. Hasta entonces solo es accesible vía GLM Coding Plan y ZCode.
¿Es un modelo nuevo? No: es post-entrenamiento sobre la misma base que GLM-5.2. Las ganancias provienen únicamente de escalar el post-entrenamiento, que es lo que hace notable el salto de Terminal-Bench 3.0 de 4.6% a 28.3%.
¿Qué cambio si migro desde GLM-5.2? Configura thinking.type en "enabled" y añade reasoning_effort (low/high/max). thinking.type: "disabled" ya no funciona.
En resumen: la frontera de pesos abiertos acaba de afilarse tanto en codificación como en seguridad, pero los pesos reales son una promesa de dos semanas, no algo que puedas descargar hoy.
Qué hacer
- 1 Watch for GLM-5.3 weights on Hugging Face in about two weeks (gated on safety evaluation and hardening).
- 2 Test now via GLM Coding Plan or ZCode — note thinking.type: "disabled" is gone — set it to "enabled" and use reasoning_effort.
Herramientas y modelos afectados
No vuelvas a tener que ponerte al día
El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.