G

GLM-5.3

Z.ai · Lanzado ago 2026

Condicional

GLM-5.3 es el modelo de pesos abiertos de codificación y ciberdefensa más reciente de Z.ai: la misma base que GLM-5.2, con todas las mejoras provenientes del post-entrenamiento. Pero las cifras principales siguen siendo generadas por el proveedor, los pesos abiertos se retienen ~2 semanas por la capacidad de seguridad emergente y el precio por token no está publicado. Recurre a él ahora para seguridad defensiva y automatización agéntica; espera a los pesos y a las auditorías independientes antes de estandarizarte.

¿Es adecuada para ti?

Bueno para

  • Ciberseguridad defensiva: 84.5% en CyberGym, el mejor resultado publicado, por delante de Mythos 5 (83.8%) y GPT-5.6 Sol (83.6%)
  • Codificación de largo alcance: 66.9% en DeepSWE v1.1 (frente al 46.2%), 28.3 en Terminal-Bench 3.0 (seis veces más que el 4.6)
  • Automatización agéntica: AutomationBench v1.0.6 salta de 26.2 a 48.2 (+84%); el aprendizaje por refuerzo SAO impulsa las ganancias de largo alcance
  • Autoalojadores que planean adoptar pesos abiertos: reutiliza la base de GLM-5.2; pesos programados para ~2 semanas

No recomendado para

  • Explotación ofensiva profunda: el 54.4% en ExploitBench sigue por detrás de Mythos 5 (78.0%) y GPT-5.6 Sol (76.5%)
  • Autoalojamiento inmediato: los pesos se retienen ~2 semanas por endurecimiento de seguridad; el primer retraso de pesos por motivos cibernéticos de Z.ai
  • Equipos que necesitan precios por token publicados o visión: no hay fila de GLM-5.3 en la tabla de precios de Z.ai; no se anunció capacidad multimodal

Rendimiento por tarea

Defensive security (CyberGym)

Excellent

84.5% en CyberGym: el mejor resultado publicado, por delante de la frontera cerrada; reportado por el proveedor, no auditado de forma independiente

Long-horizon software engineering (DeepSWE v1.1)

Very Good

66.9% en DeepSWE v1.1, frente al 46.2%: un salto de 20 puntos, aunque la cifra la ejecutó Z.ai

Terminal/CLI coding (Terminal-Bench 3.0)

Very Good

28.3 en Terminal-Bench 3.0, seis veces más que el 4.6 de GLM-5.2; a la par de la frontera en Terminal-Bench 2.1 (88.2 frente a 88.8)

Deep exploitation (ExploitBench)

Fair

El 54.4% en ExploitBench más que duplica a GLM-5.2 (24.4%), pero aún va 20+ puntos por detrás de la frontera cerrada

Vision / multimodal

Poor

No se anunció ni se midió ninguna capacidad de visión en el lanzamiento

Precios

Entrada

N/A (rate not yet published)

Salida

N/A (rate not yet published)

Contexto

1M context

Ver precios completos

Pruebas de rendimiento

PruebaPuntuaciónFuente
CyberGym84.5% Fuente
DeepSWE v1.166.9% Fuente
Terminal-Bench 3.028.3 Fuente
Terminal-Bench 2.188.2 Fuente
ExploitBench54.4% Fuente
ExploitGym (2h / 6h tasks)105 / 130 Fuente

Aún no hay cambios de veredicto

El reloj corre desde el primer día: los cambios aparecerán aquí a medida que evolucione nuestro veredicto.

Registro de verificación

Aún no hay comprobaciones de verificación

Todavía no hemos registrado ninguna comprobación de verificación para esta entrada. Cuando se ejecute una, su historial aparecerá aquí.

Cómo evaluamos