G

GLM-5.3

Z.ai · Lançado 08/2026

Condicional

O GLM-5.3 é o mais recente modelo de pesos abertos de código e ciberdefesa da Z.ai — a mesma base do GLM-5.2, com todos os ganhos vindos do pós-treinamento. Mas os números de destaque ainda são executados pelo fornecedor, os pesos abertos estão retidos por ~2 semanas por causa da capacidade de segurança emergente, e o preço por token não foi publicado. Use-o já para segurança defensiva e automação agêntica; aguarde os pesos e auditorias independentes antes de padronizar.

É adequada para ti?

Bom para

  • Cibersegurança defensiva — CyberGym 84,5%, melhor resultado publicado, à frente do Mythos 5 (83,8%) e do GPT-5.6 Sol (83,6%)
  • Código de longo horizonte — DeepSWE v1.1 66,9% (de 46,2%), Terminal-Bench 3.0 28,3 (seis vezes acima de 4,6)
  • Automação agêntica — AutomationBench v1.0.6 salta de 26,2→48,2 (+84%); o reinforcement learning SAO impulsiona os ganhos de longo horizonte
  • Auto-hospedadores planejando a adoção de pesos abertos — reutiliza a base do GLM-5.2, pesos programados para ~2 semanas

Não recomendado para

  • Exploração ofensiva profunda — ExploitBench 54,4% ainda fica atrás do Mythos 5 (78,0%) e do GPT-5.6 Sol (76,5%)
  • Auto-hospedagem imediata — pesos retidos por ~2 semanas para endurecimento de segurança; o primeiro atraso de pesos por motivo cibernético da Z.ai
  • Times que precisam de preço por token publicado ou visão — não há linha do GLM-5.3 na tabela de preços da Z.ai; nenhuma capacidade multimodal anunciada

Desempenho por tarefa

Defensive security (CyberGym)

Excellent

84,5% no CyberGym — melhor resultado publicado, à frente da fronteira fechada; reportado pelo fornecedor, não auditado de forma independente

Long-horizon software engineering (DeepSWE v1.1)

Very Good

66,9% no DeepSWE v1.1, acima dos 46,2% — um salto de 20 pontos, embora o número seja executado pela Z.ai

Terminal/CLI coding (Terminal-Bench 3.0)

Very Good

28,3 no Terminal-Bench 3.0, seis vezes acima dos 4,6 do GLM-5.2; empatado com a fronteira no Terminal-Bench 2.1 (88,2 vs 88,8)

Deep exploitation (ExploitBench)

Fair

54,4% no ExploitBench, mais que o dobro do GLM-5.2 (24,4%), mas ainda fica atrás da fronteira fechada por mais de 20 pontos

Vision / multimodal

Poor

Nenhuma capacidade de visão anunciada ou avaliada por benchmark no lançamento

Preços

Entrada

N/A (rate not yet published)

Saída

N/A (rate not yet published)

Contexto

1M context

Ver preços completos

Testes de desempenho

TestePontuaçãoFonte
CyberGym84.5% Fonte
DeepSWE v1.166.9% Fonte
Terminal-Bench 3.028.3 Fonte
Terminal-Bench 2.188.2 Fonte
ExploitBench54.4% Fonte
ExploitGym (2h / 6h tasks)105 / 130 Fonte

Ainda sem alterações de veredicto

O relógio começa a contar no primeiro dia: as alterações aparecem aqui à medida que o nosso veredicto evolui.

Registo de verificação

Ainda não há verificações

Ainda não registámos nenhuma verificação para esta entrada. Assim que uma for executada, o seu histórico aparece aqui.

Como avaliamos