A Z.ai anunciou o lançamento do GLM-5.3, modelo que reutiliza a mesma base de 743 bilhões de parâmetros do GLM-5.2 e concentra todas as melhorias no pós-treinamento. A empresa afirmou que os pesos serão publicados em cerca de duas semanas, após a conclusão da avaliação de segurança e do endurecimento do sistema.

Desempenho em codificação

No Terminal-Bench 3.0, o GLM-5.3 subiu de 4,6 para 28,3 pontos na comparação com o GLM-5.2. No DeepSWE v1.1, a pontuação passou de 46,2 para 66,9. No Agents' Last Exam (CLI), o avanço foi de 23,8 para 28,5. No GDPval-AA v2, que abrange 44 ocupações, o modelo registrou 1.769 pontos.

GLM 5.3 Performance Evaluation
GLM 5.3 Performance Evaluation

No benchmark interno Z.ai Code Bench, a empresa reportou melhora de 50% sobre o GLM-5.2, com 31,4% de acertos em tarefas com cerca de 50 mil tokens de saída. O teste compara o modelo ao Claude Opus 4.8 (29,5% com 120 mil tokens) e ao Claude Fable 5 (39,5% em esforço máximo). A companhia afirma que o benchmark privado reduz o risco de contaminação.

Em suítes públicas, o GLM-5.3 fica atrás do GPT-5.6 Sol e do Fable 5 em algumas avaliações de codificação mais difíceis. Todos os resultados são informados pelos próprios desenvolvedores, com configurações documentadas no anúncio.

Resultados em segurança cibernética

A companhia classificou o avanço em segurança cibernética como não planejado. A empresa adicionou dados de descoberta de vulnerabilidades esperando melhorar o raciocínio sobre bugs isolados, mas a capacidade continuou a se expandir com o treinamento, formando planos coerentes em cadeias completas de exploração.

Cyber Capability
Cyber Capability

No CyberGym, que testa descoberta e validação a partir de código-fonte, o GLM-5.3 subiu de 77,2% para 84,5%, superando Mythos 5 (83,8%) e GPT-5.6 Sol (83,6%). No ExploitBench, que exige raciocínio sobre causa raiz e exploração funcional, o modelo passou de 24,4% para 54,4%, ainda abaixo do Mythos 5, com 78,0%.

No ExploitGym, o GLM-5.3 completou 105 tarefas em duas horas e 130 em seis horas, contra 29 e 39 do GLM-5.2. O Mythos 5 completou 181 e 247 tarefas nos mesmos períodos.

Disponibilidade

O GLM-5.3 está disponível por meio da API da Z.ai, do GLM Coding Plan e do ZCode. A empresa recomenda que startups e equipes de engenharia de médio porte adotem o modelo imediatamente, enquanto empresas com regras de residência de dados ou revisão de fornecedores devem aguardar a liberação dos pesos.

Continue no Radar