Z.ai anunció el lanzamiento de GLM-5.3, un modelo que reutiliza la misma base de 743 mil millones de parámetros de GLM-5.2 y concentra todas las mejoras en el posentrenamiento. La empresa afirmó que los pesos se publicarán en aproximadamente dos semanas, tras completar la evaluación de seguridad y el endurecimiento del sistema.

Rendimiento en codificación

En Terminal-Bench 3.0, GLM-5.3 subió de 4,6 a 28,3 puntos en comparación con GLM-5.2. En DeepSWE v1.1, la puntuación pasó de 46,2 a 66,9. En Agents' Last Exam (CLI), el avance fue de 23,8 a 28,5. En GDPval-AA v2, que abarca 44 ocupaciones, el modelo registró 1.769 puntos.

GLM 5.3 Performance Evaluation
GLM 5.3 Performance Evaluation

En el benchmark interno Z.ai Code Bench, la empresa reportó una mejora del 50% sobre GLM-5.2, con un 31,4% de aciertos en tareas con alrededor de 50 mil tokens de salida. La prueba compara el modelo con Claude Opus 4.8 (29,5% con 120 mil tokens) y Claude Fable 5 (39,5% en esfuerzo máximo). La compañía afirma que el benchmark privado reduce el riesgo de contaminación.

En suites públicas, GLM-5.3 queda por detrás de GPT-5.6 Sol y Fable 5 en algunas evaluaciones de codificación más difíciles. Todos los resultados son informados por los propios desarrolladores, con configuraciones documentadas en el anuncio.

Resultados en seguridad cibernética

La compañía clasificó el avance en seguridad cibernética como no planificado. La empresa añadió datos de descubrimiento de vulnerabilidades esperando mejorar el razonamiento sobre errores aislados, pero la capacidad continuó expandiéndose con el entrenamiento, formando planes coherentes en cadenas completas de explotación.

Cyber Capability
Cyber Capability

En CyberGym, que prueba descubrimiento y validación a partir de código fuente, GLM-5.3 subió de 77,2% a 84,5%, superando a Mythos 5 (83,8%) y GPT-5.6 Sol (83,6%). En ExploitBench, que exige razonamiento sobre causa raíz y explotación funcional, el modelo pasó de 24,4% a 54,4%, aún por debajo de Mythos 5, con 78,0%.

En ExploitGym, GLM-5.3 completó 105 tareas en dos horas y 130 en seis horas, frente a 29 y 39 de GLM-5.2. Mythos 5 completó 181 y 247 tareas en los mismos períodos.

Disponibilidad

GLM-5.3 está disponible a través de la API de Z.ai, del GLM Coding Plan y de ZCode. La empresa recomienda que las startups y los equipos de ingeniería de tamaño mediano adopten el modelo de inmediato, mientras que las empresas con reglas de residencia de datos o revisión de proveedores deben esperar la publicación de los pesos.

Sigue en Radar