La china Zhipu AI reveló que el modelo anónimo Ox Alpha, que ganó terreno entre los desarrolladores en los últimos días, era en realidad el nuevo GLM-5.3-Flash. La empresa afirmó el miércoles (26) que todo el tráfico de la prueba se procesó en aceleradores de IA producidos en China, mientras el modelo llegó a la cima de las plataformas OpenRouter y OpenCode antes incluso del lanzamiento oficial.
Las acciones de Zhipu cerraron el jueves (27) con una subida superior al 12%, a HK$ 1.160, en Hong Kong. Durante el período en que operó de forma anónima, el modelo procesó cerca de 62 billones de tokens en OpenRouter y en OpenCode, según datos divulgados por la compañía y reportados por el South China Morning Post.
El lanzamiento llama la atención no solo por el rendimiento del modelo, sino por la infraestructura utilizada para sostenerlo. En el informe técnico, Zhipu afirma que puso el GLM-5.3-Flash en producción sobre una gran red de chips chinos y logró aumentar en tres veces el rendimiento de inferencia en comparación con la configuración inicial utilizada en el mismo hardware.

El modelo viral fue probado sin revelar su origen
Antes de la presentación oficial, el GLM-5.3-Flash apareció en OpenCode y en OpenRouter bajo el nombre clave Ox Alpha, sin identificación de la empresa responsable.
La estrategia permitió que el sistema fuera sometido a tráfico real de desarrolladores antes de que se conociera su origen. Según Zhipu, Ox Alpha rápidamente se convirtió en el modelo más popular de la semana en las plataformas donde estaba disponible.
En OpenRouter, el modelo había procesado más de 11 billones de tokens en los primeros tres días, estableciendo el mayor lanzamiento jamás registrado por la plataforma. El jueves, representaba cerca de 10,3 billones de tokens entre sistemas orientados a programación, aproximadamente el 31% del volumen semanal de la categoría.
La infraestructura detrás de este tráfico también se convirtió en parte central del anuncio. Zhipu dice en su publicación técnica que la operación ocurrió en una estructura formada por decenas de miles de aceleradores desarrollados en China. Informaciones proporcionadas por la empresa a la prensa china situaron la capacidad total utilizada en cerca de 100 mil chips domésticos.
Zhipu rediseña la arquitectura para reducir costos
El GLM-5.3-Flash es el primer modelo nativamente multimodal de la familia GLM-5, capaz de trabajar con diferentes tipos de información visual y textual desde la etapa de preentrenamiento.
El sistema tiene 320 mil millones de parámetros, pero activa solo 18 mil millones de ellos durante el procesamiento. La compañía también redujo el número de capas a 45, frente a 92 en la generación GLM-4.5, que utilizaba 32 mil millones de parámetros activos.
Otro cambio está en el mecanismo utilizado para manejar grandes volúmenes de contexto. La arquitectura combina atención lineal y dispersa, lo que permite que el modelo procese información cercana y recupere partes relevantes de un contexto más amplio sin realizar la misma cantidad de cálculos en cada paso.
Según las pruebas divulgadas por Zhipu, esta configuración reduce en tres veces el procesamiento relacionado con la atención y en 4,4 veces el tamaño del llamado KV cache en comparación con el GLM-5.3. El recurso es especialmente importante cuando el modelo trabaja con contextos que pueden llegar a 1 millón de tokens.
La empresa afirma además haber utilizado un conjunto de 30 billones de tokens multimodales en el preentrenamiento del nuevo sistema.

Los chips chinos sustentan una operación a gran escala
Para ejecutar el modelo en chips domésticos, Zhipu desarrolló un mecanismo de inferencia específico basado en SGLang y adaptó diferentes partes de la infraestructura a las limitaciones de memoria y ancho de banda de los aceleradores.
El sistema también separa tareas como la interpretación de contenido multimodal, el procesamiento inicial de los prompts y la generación de respuestas en grupos independientes de máquinas. Esta arquitectura permite distribuir diferentes etapas de la inferencia según la demanda.
La compañía afirma que las optimizaciones hicieron que el costo por token y la eficiencia del hardware se acercaran a los niveles obtenidos con las GPU convencionales de Nvidia. El resultado es presentado por Zhipu como evidencia de que los chips chinos pueden sustentar la inferencia de modelos avanzados a escala de producción.
En las pruebas publicadas por la propia empresa, el GLM-5.3-Flash obtuvo 63,4 puntos en DeepSWE v1.1, frente a 46,2 del GLM-5.2, y 48,8 en AutomationBench, frente a 26,2 de la generación anterior. Zhipu también afirma que el nuevo modelo se acerca al Claude Opus 4.8 en diferentes evaluaciones de programación y agentes de IA.
Los pesos del GLM-5.3-Flash fueron puestos a disposición públicamente, y el modelo ya se puede ejecutar mediante estructuras como SGLang, vLLM y TokenSpeed. Zhipu también comenzó a ofrecerlo a los suscriptores de su plan orientado a programación.



