Z.ai publica investigación sobre GLM-5.3 sin una ruta de acceso documentada
Z.ai informa avances en codificación y en explotación de vulnerabilidades, pero su documentación del producto identifica a GLM-5.1 como la versión más reciente y no proporciona ninguna vía de acceso a GLM-5.3.
By RuntimeWire Staff · Published · Updated
Primary source: Z.ai
Why it matters
Z.ai links long-horizon coding training to sharp claimed gains in vulnerability exploitation. Developers and security researchers still lack a confirmed GLM-5.3 endpoint, model identifier or downloadable artifact for reproducing those results.

Z.ai, la desarrolladora de inteligencia artificial de Beijing cofundada por Zhang Peng, Tang Jie y Liu Debing, publicó el 14 de agosto una entrada de investigación que presenta GLM-5.3 como una actualización post-entrenamiento para agentes de codificación e investigación de vulnerabilidades. La publicación de GLM-5.3 dice que el modelo usa la misma base que GLM-5.2, y que las mejoras provienen de otro mes de aprendizaje por refuerzo, entornos de tareas ampliados y cómputo adicional post-entrenamiento.
El registro del producto es menos claro. Al 14 de agosto, las notas de lanzamiento oficiales de Z.ai identificaban a GLM-5.1 como la última versión documentada de GLM-5 y no listaban GLM-5.3. La documentación de GLM-5 describe a GLM-5 como un modelo fundacional de pesos abiertos disponible a través del GLM Coding Plan, sin identificar un endpoint de API de GLM-5.3, un identificador de modelo alojado o un artefacto descargable.
Z.ai dice en la publicación del 14 de agosto que liberará los pesos de GLM-5.3 dos semanas después del lanzamiento, una vez que la evaluación de seguridad y el endurecimiento estén completos. La entrada remite a los lectores al Coding Plan de Z.ai y a ZCode, el agente de codificación de Z.ai, mientras etiqueta el acceso por Hugging Face como "Próximamente." No publica un endpoint de API, un identificador de modelo ni una descarga de pesos. Por lo tanto, al 14 de agosto los desarrolladores carecían de una vía de acceso confirmada a GLM-5.3 o de una configuración de producción reproducible.
La página del 14 de agosto es una entrada de investigación escrita por Z.ai que contiene afirmaciones detalladas sobre entrenamiento y benchmarks. Sus puntajes y hallazgos cibernéticos deben tratarse como afirmaciones de Z.ai hasta que evaluaciones independientes los reproduzcan. La brecha entre la publicación y la documentación de producto de Z.ai también deja sin confirmar la licencia y la configuración de servicio finales de GLM-5.3.
Tang, profesor de ciencias de la computación en Tsinghua University y cofundador de Z.ai, creó AMiner, un sistema de búsqueda académica y grafo de conocimiento en funcionamiento desde 2006. Su investigación ha abarcado minería de datos, redes sociales, grafos de conocimiento y modelos fundacionales, y su grupo contribuyó a GLM-130B, ChatGLM, CogView, CogVideo y CodeGeeX. Su biografía en Tsinghua indica que obtuvo su doctorado en ciencias de la computación allí en 2006. En su página de investigación, Tang describe su misión como "enseñar a las máquinas a pensar como los humanos."
Zhang, el CEO de Z.ai, trabajó con el Knowledge Engineering Group de Tsinghua y su centro de investigación en ciencia de datos antes de ayudar a comercializar esa investigación. Liu, el chairman de Z.ai, se ha enfocado en operaciones corporativas y de capital. Los fundadores construyeron Z.ai, previamente conocida fuera de China como Zhipu AI, alrededor de investigación originada en Tsinghua.
Z.ai cuenta con recursos sustanciales detrás de su trabajo en modelos. Su prospecto para la oferta en Hong Kong reportó 883 empleados al 30 de junio de 2025, incluyendo 657 en investigación y desarrollo. Los ingresos alcanzaron RMB312.4 millones en 2024 y RMB190.9 millones durante los primeros seis meses de 2025. A mitad de año, Z.ai dijo que atendía a más de 8,000 clientes institucionales y aproximadamente 80 millones de dispositivos.
El mismo prospecto afirma que Z.ai tenía más de 12,000 clientes institucionales en los nueve meses terminados el 30 de septiembre de 2025, y registró un consumo medio diario de tokens de aproximadamente 4.2 trillion en noviembre de 2025. Esas son medidas reportadas por Z.ai divulgadas para el proceso de listado, más que indicadores auditados de uso activo.
El prospecto informó aproximadamente RMB8.364 billion en inversiones previas a la OPV a través de rondas desde Series Angel hasta Series B6. La ronda más reciente listada aportó RMB4.377 billion e implicó una valoración post-money de aproximadamente RMB24.377 billion. Entre los patrocinadores nombrados en el prospecto figuran Meituan, Qiming Venture Partners, Legend Capital, Ant Group y Aramco Ventures. La oferta global abarcó 37,419,500 acciones a HK$116.20 cada una, lo que implica ingresos brutos de aproximadamente $557 millones.
CB Insights informa que Z.ai recaudó más de $1.4 mil millones en capital privado. Otros patrocinadores informados incluyeron a Alibaba, Tencent, Hillhouse y fondos del gobierno chino, según Forbes. Z.ai se listó en Hong Kong el 8 de enero de 2026, en una oferta que Dealroom reportó recaudó alrededor de $558 millones.
El post-entrenamiento impulsa las mejoras reportadas
Z.ai dice que la pila de entrenamiento de GLM-5.3 utiliza tres componentes introducidos con GLM-5.2: IndexShare para el procesamiento eficiente de contexto largo, SAO para aprendizaje por refuerzo en tareas de larga duración, y slime, su framework de código abierto para entrenamiento asincrónico por refuerzo.
Los entornos de entrenamiento descritos en la publicación se parecen a unidades de trabajo de ingeniería profesional en lugar de ejercicios cortos de codificación. En un ejemplo, un modelo recibe acceso a clústeres de cómputo, almacenamiento, documentación, código y resultados de experimentos. Debe localizar un cuello de botella en la infraestructura de machine learning, cambiar la implementación, ejecutar pruebas y producir una mejora de velocidad medible sin romper la corrección.
Construir suficientes de esos entornos se ha convertido en su propio problema de ingeniería. Z.ai dice que agentes de investigación recopilan patrones de tareas y los convierten en escenarios ejecutables con estado oculto y dependencias de múltiples pasos. Un juez separado intenta cada tarea para establecer que puede resolverse, mientras que verificadores generados prueban el resultado e intentan cerrar atajos que podrían permitir al modelo ganar una recompensa sin completar el trabajo subyacente.
Los humanos siguen siendo parte de esa canalización. Z.ai reconoce que la creación y verificación de entornos aún requieren una participación manual significativa. El enfoque será difícil de escalar a menos que Z.ai pueda producir tareas y recompensas confiables más rápido de lo que los especialistas pueden diseñarlas y auditarlas manualmente.
La tabla de benchmark de codificación de Z.ai reporta una subida de 4.6 a 28.3 en Terminal-Bench 3.0, de 46.2 a 66.9 en DeepSWE v1.1 y de 23.8 a 28.5 en Agents' Last Exam. En su Code Bench privado, Z.ai afirma una mejora del 50%. En la configuración de máximo esfuerzo, Z.ai dice que GLM-5.3 completó el 34.5% de las tareas usando aproximadamente 75,000 tokens de salida por tarea, en comparación con 23.4% con 96,000 tokens para GLM-5.2. El conjunto de tareas y la metodología de la prueba privada no pueden inspeccionarse de forma independiente a través de la publicación, y ninguno de estos resultados ha sido reproducido de forma independiente en el material proporcionado.
La tabla de comparación no produce un único líder. Coloca a GLM-5.3 contra modelos de Moonshot AI, DeepSeek, Alibaba, Anthropic y OpenAI. GLM-5.3 lidera las alternativas de pesos abiertos listadas en algunas evaluaciones, mientras que competidores obtienen resultados más altos en varias pruebas de codificación y explotación. La descripción de Z.ai de GLM-5.3 como el modelo de codificación de pesos abiertos más fuerte depende de sus evaluaciones y configuraciones seleccionadas.
Z.ai reporta una ganancia cibernética inesperada
La afirmación más trascendente aparece fuera de la propuesta de codificación. Z.ai dice que la capacidad de GLM-5.3 para encontrar y explotar vulnerabilidades de software mejoró más rápido de lo esperado a medida que se escaló el post-entrenamiento. La publicación describe una progresión desde identificar fallas aisladas hacia formar planes de explotación en múltiples etapas.
En sus resultados de benchmark cibernético, Z.ai reporta un puntaje CyberGym de 84.5 para GLM-5.3, frente a 77.2 para GLM-5.2. Lista un puntaje ExploitBench de 54.4, comparado con 24.4 para GLM-5.2. En ExploitGym, Z.ai reporta 105 y 130 resultados exitosos en límites de dos horas y seis horas, comparado con 29 y 39 para GLM-5.2. Estos resultados requieren reproducción independiente.
La comparación contiene una discrepancia interna de nombres. La tabla de Z.ai etiqueta el resultado de 78.0 en ExploitBench de Anthropic como "Fable 5", mientras que el texto circundante llama al modelo "Mythos 5." La publicación no establece qué configuración probó Z.ai, por lo que el resultado no puede asignarse de forma fiable a ninguno de los dos nombres. La misma tabla lista GPT-5.6 Sol en 76.5.
El significado práctico de las cifras relacionadas con seguridad cibernética depende del denominador de cada benchmark, del acceso a herramientas, de la política de reintentos y de las condiciones de ejecución. Las cifras brutas de exploits son especialmente difíciles de comparar sin ese detalle del protocolo. No obstante, el stack de evaluación de Z.ai registra sus mayores ganancias relativas más adelante en la ruta desde el descubrimiento de la vulnerabilidad hasta la explotación efectiva.
Más allá de los benchmarks controlados, Z.ai informa que sus modelos identificaron 2,436 vulnerabilidades en 269 proyectos tras la revisión de expertos, el cribado y la desduplicación, incluyendo 1,097 hallazgos descritos como de severidad crítica o alta. Z.ai dice que 53 hallazgos se divulgaron públicamente y 2,383 permanecieron bajo embargo, con actualizaciones registradas en el Z.ai Security Disclosure Ledger.
Z.ai atribuye los hallazgos al trabajo con varios equipos de seguridad en China. Los objetivos listados incluyen núcleos de sistema, sistemas operativos, motores de navegador, infraestructura de código abierto, aplicaciones web y protocolos de red. Estos siguen siendo totales reportados por Z.ai en lugar de una medición auditada de forma independiente, y los hallazgos individuales siguen sujetos a revisión por expertos y divulgación coordinada.
Pesos abiertos y la distribución de productos de codificación son competencias separadas
Z.ai compite con DeepSeek, Moonshot AI's Kimi y Alibaba's Qwen en modelos de pesos abiertos. Su distribución comercial también depende de productos de codificación que integran los modelos directamente en los flujos de trabajo de los desarrolladores. ZCode y el Coding Plan de Z.ai proveen esa capa de producto, mientras que herramientas aguas abajo como Cursor compiten controlando el entorno de codificación integrado en lugar de suministrar solo un modelo base.
En su página de suscripción, Z.ai anuncia precios desde $16.2 por mes para su Lite coding plan y dice que el plan soporta más de 20 herramientas de codificación. Las suscripciones alojadas le dan a Z.ai una relación de facturación directa con los desarrolladores. El despliegue de pesos abiertos atiende a compradores que desean ejecutar y modificar un modelo en su propia infraestructura. Los materiales oficiales de Z.ai describen GLM-5 como peso abierto, mientras que la publicación sobre GLM-5.3 promete los pesos solo después de un período de evaluación de seguridad y endurecimiento de dos semanas.
El modelo descrito en la publicación de investigación está pensado para tareas que pueden consumir decenas de miles de tokens y operar a través de terminales, repositorios e infraestructura. Mejores puntuaciones en benchmarks podrían ayudar a Z.ai a vender ese caso de uso. La adopción dependerá de la finalización fiable de trabajos de larga duración, evaluaciones reproducibles y una ruta documentada hacia el modelo.
Los resultados cibernéticos reportados exponen un costo de seguridad en el mismo método de entrenamiento. Un agente entrenado para inspeccionar código desconocido, operar herramientas, testar hipótesis y persistir ante fallos adquiere mecanismos que pueden apoyar labores de seguridad ofensiva. Z.ai dice que sus investigadores encontraron ese crecimiento de capacidad mientras buscaban un mejor desempeño en codificación.
Por ahora, Z.ai ha publicado afirmaciones detalladas sobre el entrenamiento, la codificación y los aspectos cibernéticos de GLM-5.3 sin añadir GLM-5.3 a las notas oficiales de la versión. La publicación de investigación promete los pesos después de una revisión de dos semanas, mientras que la documentación de Z.ai no proporciona ningún endpoint de API de GLM-5.3, identificador de modelo alojado ni artefacto descargable al 14 de agosto. Las pruebas independientes no pueden verificar las afirmaciones de los benchmarks hasta que los investigadores puedan establecer qué artefacto o configuración de servicio corresponde a los resultados reportados.