Z.ai lanza la API GLM-5.3 para programación y seguridad defensiva

El modelo solo de texto mantiene los precios de GLM-5.2, agrega una ventana de contexto de 1 millón de tokens y llega antes de sus pesos públicos retrasados.

By · Published

Primary source: Z.ai on X

Why it matters

Hosted access lets Z.ai monetize and monitor a model it says can chain exploits while postponing the harder-to-control open-weight release.

Z.ai launches GLM-5.3 API for coding and defensive security — The text-only model keeps GLM-5.2 pricing, adds a 1M-token context window, and arrives before its delayed public weights.

Z.ai abrió el acceso por API a GLM-5.3 el 18 de agosto, poniendo su nuevo modelo de programación y ciberseguridad detrás de una interfaz alojada mientras el laboratorio retiene los pesos del modelo para trabajos de seguridad adicionales.

El laboratorio de IA de Pekín está cobrando $1.40 por millón de tokens de entrada y $4.40 por millón de tokens de salida, las mismas tarifas listadas para GLM-5.2. La entrada en caché cuesta $0.26 por millón de tokens. Z.ai dice que GLM-5.3 también está disponible a través de pasarelas de modelos de socios, aunque su anuncio no identificó a esos proveedores.

Z.ai surgió del Knowledge Engineering Group de la Universidad de Tsinghua en 2019. Los cofundadores Jie Tang y Juanzi Li construyeron el laboratorio alrededor del programa de investigación GLM, que produjo su primer marco de preentrenamiento en 2021 y el modelo de código abierto GLM-130B al año siguiente, según la historia corporativa de Z.ai.

Una mejora post-entrenamiento con un modo de razonamiento forzado

Z.ai dice que GLM-5.3 usa el mismo modelo base que GLM-5.2, con sus ganancias provenientes enteramente del post-entrenamiento. Eso hace que este lanzamiento sea un refinamiento del modelo que Z.ai envió en junio en lugar de una nueva corrida de entrenamiento de modelo de base.

El modelo acepta solo texto y cuenta con una ventana de contexto de 1 millón de tokens con una salida máxima de 128,000 tokens. Soporta invocation de funciones, salida estructurada, caché de contexto y llamadas a herramientas en streaming. Los desarrolladores pueden conectarse a través de interfaces compatibles con los protocolos Chat Completions y Responses de OpenAI o con el protocolo Messages de Anthropic.

El razonamiento siempre está habilitado. Z.ai ofrece configuraciones de esfuerzo de razonamiento bajo, alto y máximo, siendo máximo el valor predeterminado. Las aplicaciones que envíen una solicitud con el razonamiento desactivado recibirán un error, por lo que las integraciones existentes de GLM no pueden cambiar los identificadores de modelo sin revisar sus parámetros. Z.ai publicó una guía de migración que cubre el cambio.

La configuración de razonamiento forzado importa para el costo y la latencia. Z.ai recomienda probar ambas al migrar cargas de trabajo con contexto largo, aunque el precio por token no ha aumentado.

Las ganancias en los benchmarks son mayores en tareas más largas

Z.ai informa que GLM-5.3 mejoró de 4.6 a 28.3 en Terminal-Bench 3.0, de 46.2 a 66.9 en DeepSWE v1.1 y de 23.8 a 28.5 en Agents' Last Exam. Esos son resultados reportados por la empresa y no se han reproducido de forma independiente aquí.

En Z.ai Code Bench, una prueba privada construida alrededor de entornos de desarrollo locales, la compañía dice que GLM-5.3 logró una puntuación de finalización del 34.5% en su nivel de esfuerzo máximo mientras usaba aproximadamente 75,000 tokens de salida por tarea. GLM-5.2 obtuvo 23.4% mientras consumía alrededor de 96,000 tokens de salida. El benchmark privado reduce la exposición a la contaminación de conjuntos de prueba públicos, pero su diseño y evaluación no pueden inspeccionarse tan de cerca como un benchmark público.

La propia comparación de Z.ai también muestra dónde GLM-5.3 queda atrás. La compañía reporta que Claude Fable 5 obtuvo 39.5% en su benchmark de programación, cinco puntos porcentuales por encima de GLM-5.3 en esfuerzo máximo.

El acceso por API llega antes que los pesos abiertos

La ciberseguridad es la parte más trascendental del lanzamiento. Z.ai dice que añadió entornos de descubrimiento de vulnerabilidades a los datos de post-entrenamiento de GLM-5.3 y descubrió que las ganancias del modelo crecieron a medida que las tareas pasaban de identificar fallas a construir cadenas completas de explotación.

En CyberGym, GLM-5.3 obtuvo 84.5%, frente a 77.2% para GLM-5.2, según Z.ai. Su puntuación en ExploitBench subió de 24.4% a 54.4%. La prueba de explotación más profunda todavía dejó a GLM-5.3 muy por detrás de los modelos cerrados que Z.ai evaluó, los cuales obtuvieron puntuaciones por encima del 76%.

Z.ai también afirma que los modelos GLM identificaron 2,436 vulnerabilidades en 269 proyectos del mundo real tras la revisión y eliminación de duplicados por parte de especialistas en seguridad, incluidos 1,097 problemas clasificados como de severidad media o alta. Los proyectos abarcaban sistemas operativos, motores de navegador, software de infraestructura, aplicaciones web y protocolos de red.

Esas capacidades explican la distribución escalonada. Cuando Z.ai presentó GLM-5.3 el 14 de agosto, dijo que pospondría la publicación pública de los pesos por dos semanas mientras probaba salvaguardas adicionales, Axios informó. A socios de seguridad seleccionados se les ofreció acceso controlado durante ese periodo.

El lanzamiento de la API el 18 de agosto ofrece a los desarrolladores acceso inmediato sin entregar una copia modificable libremente del modelo. También da a Z.ai visibilidad sobre el uso y una manera de aplicar controles de acceso durante la demora. El acuerdo es temporal si Z.ai cumple con su plan de liberar los pesos, pero pone de manifiesto el problema central creado por modelos cibernéticos más potentes: las salvaguardas alojadas terminan cuando los pesos salen del laboratorio.

Para los desarrolladores dispuestos a aceptar el modo de razonamiento obligatorio, GLM-5.3 está disponible a los mismos precios por token que su predecesor. Para Z.ai, el lanzamiento más difícil llega cuando siga la versión descargable.

Reader comments

Conversation for this story loads after sign-in.