PEKÍN, 17 de agosto de 2026, 04:47 CST
- Z.ai planea retener los pesos públicos de GLM-5.3 durante aproximadamente dos semanas.
- El modelo casi igualó a Anthropic en la detección de errores, pero quedó rezagado en el desarrollo de exploits.
Z.ai Co. Ltd. (HKG:2513) está retrasando la publicación de los pesos abiertos de GLM-5.3 mientras completa revisiones de seguridad. El desarrollador chino de IA espera que la revisión tome unas dos semanas.
La decisión es importante porque GLM-5.3 puede tanto encontrar fallos de software como ayudar a convertirlos en ataques. Los pesos abiertos permitirían a los usuarios ejecutar y modificar el modelo fuera del control directo de Z.ai.
El resultado principal de Z.ai provino de CyberGym, que prueba la revisión de código y la confirmación de vulnerabilidades. GLM-5.3 obtuvo un 84,5%, frente al 83,8% de Mythos 5 de Anthropic, que es restringido. La ventaja de 0,7 puntos sigue siendo una afirmación de la empresa.
| Resultado de CyberGym | GLM-5.3 | Anthropic Mythos 5 | Diferencia |
|---|---|---|---|
| Puntuación de vulnerabilidad confirmada | 84,5% | 83,8% | GLM-5.3 +0,7 puntos |
| Verificación independiente | No disponible | No disponible en la comparación de Z.ai | Resultados de proveedor no verificados |
El panorama cambió en ExploitBench. GLM-5.3 convirtió el 54,4% de los fallos descubiertos en ataques funcionales. Mythos 5 alcanzó el 78,0%, dejando una diferencia de 23,6 puntos.
| Resultado de ExploitBench | GLM-5.3 | Anthropic Mythos 5 | Diferencia |
|---|---|---|---|
| Puntuación de exploit funcional | 54,4% | 78,0% | Mythos 5 +23,6 puntos |
| Qué mide | Convertir fallos encontrados en ataques | Convertir fallos encontrados en ataques | Tarea comparable |
Las pruebas cronometradas mostraron una brecha similar. Z.ai reportó 105 tareas de desarrollo de ataques completadas después de dos horas y 130 después de seis. Mythos 5 completó 181 y 247, respectivamente.
| Prueba cronometrada de desarrollo de ataques | GLM-5.3 | Anthropic Mythos 5 | Diferencia GLM-5.3 |
|---|---|---|---|
| Tareas completadas en dos horas | 105 | 181 | 76 menos |
| Tareas completadas en seis horas | 130 | 247 | 117 menos |
Estos resultados sugieren fortalezas separadas. GLM-5.3 parece competitivo en la detección de defectos probables. Es materialmente más débil en la producción de exploits utilizables, según las propias cifras de Z.ai.
El plan de lanzamiento también separa el acceso ordinario de las capacidades sensibles. El acceso inicial será para socios de lanzamiento seleccionados. Las funciones avanzadas de ciberseguridad requerirán usuarios verificados bajo un programa de acceso confiable.
| Modelo | Estado actual | Pesos | Acceso de ciberseguridad |
|---|---|---|---|
| GLM-5.3 | Revisión de seguridad previa al lanzamiento | Lanzamiento público planeado en aproximadamente dos semanas | Funciones sensibles limitadas a usuarios verificados |
| Anthropic Mythos 5 | Disponible para organizaciones verificadas | No descargable públicamente | Programa de acceso restringido |
| GLM-5.2 | Disponible ahora | Pesos abiertos en Hugging Face | No se han anunciado controles de GLM-5.3 para este modelo |
Z.ai dijo que el acceso se ampliaría a través de “un proceso coherente y responsable”. El enfoque se asemeja a la distribución limitada de Mythos 5 de Anthropic, aunque Z.ai aún planea un lanzamiento más amplio de los pesos.
Gabriel Wagner, investigador de gobernanza de IA en Concordia AI, lo calificó como “la primera vez que un laboratorio chino justifica públicamente un lanzamiento abierto retrasado de los pesos del modelo”. Su evaluación apunta a un cambio en la forma en que los laboratorios chinos discuten el riesgo de doble uso.
La empresa ya ha construido una gran audiencia de modelos abiertos. Z.ai dice que su serie de modelos ha superado los 40 millones de descargas en todo el mundo. Su organización oficial en Hugging Face actualmente lista a GLM-5.2 como un modelo de 753 mil millones de parámetros.
La arquitectura, el número de parámetros, la ventana de contexto, la licencia y los precios de la API de GLM-5.3 permanecen sin revelarse. Por lo tanto, los compradores aún no pueden comparar los costos de implementación o las necesidades de hardware con los modelos existentes.
El despliegue puede poner a prueba si el acceso de confianza puede sobrevivir a un lanzamiento abierto posterior. Una vez que los pesos del modelo circulan, los controles centralizados de cuentas y el monitoreo de uso se vuelven difíciles de hacer cumplir.
Riesgos: Los resultados de los benchmarks no están verificados de forma independiente. Los modelos de ciberseguridad pueden ayudar a los defensores, pero también pueden reducir las barreras técnicas para los atacantes. Las salvaguardas finales y los términos de lanzamiento podrían cambiar.