PÉKIN, 17 août 2026, 04:47 CST
- Z.ai prévoit de retenir les poids publics de GLM-5.3 pendant environ deux semaines.
- Le modèle a presque égalé Anthropic dans la détection de bugs mais est resté en retrait dans le développement d’exploits.
Z.ai Co. Ltd. (HKG:2513) retarde la publication des poids ouverts de GLM-5.3 le temps de terminer les examens de sécurité. Le développeur chinois d’IA prévoit que la révision prendra environ deux semaines.
La décision est importante car GLM-5.3 peut à la fois trouver des failles logicielles et aider à les transformer en attaques. Des poids ouverts permettraient aux utilisateurs d’exécuter et de modifier le modèle en dehors du contrôle direct de Z.ai.
Le résultat phare de Z.ai provient de CyberGym, qui teste la revue de code et la confirmation de vulnérabilités. GLM-5.3 a obtenu 84,5 %, contre 83,8 % pour le Mythos 5 restreint d’Anthropic. L’avance de 0,7 point reste une affirmation de l’entreprise.
| Résultat CyberGym | GLM-5.3 | Anthropic Mythos 5 | Différence |
|---|---|---|---|
| Score de vulnérabilité confirmée | 84,5 % | 83,8 % | GLM-5.3 +0,7 point |
| Vérification indépendante | Non disponible | Non disponible dans la comparaison de Z.ai | Résultats fournisseurs non vérifiés |
La situation a changé sur ExploitBench. GLM-5.3 a converti 54,4 % des failles découvertes en attaques fonctionnelles. Mythos 5 a atteint 78,0 %, laissant un écart de 23,6 points.
| Résultat ExploitBench | GLM-5.3 | Anthropic Mythos 5 | Différence |
|---|---|---|---|
| Score d’exploit fonctionnel | 54,4 % | 78,0 % | Mythos 5 +23,6 points |
| Ce que cela mesure | Transformer les failles trouvées en attaques | Transformer les failles trouvées en attaques | Tâche comparable |
Des essais chronométrés ont montré un écart similaire. Z.ai a rapporté 105 tâches de développement d’attaque terminées après deux heures et 130 après six. Mythos 5 en a terminé respectivement 181 et 247.
| Test chronométré de développement d’attaque | GLM-5.3 | Anthropic Mythos 5 | Écart GLM-5.3 |
|---|---|---|---|
| Tâches terminées en deux heures | 105 | 181 | 76 de moins |
| Tâches terminées en six heures | 130 | 247 | 117 de moins |
Ces résultats suggèrent des points forts distincts. GLM-5.3 semble compétitif pour repérer les défauts probables. Il est nettement plus faible pour produire des exploits utilisables, selon les propres chiffres de Z.ai.
Le plan de publication distingue également l’accès ordinaire des capacités sensibles. L’accès initial sera accordé à des partenaires de lancement sélectionnés. Les fonctions avancées de cybersécurité nécessiteront des utilisateurs vérifiés dans le cadre d’un programme d’accès de confiance.
| Modèle | Statut actuel | Poids | Accès cybersécurité |
|---|---|---|---|
| GLM-5.3 | Revue de sécurité pré-version | Sortie publique prévue dans environ deux semaines | Fonctions sensibles limitées aux utilisateurs vérifiés |
| Anthropic Mythos 5 | Disponible pour les organisations approuvées | Non téléchargeable publiquement | Programme à accès restreint |
| GLM-5.2 | Disponible maintenant | Poids ouverts sur Hugging Face | Aucun contrôle GLM-5.3 annoncé pour ce modèle |
Z.ai a déclaré que l’accès s’élargirait via « un processus cohérent et responsable ». L’approche ressemble à la distribution limitée de Mythos 5 par Anthropic, bien que Z.ai prévoie toujours une diffusion plus large des poids.
Gabriel Wagner, chercheur en gouvernance de l’IA chez Concordia AI, a qualifié cela de « première fois qu’un laboratoire chinois justifie publiquement un retard dans la publication ouverte des poids du modèle ». Son analyse indique un changement dans la façon dont les laboratoires chinois abordent le risque d’usage dual.
L’entreprise a déjà constitué une large audience de modèles ouverts. Z.ai affirme que sa série de modèles a dépassé les 40 millions de téléchargements dans le monde. Son organisation officielle sur Hugging Face répertorie actuellement GLM-5.2 comme un modèle de 753 milliards de paramètres.
L’architecture, le nombre de paramètres, la fenêtre de contexte, la licence et la tarification API de GLM-5.3 restent non divulgués. Les acheteurs ne peuvent donc pas encore comparer les coûts de déploiement ou les besoins matériels avec les modèles existants.
Le déploiement pourrait tester si l’accès de confiance peut survivre à une publication ouverte ultérieure. Une fois les poids du modèle diffusés, il devient difficile de faire respecter les vérifications centralisées des comptes et la surveillance de l’utilisation.
Risques : Les résultats des benchmarks ne sont pas vérifiés de manière indépendante. Les modèles de cybersécurité peuvent aider les défenseurs, mais ils peuvent aussi abaisser les barrières techniques pour les attaquants. Les garanties finales et les conditions de publication pourraient évoluer.