PEKING, 17. August 2026, 04:47 CST
- Z.ai plant, die öffentlichen Gewichte von GLM-5.3 für etwa zwei Wochen zurückzuhalten.
- Das Modell erreichte beim Auffinden von Fehlern fast das Niveau von Anthropic, lag aber bei der Entwicklung von Exploits zurück.
Z.ai Co. Ltd. (HKG:2513) verzögert die öffentliche Freigabe der offenen Gewichte von GLM-5.3, während Sicherheitsüberprüfungen abgeschlossen werden. Der chinesische KI-Entwickler erwartet, dass die Überprüfung etwa zwei Wochen dauern wird.
Die Entscheidung ist bedeutsam, weil GLM-5.3 sowohl Softwarefehler finden als auch bei deren Ausnutzung helfen kann. Offene Gewichte würden es Nutzern ermöglichen, das Modell außerhalb der direkten Kontrolle von Z.ai auszuführen und zu modifizieren.
Das wichtigste Ergebnis von Z.ai stammt aus CyberGym, das Code-Review und Bestätigung von Schwachstellen testet. GLM-5.3 erzielte 84,5 %, gegenüber 83,8 % für Anthropics eingeschränktes Mythos 5. Der Vorsprung von 0,7 Punkten bleibt eine Unternehmensbehauptung.
| CyberGym-Ergebnis | GLM-5.3 | Anthropic Mythos 5 | Unterschied |
|---|---|---|---|
| Bestätigte Schwachstellenbewertung | 84,5 % | 83,8 % | GLM-5.3 +0,7 Punkte |
| Unabhängige Überprüfung | Nicht verfügbar | Nicht verfügbar im Vergleich von Z.ai | Unbestätigte Anbieterergebnisse |
Das Bild änderte sich bei ExploitBench. GLM-5.3 wandelte 54,4 % der entdeckten Schwachstellen in funktionierende Angriffe um. Mythos 5 erreichte 78,0 %, was eine Lücke von 23,6 Punkten hinterließ.
| ExploitBench-Ergebnis | GLM-5.3 | Anthropic Mythos 5 | Unterschied |
|---|---|---|---|
| Bewertung funktionierender Exploits | 54,4 % | 78,0 % | Mythos 5 +23,6 Punkte |
| Was gemessen wird | Gefundene Schwachstellen in Angriffe umwandeln | Gefundene Schwachstellen in Angriffe umwandeln | Vergleichbare Aufgabe |
Zeitlich begrenzte Tests zeigten eine ähnliche Lücke. Z.ai meldete 105 abgeschlossene Aufgaben zur Angriffsentwicklung nach zwei Stunden und 130 nach sechs. Mythos 5 schloss jeweils 181 bzw. 247 ab.
| Zeitlich begrenzter Angriffsentwicklungstest | GLM-5.3 | Anthropic Mythos 5 | GLM-5.3 Rückstand |
|---|---|---|---|
| Abgeschlossene Aufgaben in zwei Stunden | 105 | 181 | 76 weniger |
| Abgeschlossene Aufgaben in sechs Stunden | 130 | 247 | 117 weniger |
Diese Ergebnisse deuten auf unterschiedliche Stärken hin. GLM-5.3 scheint beim Erkennen wahrscheinlicher Fehler konkurrenzfähig zu sein. Es ist jedoch deutlich schwächer bei der Erstellung nutzbarer Exploits, basierend auf den eigenen Zahlen von Z.ai.
Der Veröffentlichungsplan trennt auch den normalen Zugang von sensiblen Fähigkeiten. Der anfängliche Zugang wird ausgewählten Launch-Partnern gewährt. Erweiterte Cybersicherheitsfunktionen erfordern verifizierte Nutzer im Rahmen eines Trusted-Access-Programms.
| Modell | Aktueller Status | Gewichte | Cybersecurity-Zugang |
|---|---|---|---|
| GLM-5.3 | Sicherheitsüberprüfung vor Veröffentlichung | Geplante öffentliche Freigabe in etwa zwei Wochen | Sensible Funktionen nur für verifizierte Nutzer |
| Anthropic Mythos 5 | Verfügbar für geprüfte Organisationen | Nicht öffentlich herunterladbar | Programm mit eingeschränktem Zugang |
| GLM-5.2 | Jetzt verfügbar | Offene Gewichte auf Hugging Face | Keine GLM-5.3-Kontrollen für dieses Modell angekündigt |
Z.ai sagte, der Zugang würde durch „einen konsistenten und verantwortungsvollen Prozess“ erweitert werden. Der Ansatz ähnelt der begrenzten Verteilung von Mythos 5 durch Anthropic, obwohl Z.ai weiterhin eine breitere Veröffentlichung der Gewichte beabsichtigt.
Gabriel Wagner, ein Forscher für KI-Governance bei Concordia AI, nannte es „das erste Mal, dass ein chinesisches Labor die verzögerte offene Veröffentlichung von Modellgewichten öffentlich rechtfertigt.“ Seine Einschätzung deutet auf eine Veränderung in der Diskussion chinesischer Labore über Dual-Use-Risiken hin.
Das Unternehmen hat bereits ein großes Open-Model-Publikum aufgebaut. Z.ai sagt, dass seine Modellreihe weltweit über 40 Millionen Downloads erreicht hat. Die offizielle Hugging Face-Organisation listet derzeit GLM-5.2 als ein Modell mit 753 Milliarden Parametern.
Die Architektur, die Parameteranzahl, das Kontextfenster, die Lizenz und die API-Preise von GLM-5.3 bleiben unveröffentlicht. Käufer können daher die Bereitstellungskosten oder Hardware-Anforderungen noch nicht mit bestehenden Modellen vergleichen.
Die Einführung könnte testen, ob vertrauensbasierter Zugang eine spätere offene Veröffentlichung übersteht. Sobald Modellgewichte im Umlauf sind, werden zentrale Kontoüberprüfungen und Nutzungsüberwachung schwer durchzusetzen.
Risiken: Die Benchmark-Ergebnisse sind nicht unabhängig verifiziert. Cybersecurity-Modelle können Verteidiger unterstützen, aber sie könnten auch technische Hürden für Angreifer senken. Endgültige Schutzmaßnahmen und Freigabebedingungen könnten sich ändern.