PEKIN, 17 sierpnia 2026, 04:47 CST
- Z.ai planuje wstrzymać publiczne udostępnienie wag GLM-5.3 na około dwa tygodnie.
- Model niemal dorównał Anthropic w wykrywaniu błędów, ale pozostawał w tyle w opracowywaniu exploitów.
Z.ai Co. Ltd. (HKG:2513) opóźnia publiczne wydanie otwartych wag GLM-5.3, podczas gdy kończy przeglądy bezpieczeństwa. Chiński deweloper AI przewiduje, że przegląd potrwa około dwóch tygodni.
Decyzja ma znaczenie, ponieważ GLM-5.3 potrafi zarówno znajdować luki w oprogramowaniu, jak i pomagać w przekształcaniu ich w ataki. Otwarte wagi pozwoliłyby użytkownikom uruchamiać i modyfikować model poza bezpośrednią kontrolą Z.ai.
Najważniejszy wynik Z.ai pochodził z CyberGym, który testuje przegląd kodu i potwierdzanie podatności. GLM-5.3 uzyskał wynik 84,5%, wobec 83,8% dla ograniczonego Mythos 5 od Anthropic. Przewaga 0,7 punktu pozostaje twierdzeniem firmy.
| Wynik CyberGym | GLM-5.3 | Anthropic Mythos 5 | Różnica |
|---|---|---|---|
| Wynik potwierdzonych podatności | 84,5% | 83,8% | GLM-5.3 +0,7 punktu |
| Niezależna weryfikacja | Brak dostępnych danych | Brak danych w porównaniu Z.ai | Niezweryfikowane wyniki dostawcy |
Obraz zmienił się w ExploitBench. GLM-5.3 przekształcił 54,4% wykrytych luk w działające ataki. Mythos 5 osiągnął 78,0%, pozostawiając różnicę 23,6 punktu.
| Wynik ExploitBench | GLM-5.3 | Anthropic Mythos 5 | Różnica |
|---|---|---|---|
| Wynik działających exploitów | 54,4% | 78,0% | Mythos 5 +23,6 punktu |
| Co mierzy | Przekształcanie wykrytych luk w ataki | Przekształcanie wykrytych luk w ataki | Porównywalne zadanie |
Testy czasowe wykazały podobną różnicę. Z.ai zgłosił 105 ukończonych zadań opracowywania ataków po dwóch godzinach i 130 po sześciu. Mythos 5 ukończył odpowiednio 181 i 247.
| Test opracowywania ataków na czas | GLM-5.3 | Anthropic Mythos 5 | Różnica GLM-5.3 |
|---|---|---|---|
| Zadania ukończone w dwie godziny | 105 | 181 | O 76 mniej |
| Zadania ukończone w sześć godzin | 130 | 247 | O 117 mniej |
Te wyniki sugerują odrębne mocne strony. GLM-5.3 wydaje się konkurencyjny w wykrywaniu prawdopodobnych defektów. Jest wyraźnie słabszy w tworzeniu użytecznych exploitów, według danych Z.ai.
Plan wydania rozdziela także zwykły dostęp od wrażliwych funkcji. Początkowy dostęp otrzymają wybrani partnerzy startowi. Zaawansowane funkcje cyberbezpieczeństwa będą wymagały zweryfikowanych użytkowników w ramach programu zaufanego dostępu.
| Model | Obecny status | Wagi | Dostęp do cyberbezpieczeństwa |
|---|---|---|---|
| GLM-5.3 | Przegląd bezpieczeństwa przed wydaniem | Planowana publiczna premiera za około dwa tygodnie | Funkcje wrażliwe ograniczone do zweryfikowanych użytkowników |
| Anthropic Mythos 5 | Dostępny dla zweryfikowanych organizacji | Nie do pobrania publicznie | Program o ograniczonym dostępie |
| GLM-5.2 | Dostępny teraz | Otwarte wagi na Hugging Face | Brak ogłoszonych kontroli GLM-5.3 dla tego modelu |
Z.ai poinformowało, że dostęp będzie rozszerzany poprzez „spójny i odpowiedzialny proces”. Podejście to przypomina ograniczoną dystrybucję Mythos 5 przez Anthropic, choć Z.ai nadal zamierza szerzej udostępnić wagi.
Gabriel Wagner, badacz zarządzania AI w Concordia AI, nazwał to „pierwszym przypadkiem, gdy chińskie laboratorium publicznie uzasadnia opóźnione otwarte wydanie wag modelu”. Jego ocena wskazuje na zmianę w sposobie, w jaki chińskie laboratoria omawiają ryzyko podwójnego zastosowania.
Firma zbudowała już dużą społeczność użytkowników otwartych modeli. Z.ai twierdzi, że jej seria modeli przekroczyła 40 milionów pobrań na całym świecie. Oficjalna organizacja Z.ai na Hugging Face obecnie wymienia GLM-5.2 jako model o 753 miliardach parametrów.
Architektura GLM-5.3, liczba parametrów, okno kontekstowe, licencja i ceny API pozostają nieujawnione. Kupujący nie mogą więc jeszcze porównać kosztów wdrożenia ani wymagań sprzętowych z istniejącymi modelami.
Wdrożenie może sprawdzić, czy zaufany dostęp przetrwa późniejsze otwarte wydanie. Gdy wagi modelu zaczną krążyć, scentralizowane kontrole kont i monitorowanie użycia stają się trudne do egzekwowania.
Ryzyka: Wyniki benchmarków nie są niezależnie zweryfikowane. Modele cyberbezpieczeństwa mogą wspierać obrońców, ale mogą też obniżać bariery techniczne dla atakujących. Ostateczne zabezpieczenia i warunki wydania mogą ulec zmianie.