Objava Zhipu za GLM-5.3 sadrži rečenicu koja je izostavljena iz većine izvještaja. Opisujući vlastite rezultate u cyber sigurnosti, bežingška tvrtka navodi da “sposobnost raste najbrže upravo tamo gdje smo najdalje iza”.
Zhipu, koji također posluje pod imenom Z.ai, jedna je od rijetkih kineskih laboratorija koja objavljuje modele koji se natječu s američkom tehnologijom. 14. kolovoza lansirali su GLM-5.3, model usmjeren na kodiranje, i objavili tehničku napomenu o tome kako model uspoređuje s konkurencijom. Ta napomena je izvor svih ovdje prikazanih izvještaja.
Izjava koja je privukla pažnju odnosila se na sigurnost. Uz rezultate kodiranja, Zhipu je naveo da je GLM-5.3 neočekivano dobar u pronalaženju softverskih ranjivosti, ostvarujući 84.5% na mjerilu zvanom CyberGym, u usporedbi s 83.8% za Anthropicov Mythos 5 i 83.6% za OpenAI-ov GPT-5.6 Sol. Naslovi su se pojavili s informacijom da sada kineski model bolje pronalazi greške od američkih.
Razlog zašto ova informacija ima veći utjecaj od uobičajenih rezultata mjerila je u tome što je otkrivanje ranjivosti postalo ključno. Model koji može čitati kod i locirati iskorištive greške koristan je za obrambene stručnjake koji audituju vlastiti softver, kao i za svakoga tko radi to isto na tuđem kodu. Anthropicov ekvivalentni rad je zaštićen, dok Zhipu planira objaviti težine GLM-5.3 dostupne za preuzimanje.
Zhipuova vlastita objava je opreznija od izdanih izvještaja. Broj na CyberGym-u je stvaran i dokumentiran. Također je to najuži od tri objavljena rezultata u cyber sigurnosti, a Zhipu jasno naglašava da su druga dva rezultata lošija.
Tri mjerila, tri različite slike
CyberGym počinje od izvornog koda koji model može pročitati i testira može li pronaći ranjivost i potvrditi da je greška autentična. To je rezultat koji je privukao pažnju, a razlika iznosi sedam desetina postotnog boda.
ExploitBench postavlja teži zadatak, zahtijevajući od modela da razmišlja o stvarnoj ranjivosti i kako bi se ona mogla iskoristiti. GLM-5.3 ostvaruje 54.4%, više nego dvostruko od prethodnika s 24.4%. Mythos 5 ostvaruje 78.0%, a GPT-5.6 Sol 76.5%.
ExploitGym broji koliko zadataka iskorištavanja model može završiti unutar fiksnog vremenskog okvira. GLM-5.3 završava 105 zadataka u dva sata i 130 u šest. Mythos 5 završava 181 i 247.
Ova dva rezultata su manje zastupljena, a ona opisuju razliku. Pronalaženje greške i izrada funkcionalnog iskorištavanja su različiti zadaci. Zhipu smatra da što je test dalje duž tog lanca, to je model dalje iza, što tvrtka izjavljuje u objavi umjesto da ostavlja da se to otkrije.



