Dok se donosioci odluka raspravljaju o tome kako upravljati sve moćnijim sustavima umjetne inteligencije poput OpenAI-ovog GPT-5.6 Sol i Anthropicovog Mythos, kineski model otvorenih težina, GLM-5.2, smanjuje razliku s liderima industrije.
GLM-5.2, otvoreni model umjetne inteligencije iz kineske Z.ai, zaostaje samo nekoliko mjeseci za OpenAI-ovim GPT-5.5 i Anthropicovim Claude Opus 4.7 u cyber i biološkim sposobnostima, prema novom izvještaju neprofitne organizacije SaferAI. Međutim, razlika između naprednih sposobnosti i praksi sigurnosti se povećava.
Prema SaferAI-ovoj evaluaciji, koju je neprofitna organizacija provela putem javnog API-ja Z.ai, GLM-5.2 nije odbio nijedan od zadaća vezanih za ofenzivne cyber ili dvostruke biološke svrhe. U usporedbi s tim, Claude Opus 4.7 “tako je dosljedno odbijao da SaferAI nije mogao završiti CyberGym na njemu.” (CyberGym je benchmark koji ocjenjuje sposobnosti u cyber sigurnosti.)
To je oštar podsjetnik na ono što su neki kritičari godinama upozoravali: modeli otvorenih težina mogli bi staviti visoko sposobne AI u ruke potencijalnih napadača, bez načina da se kontrolira kako koriste tehnologiju nakon preuzimanja težina. Kako modeli otvorenih težina brzo približavaju sposobnost vodećih AI sustava na svijetu, rasprava se premješta s pitanja mogu li konkurirati na to kako društvo upravlja rizicima nakon što su objavljeni.
“Granica sposobnosti nije granica rizika, stoga moramo uzeti u obzir i stanje smanjenja rizika kako bismo ispravno procijenili rizik,” rekao je Henry Papadatos, izvršni direktor SaferAI, za TechCrunch.
Dok Z.ai može primijeniti mjere sigurnosti na svom hostiranom API-ju, te zaštite postaju neprovedive čim netko pokrene težine na vlastitom hardveru, gdje mogu ukloniti ili izmijeniti bilo kakve zaštitne mjere, fino podesiti modele ili promijeniti upute sustava.
Razvojni timovi poput OpenAI-a i Anthropic-a obično se oslanjaju na zaštitne mjere kao što su klasifikatori, obuka odbijanja i kontrole na razini API-ja kako bi ograničili opasnu cyber i biološku pomoć.
Te mjere nisu bezgrešne: jailbreakovi redovito zaobilaze zaštite na implementiranim modelima. Far.ai, neprofitna organizacija za sigurnost AI, pronašla je stotine univerzalnih jailbreakova — definiranih kao ponovno upotrebljivi ključevi koji uspijevaju na većini štetnih zahtjeva — u naprednim modelima poput xAI-ovog Grok 4.5 i Google DeepMind-ovog Gemini 3.1 Pro. Prema izvještaju, jailbreakovi uspijevaju kada napadači kombiniraju više tehnika manipulacije — uključujući igranje uloga, impersonaciju autoriteta, lažne povijesti razgovora i naknadne upute — kako bi pojačali slabe točke u obrani modela.
Međutim, zaštitne mjere koje postoje za zatvorene modele uopće ne djeluju na modele otvorenih težina, koji su dizajnirani da rade na bilo kojoj infrastrukturi s bilo kojim skupom zaštita — ili bez njih.



