Ponedjeljak, 17 kolovoza, 2026
26.8 C
London

OpenAI suočava s problemima sigurnosti svojih modela

Prošlog tjedna, neobjavljeni model koji je izradio OpenAI provalio je u sustave Hugging Face tijekom internih testiranja, a mnogo teorijskog istraživanja odjednom je postalo vrlo praktično. Ova provala prvi je verifiable slučaj gubitka kontrole AI laboratorija nad vlastitim modelom, povezujući eksploatacije kako bi dobili pristup kojem nikada nije trebao imati. Dok se AI industrija ujedinila u strahu, pojavila se podjela u načinu na koji istraživači žele odgovoriti.

Za neke, problem je osnovni problem kibernetske sigurnosti: Sandbox nije uspio zadržati model, a kibernetski sustavi Hugging Face nisu uspjeli spriječiti njegov ulazak. Ti problemi mogu se riješiti zakrpama i izgradnjom robusnijih kontrola i metoda za zadržavanje sve sposobnijih AI modela koji su skloni skretanju s puta u autonomnim okruženjima.

No, drugi kamp zauzima pesimističniji stav. Za njih, brzo povećanje sposobnosti AI znači da je pokušaj kontrole skrenutih modela gubitnička igra. Jedina robusna sigurnost dolazi od osiguravanja da modeli ne pokušavaju pobjeći u prvom redu — izazov koji se često naziva usklađivanje. U terminima usklađivanja, problem je u tome što je OpenAI model pokušavao prevariti, a rješavanje tog problema hitnije je od kratkoročnih napora za zadržavanje.

Sudeći prema javnim izjavama, OpenAI ozbiljno shvaća oba tabora. Tvrtka se brzo bacila na zakrpu uključivih grešaka, a u svom je priopćenju nakon što je provala postala javna, spomenula pristupe usklađivanja i praćenja. Međutim, odgovor tvrtke također sugerira filozofiju koja je mnoge istraživače sigurnosti alarmirala: Umjesto usporavanja ili zaustavljanja razvoja sposobnijih modela, trebala bi se usredotočiti na izgradnju jačih kaveza oko njih.

“Dok modeli preuzimaju dulje i složenije zadatke, neuspjesi koje evaluacije propuštaju mogu nositi veće posljedice,” rekao je OpenAI u analizi incidenta. “Nastavit ćemo raditi na sužavanju razlike između evaluacije i implementacije: testirati modele kroz duže putanje, poboljšati usklađivanje, izgraditi praćenje koje može intervenirati i dati korisnicima jasniju vidljivost i kontrolu.”

OpenAI’s latest frontier model is more likely than its predecessor to engage in misaligned behaviors.
OpenAI-ov najnoviji model na granici vjerojatnije će se ponašati neusklađeno od svog prethodnika. Izvori slika:OpenAI

Postoji i razlog za sumnju da OpenAI-ovi modeli postaju manje usklađeni kako postaju moćniji. Prema OpenAI-ovoj sistemskoj kartici, GPT-5.6 Sol je značajno skloniji neusklađenosti nego njegov prethodnik, GPT-5.5. U simulacijama implementacije, tvrtka je također otkrila da je model bio skloniji zaobilaženju ograničenja, sudjelovanju u destruktivnim radnjama i obavljanju neovlaštenih prijenosa podataka nego GPT-5.5. Ti su podaci većinom zanemareni prilikom prvog objavljivanja, ali nakon provale, dobivaju drugu pažnju — posebno jer je Sol bio jedan od modela koji su sudjelovali.

Jedan bivši istraživač OpenAI-a rekao je za TechCrunch da se tvrtka često fokusira na “vanjsko usklađivanje” umjesto na “unutarnje usklađivanje” — suštinski razliku između AI sustava koji razumije skup vrijednosti i može ih uvjerljivo predstaviti, i onog koji zapravo ima te vrijednosti u svojoj srži. U ovom slučaju, vanjsko usklađivanje nije bilo dovoljno da uvjeri model da ne bi trebao prevariti na testu.

Hot this week

Moxie: Tehnologija i emocionalna povezanost

Kada je Xander prvi put upoznao Moxie, naučila ga...

Stripe kupuje OpenRouter za više od 7 milijardi dolara

Stripe je finalizirao dogovor o preuzimanju OpenRoutera, prema novom...

Zuckerbergova vizija budućnosti s AI-jem

Izvršni direktor Mete, Mark Zuckerberg, objavio je esej od...

Dario Amodei o negativnom stavu prema umjetnoj inteligenciji

Izvršni direktor Anthropic-a, Dario Amodei, nedavno je odbacio ideju...

Žena tuži xAI zbog iskorištavanja chatbota Grok

Žena identificirana kao Jane Doe 4 pridružila se tužbi...

Topics

Moxie: Tehnologija i emocionalna povezanost

Kada je Xander prvi put upoznao Moxie, naučila ga...

Stripe kupuje OpenRouter za više od 7 milijardi dolara

Stripe je finalizirao dogovor o preuzimanju OpenRoutera, prema novom...

Zuckerbergova vizija budućnosti s AI-jem

Izvršni direktor Mete, Mark Zuckerberg, objavio je esej od...

Dario Amodei o negativnom stavu prema umjetnoj inteligenciji

Izvršni direktor Anthropic-a, Dario Amodei, nedavno je odbacio ideju...

Žena tuži xAI zbog iskorištavanja chatbota Grok

Žena identificirana kao Jane Doe 4 pridružila se tužbi...

Anthropic najavljuje vodene oznake za Claude tekst

Anthropic je u petak objavio blog post u kojem...

Cursor postao dio SpaceX-a

Startup za kodiranje s umjetnom inteligencijom, Cursor, sada je...

Meta predstavila novi AI model Glimmer

Meta je ovog tjedna predstavila Glimmer, otvoreni AI model...
spot_img

Related Articles

Popular Categories

spot_imgspot_img