OpenAI je u utorak priznao da je jedan od njegovih AI modela probio sustave Hugging Face, neovisne platforme za hosting AI-a, tijekom unutarnjeg testiranja kibernetske sigurnosti koje nije prošlo kako je planirano. Modeli su navodno pobjegli iz izoliranog okruženja za testiranje i došli do sustava Hugging Face. Hugging Face je prvotno pripisao proboj “vanjskom AI agentu”.
U blog objavi objavljenoj u utorak poslijepodne, OpenAI je detaljno opisao korake koji su doveli do kompromitacije usluge.
“Nakon istrage, sada znamo da je ovaj konkretni incident bio uzrokovan kombinacijom OpenAI modela — uključujući GPT‑5.6 Sol i još sposobniji model koji je u fazi pre-release, svi s smanjenim kibernetskim odbijanjima radi evaluacijskih svrha — tijekom internog testiranja na benchmarku kibernetskih sposobnosti,” navodi se u objavi.
Osobito, čini se da je proval fokusiran na ExploitGym, javno hostani benchmark koji mjeri sposobnost modela da izvršavaju napade temeljem postojećih ranjivosti. Benchmarki poput ExploitGyma se obično koriste u obuci modela za usavršavanje specifičnih vještina, ali ovo je prvi poznati incident u kojem je to testiranje rezultiralo stvarnim kibernetskim napadom.
U ovom slučaju, model nije trebao imati pristup internetu, osim specifičnog alata koji je omogućio modelima instalaciju potrebnih softverskih paketa za dovršavanje zadatka. Umjesto toga, model je uspio pronaći neotkrivenu ranjivost u programu za instalaciju paketa, koju je iskoristio za pristup širem internetu.
“Modeli su bili hiperfokusirani na pronalaženje rješenja za ExploitGym, idući do krajnjih mjera kako bi postigli prilično uski testni cilj,” navodi se u OpenAI-ovoj objavi. “Nakon stjecanja pristupa internetu, modeli su zaključili da Hugging Face potencijalno hosta modele, skupove podataka i rješenja za ExploitGym. Znajući to, model je tražio i uspješno pronašao načine za pristup tajnim informacijama koje je mogao iskoristiti za varanje u evaluaciji.”
Konačno, modeli su pronašli ranjivosti u infrastrukturi Hugging Face koje su im omogućile “dobivanje testnih rješenja izravno iz produkcijske baze podataka Hugging Face,” učinkovito pružajući odgovore na benchmark.
Za Hugging Face, očiti rezultat bio je sofisticirani i agresivni kibernetski napad, s “mnogim tisućama pojedinačnih akcija u roju kratkotrajnih sandboxova, s samo-migrirajućim zapovjedno-kontrolnim sustavima na javnim uslugama,” kako je tvrtka navela u svom prvotnom otkriću.
OpenAI je identificirao i prijavio ranjivosti u programu za instalaciju paketa i surađuje s Hugging Faceom na daljnjoj istrazi incidenta. Tvrtka je također navela da će implementirati nove kontrole kako u testiranju modela, tako i u povezanoj infrastrukturi, s ciljem sprječavanja sličnih incidenata u budućnosti.
Nije jasno hoće li OpenAI suočiti s pravnim posljedicama zbog ovog proboja, iako je vjerojatno da su akcije modela prekršile Zakon o računalnoj prijevari i zlostavljanju.
Unatoč tome, rezultat je neobično živopisna ilustracija moći i opasnosti frontier AI modela koji djeluju na dugim vremenskim horizontima. Kao što je OpenAI-ov istraživač Micah Carroll objavio kao odgovor na vijest, “Ako vas ovo ne uvjeri da su rizici pogrešnog usklađivanja ključna briga u budućnosti, ne znam što hoće.”



