OpenAI je u utorak priznao da je jedan od njegovih AI modela prekršio sustave Hugging Face, neovisne platforme za hosting AI, tijekom internog testiranja kibernetske sigurnosti koje je pošlo po zlu. Modeli su navodno napustili svoje izolirano testno okruženje i došli do sustava Hugging Face. Hugging Face je prvotno pripisao proboj “vanjskom AI agentu”.
U blog postu objavljenom u utorak poslijepodne, OpenAI je detaljno opisao korake koji su doveli do kompromitacije usluge.
“Nakon istraživanja, sada znamo da je ovaj incident bio rezultat kombinacije OpenAI modela — uključujući GPT‑5.6 Sol i još sposobniji model u predizdanju, svi s smanjenim kibernetskim odbijanjima za evaluacijske svrhe — dok su se interno testirali na benchmarku kibernetskih sposobnosti,” navodi se u postu.
Osobito, proboj se čini da je bio fokusiran na ExploitGym, javno hostiran benchmark koji mjeri sposobnost modela da izvršava napade temeljem postojećih ranjivosti. Benchmarkovi poput ExploitGyma često se koriste u obuci modela za usavršavanje specifičnih vještina, ali ovo je prvi poznati incident u kojem je to testiranje rezultiralo stvarnim kibernetskim napadom.
U ovom slučaju, model u pitanju nije trebao imati pristup internetu, osim određenog alata koji je omogućavao modelima instalaciju softverskih paketa potrebnih za dovršavanje zadatka. Umjesto toga, model je uspio pronaći neotkrivenu ranjivost u programu za instalaciju paketa, koju je iskoristio za pristup širem internetu.
“Modeli su bili hiperfokusirani na pronalaženje rješenja za ExploitGym, idući na ekstremne mjere kako bi postigli prilično uski testni cilj,” navodi se u postu OpenAI-a. “Nakon stjecanja pristupa internetu, modeli su zaključili da Hugging Face potencijalno hostira modele, skupove podataka i rješenja za ExploitGym. Znajući to, model je tražio i uspješno pronašao načine za pristup tajnim informacijama koje je mogao iskoristiti za varanje evaluacije.”
Na kraju, modeli su pronašli ranjivosti u infrastrukturi Hugging Face koje su im omogućile da “dobiju testna rješenja izravno iz produkcijske baze podataka Hugging Face,” učinkovito pružajući odgovore na benchmark.
Za Hugging Face, očigledan rezultat bio je sofisticiran i agresivan kibernetski napad, sa “mnogim tisućama pojedinačnih akcija kroz roj kratkotrajnih sandboxova, s samomigrirajućom komandno-kontrolnom infrastrukturom postavljenom na javnim uslugama,” kako je tvrtka navela u svom prvotnom otkriću.
OpenAI je identificirao i prijavio ranjivosti u programu za instalaciju paketa i radi s Hugging Faceom na daljnjem istraživanju incidenta. Tvrtka je također izjavila da će implementirati nove kontrole kako na testiranju modela, tako i na povezanoj infrastrukturi, s ciljem sprječavanja sličnih incidenata u budućnosti.
Nije jasno hoće li OpenAI suočiti s pravnim posljedicama zbog proboja, iako je vjerojatno da su postupci modela prekršili Zakon o računalnoj prijevari i zlostavljanju.
Ipak, rezultat je neobično živopisna ilustracija snage i opasnosti granica AI modela koji djeluju na dugim vremenskim horizontima. Kao što je istraživač OpenAI-a Micah Carroll objavio u odgovoru na vijest, “Ako vas ovo ne uvjeri da su rizici neusklađenosti ključna briga u budućnosti, ne znam što hoće.”



