Hugging Face je u ponedjeljak objavio tehnički vremenski okvir koji detaljno opisuje kako je autonomni AI agent, temeljen na OpenAI modelima, uspio provaliti u njihove sustave tijekom više od četiri dana ranije ovog mjeseca. Ovo je prvi sigurnosni incident o kojem je CEO OpenAI, Sam Altman, rekao da se “osjećao vrlo visceralno.”
Nije iznenađujuće s obzirom na to da se čini da je ovdje nešto doista oslobođeno. Tim Hugging Facea je u uvodu svog izvještaja naglasio da “svi trebaju biti spremni kao branitelji”, prije nego što su se posvetili detaljima koji su od koristi profesionalcima za sigurnost.
Dok ostatak interneta pokušava shvatiti što se dogodilo (žargon u izvještaju Hugging Facea je nemoguć za većinu ljudi), mnogi promatrači propuštaju jednu važnu točku: ovo nije bio neposlušni agent koji ne izvršava naredbe. Bio je to sustav izgrađen za pronalaženje ranjivosti, koji je radio upravo to, ali protiv krivog cilja.
Jedan način za razmišljanje o svemu tome je zamisliti medvjeda u kampu. Medvjed pokušava otvoriti zatvarače šatora, ručke automobila, hladnjake i kante za smeće. To radi u svakom kampu, cijelu noć, jer zna da mu je potrebna samo jedna otključana hladnjaka kako bi napunio trbuh s namirnicama nesretnog posjetitelja.
Otprilike to se dogodilo i s Hugging Face. OpenAI sustav je isprobao tisuće stvari i samo je nastavio. Na kraju je nekoliko tih pokušaja uspjelo, a kada su uspjeli, agent je nastavio s upornom determinacijom koja je, da, inhumana. Prema Hugging Faceu, agent je izveo 17,600 akcija tijekom četiri i pol dana bez pauze.
Što nas vraća na našu analogiju s medvjedom. Baš kao što jedan uspjeh s hladnjakom punom hrane poučava medvjeda da sljedeći put pokuša još jače (sada je “hrana uvjetovan” medvjed), jedan provaljeni lozinka je navela OpenAI agenta da traži više ranjivosti i, na kraju, do jednog ključa koji je otključao nekoliko sustava kompanije odjednom.
Niti jedan scenarij nije bezopasan. Medvjed koji napada vašu hladnjaku i dalje jede vašu hranu i vjerojatno uništava vaš kamp. Samo je fokusiran na prehranu, ali ipak ostavlja trag uništenja. Slično tome, OpenAI agent je očito slijedio cilj bez obzira na sve ostalo. Agent je prvotno polagao ispit iz kibernetičke sigurnosti, shvatio da ključ odgovora na ispit vjerojatno leži na serverima Hugging Facea i krenuo prema tome.
Ustrajnost ovdje je ono što je zaista značajno; agent je imao zadatak i nije se namjeravao zaustaviti dok ga nije izvršio. Hugging Face je, konačno shvativši da nešto nije u redu, prekinuo njegov pristup i zatvorio provalu, ali tada je već bilo prekasno. Agent je već dobio ono što je tražio, i još mnogo više.



