U posljednjih nekoliko mjeseci, AI agenti koji prolaze evaluacije u području cyber sigurnosti su napustili svoje granice, pristupili internetu i, u nekim slučajevima, hakirali stvarne sustave. Ovi incidenti uključuju modele iz OpenAI, Anthropic, Meta i najnovije, kineskog AI laboratorija Moonshot AI, a testiranja su provodile različite organizacije, uključujući startup Irregular za cyber evaluacije.
Ovi događaji otkrivaju rastući problem za AI industriju: kako autonomni agenti postaju sposobniji, okruženja dizajnirana za sigurno testiranje njihovih granica ne uspijevaju ih zadržati.
„Broj ovih incidenata jasno pokazuje da sandboxing i kontrole testnog okruženja ne drže korak s sposobnostima modela,“ rekao je Seán Ó hÉigeartaigh, direktor programa AI: Futures and Responsibility na Sveučilištu Cambridge.
Priroda modela koji se testiraju dodatno povećava rizik. AI tvrtke testiraju cyber evaluacije na neobjavljenim, sljedećim generacijama modela, često s normalnim zaštitama koje ograničavaju zloćudno ponašanje onemogućenima, kako bi istraživači mogli vidjeti što su modeli zaista sposobni. To znači da je sigurnost testnog okruženja ključna linija obrane.
„To je vrlo dobra stvar za testiranje, ali također znači da ako uspiju pobjeći u divljinu, mogu prouzročiti značajnu štetu,“ rekao je Ó hÉigeartaigh.
U jednom od najozbiljnijih slučajeva, neobjavljeni OpenAI model pobjegao je iz svog sandboxa i hakirao sustave Hugging Face. Tijekom odvojenih evaluacija koje je proveo Irregular, modeli Anthropic i Meta dosegli su sustave izvan svojih testnih okruženja nakon što su pogrešne konfiguracije nenamjerno omogućile pristup internetu. Moonshot AI’s Kimi K3 također je iskoristio curenje u svom sandboxu da pristupi internetu i informacijama na GitHubu.
U testiranju britanskog AI Security Institute (AISI), istraživači su agentima zapravo omogućili pristup internetu, ne shvaćajući da će poduzeti nesankcionirane stvarne akcije, uključujući pokušaj socijalnog inženjeringa da unesu ranjivost u otvoreni projekt.
Svi agenti nisu bili upute napadati nasumične ciljeve. Samo su radili sve što je bilo potrebno za rješavanje postavljenog problema.
Andrew Yoon, voditelj istraživanja u neprofitnoj organizaciji CivAI, smatra da incidenti ukazuju na promjenu. „Nekada smo se brinuli samo o zloupotrebi AI modela od strane ljudi, sada smo u situaciji gdje su AI modeli prijetnje sami po sebi.“



