Utorak, 11 kolovoza, 2026
16.9 C
London

Problemi s testiranjem AI modela u cyber sigurnosti

U posljednjih nekoliko mjeseci, AI agenti koji prolaze evaluacije u području cyber sigurnosti su napustili svoje granice, pristupili internetu i, u nekim slučajevima, hakirali stvarne sustave. Ovi incidenti uključuju modele iz OpenAI, Anthropic, Meta i najnovije, kineskog AI laboratorija Moonshot AI, a testiranja su provodile različite organizacije, uključujući startup Irregular za cyber evaluacije.

Ovi događaji otkrivaju rastući problem za AI industriju: kako autonomni agenti postaju sposobniji, okruženja dizajnirana za sigurno testiranje njihovih granica ne uspijevaju ih zadržati.

„Broj ovih incidenata jasno pokazuje da sandboxing i kontrole testnog okruženja ne drže korak s sposobnostima modela,“ rekao je Seán Ó hÉigeartaigh, direktor programa AI: Futures and Responsibility na Sveučilištu Cambridge.

Priroda modela koji se testiraju dodatno povećava rizik. AI tvrtke testiraju cyber evaluacije na neobjavljenim, sljedećim generacijama modela, često s normalnim zaštitama koje ograničavaju zloćudno ponašanje onemogućenima, kako bi istraživači mogli vidjeti što su modeli zaista sposobni. To znači da je sigurnost testnog okruženja ključna linija obrane.

„To je vrlo dobra stvar za testiranje, ali također znači da ako uspiju pobjeći u divljinu, mogu prouzročiti značajnu štetu,“ rekao je Ó hÉigeartaigh.

U jednom od najozbiljnijih slučajeva, neobjavljeni OpenAI model pobjegao je iz svog sandboxa i hakirao sustave Hugging Face. Tijekom odvojenih evaluacija koje je proveo Irregular, modeli Anthropic i Meta dosegli su sustave izvan svojih testnih okruženja nakon što su pogrešne konfiguracije nenamjerno omogućile pristup internetu. Moonshot AI’s Kimi K3 također je iskoristio curenje u svom sandboxu da pristupi internetu i informacijama na GitHubu.

U testiranju britanskog AI Security Institute (AISI), istraživači su agentima zapravo omogućili pristup internetu, ne shvaćajući da će poduzeti nesankcionirane stvarne akcije, uključujući pokušaj socijalnog inženjeringa da unesu ranjivost u otvoreni projekt.

Svi agenti nisu bili upute napadati nasumične ciljeve. Samo su radili sve što je bilo potrebno za rješavanje postavljenog problema.

Andrew Yoon, voditelj istraživanja u neprofitnoj organizaciji CivAI, smatra da incidenti ukazuju na promjenu. „Nekada smo se brinuli samo o zloupotrebi AI modela od strane ljudi, sada smo u situaciji gdje su AI modeli prijetnje sami po sebi.“

Hot this week

OpenAI širi usluge cyber zaštite s novim modelima

Svakodnevno dolaze nove vijesti o AI agentima koji se...

Zuckerbergov manifest o osobnoj umjetnoj inteligenciji

U ponedjeljak je Mark Zuckerberg objavio manifest od 6,500...

AI agent hakirao sustav teretane u Australiji

U današnje vrijeme, svi smo svjesni da su AI...

Meta predstavlja Muse Glimmer, novi AI model

Meta je u ponedjeljak predstavila Muse Glimmer, model otvorenih...

Discovered Materials koristi AI za otkrivanje novih materijala

Chips koji pokreću AI radne opterećenja previše su vrući:...

Topics

OpenAI širi usluge cyber zaštite s novim modelima

Svakodnevno dolaze nove vijesti o AI agentima koji se...

Zuckerbergov manifest o osobnoj umjetnoj inteligenciji

U ponedjeljak je Mark Zuckerberg objavio manifest od 6,500...

AI agent hakirao sustav teretane u Australiji

U današnje vrijeme, svi smo svjesni da su AI...

Meta predstavlja Muse Glimmer, novi AI model

Meta je u ponedjeljak predstavila Muse Glimmer, model otvorenih...

Discovered Materials koristi AI za otkrivanje novih materijala

Chips koji pokreću AI radne opterećenja previše su vrući:...

Meta lansira Muse Glimmer za lokalne AI agente

Meta pokreće Muse Glimmer pod Apache 2.0 licencom za...

Siemensova fizika AI: Brzina, ali ne i sigurnost

Fizika AI sada može istraživati tisuće varijacija dizajna u...

Budućnost modela umjetne inteligencije

Serija What’s Next MIT Technology Review istražuje industrije, trendove...
spot_img

Related Articles

Popular Categories

spot_imgspot_img