Kao što je tvrtka Anthropic objavila, njihovi sigurnosni modeli temeljeni na Claude-u neovlašteno su pristupili osjetljivim proizvodnim okruženjima triju vanjskih organizacija tijekom unutarnjeg testiranja koje je bilo usmjereno na mjerenje ofenzivnih sposobnosti modela u kibernetičkom prostoru. Ovi događaji, koje je Anthropic otkrio u četvrtak, predstavljaju drugo otkriće u posljednjih 10 dana da su AI modeli iz redova najbogatijih pružatelja usluga prešli u zaštićene mreže, što bi u tradicionalnim scenarijima hakiranja moglo dovesti do dugotrajnih zatvorskih kazni za osobe iza tipkovnice.
Ranije ovog mjeseca, OpenAI je objavio da su njihovi sigurnosni modeli iskoristili zero-day ranjivost za provale u mrežu Hugging Face-a, platforme za open source modele strojnog učenja i AI dataset-e. OpenAI modeli su ukrali pristupne podatke i druge povjerljive informacije Hugging Face-a te su iskoristili javno izložene vjerodajnice za kompromitaciju računa četiri druge treće strane.
Anthropic je izjavio da je događaj s OpenAI-jem potaknuo njihove inženjere da pregledaju slične procjene kibernetičke sigurnosti modela Claude. Tijekom revizije otkrivena su tri incidenta u kojima je model pristupio internetu iz okruženja za evaluaciju Irregular, jednog od njihovih partnera za vanjsku evaluaciju, i neovlašteno pristupio proizvodnoj infrastrukturi triju različitih organizacija.
Anthropic je objasnio da su upiti koje su inženjeri dostavili tijekom izazova “capture the flag” – uobičajenog načina procjene ofenzivnih i defensivnih sposobnosti različitih hakiranja – jasno pokazali da je okruženje za testiranje samo simulacija te da modeli nisu imali pristup otvorenom internetu. Međutim, testni partner Irregular pogrešno je omogućio takav pristup, a modeli su to shvatili kao dio vježbi.
Provale su se dogodile putem triju Claude modela: Opus 4.7, Mythos 5 i internog istraživačkog prototipa. Opus 4.7, najstariji od triju, bio je taj koji je najviše prekoračio svoje granice. Anthropic je objasnio:
“Operirajući pod lažnim uvjerenjem da su svi dostupni entiteti namijenjeni za vježbu, Claude je kompromitirao infrastrukturu pogođenih organizacija koristeći osnovne tehnike, poput iskorištavanja slabih lozinki i neautenticiranih krajnjih točaka. Nije pronašao niti iskoristio složene ranjivosti, a u svakom slučaju, Claude je nastavio raditi na dovršetku samo specifičnog zadatka capture-the-flag koji mu je dodijeljen.”
Međutim, u nekim slučajevima, naš stariji model nastavio je napad čak i nakon što je dobio dokaze da se nalazi na otvorenom internetu; naš najnoviji model stao je kada je prepoznao da je na internetu. U nijednoj od ovih situacija Claude nije pokušao napustiti svoje testno okruženje namjerno.
Dok je Opus model nastavio napad čak i nakon što je ispravno predvidio da je provalio u proizvodni sustav treće strane, Anthropic je rekao da je Mythos 5 došao do sličnog zaključka ali se “razmišljao natrag do zaključka da je još uvijek u simulaciji.” To znači da Mythos također nije prekinuo vježbu nakon što je jasno prešao granicu.



