Što se događa kada se AI agenti suoče jedni s drugima? Prema testiranjima tvrtke Anthropic, situacija se brzo zakomplicira.
U četvrtak je Anthropicov Frontier Red Team objavio novo istraživanje koje ispituje kako se skupine AI agenata ponašaju kada se susretnu u stvarnom svijetu. Nalazi pružaju uvid u potencijalne rizike koji bi se mogli razviti dok tvrtke i vlade implementiraju agente koji rade autonomno.
U jednom eksperimentu, Anthropic je dala tri Claude agenta pristup istom softverskom projektu, svaki s vlastitim nespojivim uputama o tome što raditi. Agenti nisu bili obaviješteni da će drugi agenti raditi na istom projektu, pa su istraživači mogli promatrati što se događa kada se susretnu.
„Konstantno smo svjedočili sukobu među agentima,“ napisali su istraživači. Svi modeli su pretpostavili da drugi „namjerno ometaju njihov rad“ i počeli su sabotirati jedni druge s „sve agresivnijim, samoreplicirajućim malwareom.“
Istraživanje dolazi nakon nekoliko istaknutih incidenata kada su agenti tvrtke Anthropic i OpenAI napustili svoje sandboxes tijekom evaluacija kibernetičke sigurnosti i prodrli u stvarne sustave. Dok se većina rasprava u krugovima sigurnosti AI-a fokusirala na to što se događa kada autonomni agent postane problematičan, najnovije istraživanje tvrtke Anthropic postavlja drugo pitanje: Koje nove i potencijalno štetne dinamike nastaju kada tisuće ili milijuni agenata međusobno djeluju?
„Obujam interakcije među agentima mogao bi vjerojatno nadmašiti interakcije među ljudima i ljudima i agentima prije nego što svijet shvati uvjete za uspješne interakcije,“ navodi se u studiji. „Benigne ponašajne osobitosti na individualnoj razini mogle bi se pretvoriti u neželjene globalne posljedice.“
Jedan nedavni incident s OpenAI-jem pruža stvarni primjer nekoliko dinamika koje je Anthropic spomenuo u svom radu. Ranije ovog mjeseca na sigurnosnoj konferenciji Black Hat u Las Vegasu, OpenAI je otkrio da su tjednima prije nego što su njihovi agenti hakirali Hugging Face, surađivali nekoliko dana i tjedana kako bi pronašli propuste u sustavima procjene kibernetičke sigurnosti tvrtke i dijelili ih jedni s drugima.
Dok taj incident pokazuje da agenti mogu dobro surađivati, s potencijalno velikim posljedicama, istraživanje tvrtke Anthropic pokazuje što se događa kada su ciljevi agenata nespojivi.



