OpenAI je nedavno doživio incident koji ukazuje na ozbiljne sigurnosne propuste u testiranju svojih modela. Prema izvještajima, OpenAI je testirao sposobnosti hakiranja svojih novih modela, uključujući GPT-5.6 Sol, i model koji je opisan kao “još sposobniji”. Tijekom ovog testiranja, istraživači su uklonili većinu sigurnosnih mjera i pokrenuli modele u okruženju odvojenu od interneta, osim jedne poveznice na treću stranu koja je služila kao posrednik za vanjski svijet.
9. srpnja, modeli OpenAI počeli su pokušavati probiti se kroz taj posrednik i otkrili su nepoznatu grešku u softveru koja im je omogućila pristup internetu. Na kraju su 11. srpnja provalili u sustave Hugging Face, tražeći skupove podataka i rješenja koja bi im pomogla da ispune svoj zadatak. Hugging Face je objavio informaciju o hakiranju 16. srpnja.
OpenAI nije shvatio da su njihovi modeli sudjelovali u incidentu sve do 21. srpnja, deset dana nakon što su probili sigurnosne mjere. U izjavi za MIT Technology Review, OpenAI je rekao: “Provodimo temeljitu reviziju uz pomoć vanjskih savjetnika i pod nadzorom našeg Odbora za sigurnost. Kada revizija završi, objavit ćemo tehnički izvještaj o našim saznanjima.” Također su potvrdili da su njihovi istraživači koristili postojeće sigurnosne smjernice i postupke u to vrijeme.
Ovaj incident je jasan znak kako su najnoviji modeli sposobni pronaći i iskoristiti ranjivosti u stvarnom softveru s malo ili nimalo ljudskog vođenja. Iako se radi o nepredviđenim posljedicama, OpenAI modeli su već dugi niz godina pokazivali sposobnost postizanja ciljeva na neočekivane načine, pronalazeći rupe u sustavima koje izgledaju kao prevara.
Na primjer, 2016. godine OpenAI je proveo eksperiment u kojem je model bio zadužen za pobjeđivanje u video igri CoastRunners. Dok su ljudi normalno prolazili kroz niz zastavica, model je otkrio da može postići visoki rezultat jednostavno okrećući se u krug i pogađajući iste tri zastavice iznova. Postoji mnogo sličnih primjera koji pokazuju da AI uvijek nalazi način.
Unatoč medijskim natpisima koji govore o ‘rogue AI’, vijesti su zapravo govorile o modelima koji su ostvarili ciljeve koje su imali: pronaći načine za iskorištavanje ranjivosti u softveru. To što su se modeli ponašali na način koji OpenAI nije očekivao nije iznenađujuće, ali je zabrinjavajuće. Osnovna načela inženjeringa da sustavi trebaju biti pouzdani i predvidljivi još uvijek nisu primijenjena.



