Četvrtak, 13 kolovoza, 2026
26.1 C
London

Incident s Hugging Face: Kako AI može varati

MIT Technology Review objašnjava: Neka naši autori razjasne složen i neuredan svijet tehnologije kako biste razumjeli što dolazi. Možete pročitati više iz serije ovdje.

Kada su dva OpenAI modela hakirala web stranicu Hugging Face u srpnju, nisu pokušavali zaraditi novac ili počiniti sabotažu – samo su tražili odgovore na testno pitanje. Prema postmortem analizi OpenAI, modeli, koji su bili lišeni svojih tipičnih sigurnosnih značajki radi testiranja, odlučili su riješiti cyber sigurnosnu vježbu hakirajući iz izoliranog okruženja u kojem su pokušali biti zadržani i u baze podataka Hugging Face, gdje su – pretpostavili su – mogli pronaći točan odgovor na problem.

Incident s Hugging Face privukao je intenzivnu pažnju posljednjih nekoliko tjedana. To je dramatična ilustracija koliko su AI modeli postali dobri u hakiranju: Da bi se ušlo u baze podataka Hugging Face, modeli su morali spojiti nekoliko prethodno neotkrivenih cyber sigurnosnih eksploatacija. No, možda je još upečatljivije kao primjer kako i zašto AI sustavi lažu i varaju. Kako modeli postaju sve moćniji, posljedice bi mogle postati mnogo ozbiljnije.

Što je varanje nagradama? Istraživači su već neko vrijeme znali da AI sustavi tendiraju uzimati kreativne pristupe u ostvarivanju ciljeva koji su im postavljeni. Godine 2016. suosnivači Anthropic-a Dario Amodei i Jack Clark, koji su tada radili u OpenAI, objavili su blog post o AI agentu kojeg su obučavali da igra igru s utrkama čamaca pod nazivom Coast Runners. Umjesto da vozi kroz utrku do cilja, kako su istraživači očekivali, agent je pronašao kutak staze gdje se mogao vrtjeti skupljajući pojačanja, čime je maksimizirao svoj rezultat. Priča o Coast Runners brzo je postala jedan od najpoznatijih primjera varanja nagradama, fenomena u kojem AI agenti izvršavaju zadatke ili zarađuju visoke rezultate koristeći nepredviđene strategije.

Povijesno gledano, istraživači su raspravljali o varanju nagradama gotovo isključivo u kontekstu učenja s pojačanjem, uobičajenog režima obuke AI. Kao što je obuka pasa, učenje s pojačanjem uključuje davanje nagrade kada subjekt postigne cilj; nagrade potom pojačavaju ponašanja koja su dovela do tog postignuća. U slučaju obuke AI, nagrade su same po sebi matematičke, ali u suštini su iste kao pasja poslastica: Nakon primanja nagrade, agent je sklon ponoviti bilo koje radnje koje su to omogućile.

Kako varanje nagradama djeluje za LLM-ove? S današnjim sofisticiranim agentima temeljenim na LLM-u, određivanje kada dati nagradu može biti mnogo složenije. Ako se AI sustavu postavi zadatak rješavanja programerskog problema, može se potruditi pronaći rješenje – ponašanje koje AI tvrtke žele pojačati. No, također bi moglo prilagoditi kod koji procjenjuje je li problem riješen, potražiti rješenje na internetu ili na drugi način varati. To su ponašanja koja AI tvrtke žele eliminirati iz svojih modela, ali ako model dovoljno uvjerljivo vara, umjesto toga će biti nagrađen, a ponašanje će se pojačati.

Hot this week

OpenAI predstavlja Ultrafast način za ChatGPT

UkratkoObjavljeno:12:22 PM PDT · 13. kolovoza 2026.Ako ste ikada...

IBM i OpenAI udružuju snage za AI rješenja

IBM je u četvrtak najavio partnerstvo s OpenAI-om kako...

AI agenti u sukobu: novi izazovi sigurnosti

Što se događa kada se AI agenti suoče jedni...

Microsoft spaja svoje Copilot aplikacije

Prije dvije godine, Microsoft je opisao AI kao "generacijski...

Nvidia ulaže u AI centre s 500 milijardi dolara

Nvidia objavila je ovog tjedna da su Apollo, BlackRock,...

Topics

OpenAI predstavlja Ultrafast način za ChatGPT

UkratkoObjavljeno:12:22 PM PDT · 13. kolovoza 2026.Ako ste ikada...

IBM i OpenAI udružuju snage za AI rješenja

IBM je u četvrtak najavio partnerstvo s OpenAI-om kako...

AI agenti u sukobu: novi izazovi sigurnosti

Što se događa kada se AI agenti suoče jedni...

Microsoft spaja svoje Copilot aplikacije

Prije dvije godine, Microsoft je opisao AI kao "generacijski...

Nvidia ulaže u AI centre s 500 milijardi dolara

Nvidia objavila je ovog tjedna da su Apollo, BlackRock,...

Apple pregovara s izdavačima o korištenju sadržaja za Siri

Prema novom izvještaju The Wall Street Journal, Apple je...

Okta smanjuje troškove AI agenta s novim alatom

Okta tvrdi da alati Model Context Protocol (MCP) mogu...

Mladi o umjetnoj inteligenciji: Strahovi i očekivanja

Kada smo razgovarali s djecom o umjetnoj inteligenciji, očekivali...
spot_img

Related Articles

Popular Categories

spot_imgspot_img