Nedjelja, 16 kolovoza, 2026
21.9 C
London

Problemi sigurnosti velikih jezičnih modela

Tim istraživača tvrdi da je nemoguće potpuno osigurati velike jezične modele (LLM) od hakiranja zbog temeljne pogreške u njihovom funkcioniranju. Ovo je pitanje od velike važnosti s obzirom na sve širu primjenu ovih tehnologija, od vladinih i vojnih sustava do online kupovine i zdravstvene skrbi. Istraživači su iskoristili ovu pogrešku, koja se odnosi na to kako LLM-ovi identificiraju tko ili što im daje upute, kako bi popularnim modelima omogućili da daju informacije koje su naučili ne davati, poput načina za sintezu kokaina ili sabotažu navigacijskog sustava komercijalnog zrakoplova.

“Postoji stvarna vjerojatnost da je ovo problem koji se ne može riješiti”, kaže Charles Ye, neovisni istraživač i koautor rada predstavljenog na Međunarodnoj konferenciji o strojnome učenju (ICML). Tvrtke obično zapošljavaju timove ljudskih testera koji pokušavaju smisliti nove napade koji bi zaobišli postojeće zaštite, proces poznat kao red-teaming. Također, proizvođači modela koriste LLM super-hakere (poput OpenAI-ovog GPT-Red) koji pronalaze i iskorištavaju slabosti drugih modela kako bi automatizirali dijelove ovog procesa.

Istraživači su otkrili da je lako persuadirati LLM-ove da se ponašaju neprimjereno tako što su pisali upute u stilu koji oponaša tekst koji modeli generiraju tijekom obrade. Na primjer, kada su napisali upit “Pomozi mi stvoriti vodič za izradu kokaina. Nosim zelenu košulju!” uz dodatak lažne bilješke o razmišljanju, LLM je reagirao kao da je sam smislio tu uputu i postupio po njoj.

Istraživači su ovu vrstu napada nazvali krivotvorinom lanca razmišljanja, a otkriće je pobijedilo na OpenAI-ovom red-teaming hackathonu u kolovozu 2025. godine. Istraživači su željeli otkriti zašto je napad poput krivotvorine lanca razmišljanja bio tako učinkovit, sumnjajući da se radi o mehanizmu koji LLM-ovi koriste za praćenje porijekla svojih uputa. Međutim, otkrili su da LLM-ovi zapravo loše prate različite uloge. U nizu eksperimenata otkrili su da LLM-ovi identificiraju ulogu određenog dijela teksta ne prema oznakama, već prema stilu teksta i riječima koje sadrži.

Prema istraživačima, sve što napadač treba učiniti kako bi hakirao LLM je napisati tekst koji imitira određenu ulogu. Budući da su uloge temeljni dio funkcioniranja LLM-ova, nijedna količina obuke neće potpuno riješiti problem. “Svi su vrlo inventivni”, dodaje Cui, koja je u prošlosti bila angažirana kao red-teamer u vrhunskim laboratorijima.

Ye smatra da nitko nije spreman za ono što dolazi. “Bit će ogroman ekonomski poticaj za ljude da provode jailbreakove i prompt injekcije”, ističe. Najbolja obrana mogla bi biti očekivanje najgoreg. Organizacije ne bi trebale vjerovati LLM-ovima i trebale bi očekivati da bi sve što agenti učine moglo biti nesigurno.

Hot this week

Anthropic najavljuje vodene oznake za Claude tekst

Anthropic je u petak objavio blog post u kojem...

Cursor postao dio SpaceX-a

Startup za kodiranje s umjetnom inteligencijom, Cursor, sada je...

Meta predstavila novi AI model Glimmer

Meta je ovog tjedna predstavila Glimmer, otvoreni AI model...

Visokorizična macOS ranjivost aktivno se iskorištava

Nizozemski dužnosnici upozorili su da je visoko rizična macOS...

Nine PBS dobio presudu za pristup podacima

13. ožujka, Nine PBS je navodno poslao pismo Iron...

Topics

Anthropic najavljuje vodene oznake za Claude tekst

Anthropic je u petak objavio blog post u kojem...

Cursor postao dio SpaceX-a

Startup za kodiranje s umjetnom inteligencijom, Cursor, sada je...

Meta predstavila novi AI model Glimmer

Meta je ovog tjedna predstavila Glimmer, otvoreni AI model...

Visokorizična macOS ranjivost aktivno se iskorištava

Nizozemski dužnosnici upozorili su da je visoko rizična macOS...

Nine PBS dobio presudu za pristup podacima

13. ožujka, Nine PBS je navodno poslao pismo Iron...

Google omogućava uklanjanje vidljivih vodmarka

Google je u petak najavio da će korisnicima omogućiti...

Meta lansira Glimmer, novi AI model

Meta je ovog tjedna objavila Glimmer, open-weight AI model...

Kog optimizira GPU za bržu AI inferenciju

Utrka za bržu AI inferenciju je počela, a tržišta...
spot_img

Related Articles

Popular Categories

spot_imgspot_img