Utorak, 21 srpnja, 2026
23.1 C
London

Nova tehnika otkriva tajne LLM-a

Tvrtka Anthropic razvila je tehniku koja je pružila najjasniji uvid u ono što se zapravo događa unutar velikih jezičnih modela dok odgovaraju na pitanja ili izvršavaju zadatke. Njihova otkrića kreću se od svakodnevnih do uznemirujućih.

Istraživači u tvrtki izradili su alat nazvan Jacobian lens (ili J-lens) i koristili ga za otkrivanje skrivene zone, koju su nazvali J-space, unutar Claude Opus 4.6, verzije Anthropicovog glavnog LLM-a objavljene u veljači. J-space sadrži pojedinačne riječi koje su povezane s riječima i frazama koje će model vjerojatno izgovoriti kao odgovor u bliskoj budućnosti. Ako bi Claude bio osoba (što nije), mogli bismo reći da te skrivene riječi otkrivaju što mu je na pameti prije nego što zapravo progovori.

Anthropic je otkrio da ono što LLM zapravo radi često može biti različito od onoga što tvrdi da radi. Tvrtka tvrdi da praćenje riječi koje se pojavljuju u J-space pruža novi način razumijevanja i kontrole svojih modela.

Tvrtka je podijelila svoje rezultate u radu objavljenom na njihovoj web stranici ovog tjedna. Također su se udružili s Neuronpedijom, otvorenom platformom koja omogućuje istraživanje LLM-a, kako bi stvorili praktičnu demonstraciju koju svatko može isprobati. “To je vrlo dobar i zanimljiv rad,” kaže Tom McGrath, glavni znanstvenik i suosnivač Goodfire-a, startupa koji također razvija alate za razumijevanje i kontrolu LLM-a.

U posljednjih nekoliko godina, Anthropic je pomicao granice u području istraživanja poznatom kao mehanistička interpretabilnost, koje uključuje istraživanje unutarnjeg rada LLM-a kako bi se vidjelo kako funkcioniraju. Nova tehnika nadograđuje prethodni rad Anthropic-a i drugih kako bi otkrila dublju razinu unutar LLM-a koju istraživači ranije nisu vidjeli.

Pretpostavite da je LLM niz knjiga. Svaka knjiga predstavlja sloj osnovnih računalnih jedinica poznatih kao neuroni, pri čemu svaki neuron u jednom sloju prenosi informacije neuronima u slojevima iznad. Knjige na dnu stoga su ulazni slojevi, koji obrađuju tekst koji ulazi u model, dok su knjige na vrhu izlazni slojevi, koji pripremaju tekst koji model treba proizvesti.

U sredini stoga se nalaze slojevi koji obavljaju teže zadatke, obrađujući kompleksne matematičke operacije koje pretvaraju upite u odgovore, riječ po riječ. Tamo se odvijaju zaista pametne i misteriozne stvari.

Da bi dublje zavirio u te srednje slojeve, Anthropic je prilagodio postojeći alat nazvan logit lens. Logit lens može se koristiti za gledanje unutar LLM-a kako bi se identificirale riječi koje će vjerojatno proizvesti sljedeće. Pomicanjem leće duž hrpe knjiga otkriva se koje riječi LLM fokusira u tom trenutku. J-lens radi na sličan način, ali odabire riječi koje će LLM vjerojatno izjaviti u bliskoj budućnosti, ne nužno odmah.

“Kada model radi, ne pokušava samo predvidjeti sljedeći token, nego izračunava i mnogo drugih stvari koje bi mogle biti korisne za tokene koji se događaju u budućnosti,” kaže McGrath. J-lens daje naznake o tome o čemu razmišlja na različitim razinama slojeva knjiga, ali ne izgovara naglas.

Hot this week

Napredni materijali i umjetna inteligencija

Razgovor o umjetnoj inteligenciji često se usredotočuje na algoritme,...

Bristol Myers Squibb nabavlja Nvidia DGX SuperPOD

Bristol Myers Squibb kupuje Nvidia DGX SuperPOD temeljen na...

Gritt: Inovativni robot za instalaciju solarnih panela

Jedna od najvažnijih stvari koja se događa na Zemlji...

Utjecaj kineskih modela otvorene težine na tržište

Tvrtke koje u ovom mjesecu razmatraju kineske modele otvorene...

Anthropic postigao nagodbu od 1,5 milijardi dolara

17:12 PDT · 20. srpnja 2026.Tvrtka Anthropic konačno može...

Topics

Napredni materijali i umjetna inteligencija

Razgovor o umjetnoj inteligenciji često se usredotočuje na algoritme,...

Bristol Myers Squibb nabavlja Nvidia DGX SuperPOD

Bristol Myers Squibb kupuje Nvidia DGX SuperPOD temeljen na...

Gritt: Inovativni robot za instalaciju solarnih panela

Jedna od najvažnijih stvari koja se događa na Zemlji...

Utjecaj kineskih modela otvorene težine na tržište

Tvrtke koje u ovom mjesecu razmatraju kineske modele otvorene...

Anthropic postigao nagodbu od 1,5 milijardi dolara

17:12 PDT · 20. srpnja 2026.Tvrtka Anthropic konačno može...

Ravnatelj CAISI-a Chris Fall dao ostavku

Chris Fall, ravnatelj Centra za standarde i inovacije u...

Google razvija novi čip za umjetnu inteligenciju

Alphabet, matična tvrtka Googlea, dizajnira novi čip za poslužitelje...

Ažuriranje Model Context Protocol-a

Model Context Protocol (MCP) jedan je od osnovnih građevinskih...
spot_img

Related Articles

Popular Categories

spot_imgspot_img