Serija What’s Next MIT Technology Review istražuje industrije, trendove i tehnologije kako bi pružila uvid u budućnost. U ljeto 2017. godine, istraživači umjetne inteligencije u Googleu objavili su rad pod nazivom “Attention Is All You Need”, u kojem su opisali novu vrstu neuronske mreže nazvanu transformer. Ova tehnologija se pokazala vrlo uspješnom u obradi dugih nizova podataka, posebno teksta.
Devet godina kasnije, transformeri su postali temelj svakog značajnog modela velikog jezika na tržištu. “Cijela industrija umjetne inteligencije temelji se na transformerima,” kaže Justin Dangel, suosnivač i izvršni direktor startupa Subquadratic. “Oni su jedna od najvažnijih inovacija u povijesti računalnih znanosti i promijenili su svijet.”
No, transformeri počinju pokazivati znakove zastarjelosti. Mnogi od nedavnih napredaka u LLM-ovima, poput razvoja modela za zaključivanje, nisu samo produžeci te osnovne tehnologije, već rješenja koja premošćuju neke od njezinih osnovnih nedostataka.
Rastući broj znanstvenika i inženjera postavlja pitanje što dolazi sljedeće. LLM-ovi ne nestaju, ali način na koji se grade je otvoren za promjene. (MIT Technology Review nazvao je ovu buduću generaciju modela LLMs+ na ovogodišnjem popisu 10 stvari koje su važne u AI.)
Unoseći val startupa koji se nadaju pomicanju granica ove tehnologije, neki će nesumnjivo propasti, ali imaju sve na kocki i daleko manje za izgubiti od kompanija na čelu današnje industrije.
Transformatori se suočavaju s problemima. Ključna snaga transformera leži u mehanizmu zvanom gusta pažnja, koja kodira značenje bloka teksta u seriji brojeva. Međutim, kako duljina teksta raste, broj potrebnih izračuna brzo se povećava. Na primjer, dokument od 10,000 riječi može zahtijevati da transformer izvrši 50 milijuna množenja. To je glavni razlog zašto LLM-ovi troše toliko energije.
Troškovi su ogromni. OpenAI planira potrošiti 50 milijardi dolara na računalstvo ove godine, prema riječima predsjednika Grega Brockmana. Međunarodna agencija za energiju predviđa da će ukupna potrošnja električne energije podataka dvostruko porasti do 2030. godine.
Osim toga, transformeri se muče s onim što mnogi od najnovijih modela žele postići. Zbog načina na koji procesuiraju tekst riječ po riječ, transformeri nisu dobri u praćenju velike količine informacija odjednom. Ako LLM-ovi žele obavljati složenije zadatke, morat će obraditi veće količine podataka.
Za modele zaključivanja, oni pišu bilješke sami sebi (u obliku ‘lanaca misli’) i zatim ih ponovno čitaju, što dodatno povećava količinu podataka koju treba pratiti. Kako LLM-ovi postaju veći i bolji, transformeri postaju usko grlo. Njihova ključna snaga sada je ograničenje.
Postoji nekoliko novih ideja o tome kako riješiti problem transformera—inovacije koje bi mogle promijeniti LLM-ove zauvijek, čineći ih bržima, učinkovitijima i (možda) čak pametnijima.



