Savjetnik za znanost Bijele kuće Michael Kratsios izjavio je da je Moonshot, kineska tvrtka iza Kimi K3, najvećeg dostupnog LLM-a otvorene težine, izgradila svoj model kopirajući Anthropicov Fable LLM koristeći čipove koji nisu odobreni za izvoz u Kinu.
“Velika, tajna industrijska destilacija usmjerena na krađu vlasničke američke tehnologije i potkopavanje američkog istraživanja je neprihvatljiva,” napisao je Kratsios, usred izvještaja o raspravama o zabrani kineskih modela otvorene težine koji su uzburkali AI sektor. Moonshot nije odgovorio na pitanja o svom procesu obuke, a Kratsios nije podijelio dodatne detalje o izvorima svojih optužbi.
Tweet Kratsiosa odražava komentare ministra financija Scotta Bessenta koji je rekao da “nalazimo vodene oznake naših američkih velikih jezičnih modela na mnogim kineskim modelima, i to je neprihvatljivo.” Nije jasno od čega se te vodene oznake sastoje, a Ministarstvo financija nije odgovorilo na upit.
Međutim, stručnjaci su skeptični da je destilacija—proces postavljanja upita LLM-u kako bi se odredila njegova unutarnja struktura i kopirale njegove sposobnosti—odgovorna za napredne sposobnosti koje Kimi K3 pokazuje.
“Ne mislim da možete dobiti model ovakve snage i ovako brzo nakon što je Fable isključivo radio na destilaciji,” rekao je Braden Hancock, istraživač s Laude instituta i suosnivač Snorkel AI. “Jednostavno nema dovoljno vremena, zar ne? Fable je dostupan od 1. srpnja. Ne možete destilirati toliko podataka, obučiti model i objaviti ga u dva tjedna.”
“Bio sam mišljenja da destilacija postaje sve manje utjecajna kako se kineski modeli približavaju granici, a režim obuke prelazi na [pojačano učenje],” rekao je Nathan Lambert, istraživač AI-a u Allen Institute for AI, u podcastu objavljenom jučer. “[U]koli to bude slučaj, svi bi lako mogli sustići GLM ili K3 koristeći njegove podatke za destilaciju. Ali to nismo vidjeli, niti ćemo to vidjeti, samo iz nadziranog finog podešavanja.”
Izvođenje destilacije zahtijeva laboratorij koji sustavno postavlja upite svom ciljanom modelu kako bi generirao podatke koji se mogu koristiti za post-obuku. Ponekad to uključuje eksplicitno traženje od modela da artikulira svoj lanac mišljenja kako bi se razumjelo kako rješava probleme. U drugim slučajevima, upiti i odgovori modela koriste se za obučavanje novog modela u procesu poznatom kao nadzirano fino podešavanje, ili SFT.
Ovaj proces finog podešavanja može rezultirati modelom koji je navodno stvorio treća strana tvrdeći da je Claude. Finno podešavanje je, prema Lambertovom mišljenju, mjesto gdje “model usvaja svoje manire.”
Međutim, Lambert ističe da koristi SFT postaju manje važne kako modeli postaju složeniji. Za destilaciju sposobnosti poput Fablea vjerojatno bi bile potrebne tehnike pojačanog učenja. U mnogim slučajevima, to znači da agent većeg modela ocjenjuje odgovore manjeg modela i prilagođava se na temelju ocjene.
Naprednije tehnike također zahtijevaju značajniju infrastrukturu. Veliki radovi pojačanog učenja mogu zahtijevati desetke milijuna agenata. Korištenje API-ja granice laboratorija za to “bilo bi nevjerojatno skupo i potencijalno bi vjerojatno predstavljalo vremensko usko grlo jer su ti modeli prilično spori i, iskreno, možda vam ne bi donijeli poboljšanje performansi.”



