PRISM2, koji su razvili Paige i Microsoft, analizira slike cijelih uzoraka putem postavke perceptera koja je obučena koristeći kombinaciju tkivnih pločica i kliničkog dijaloga temeljenog na izvještajima o patologiji. Ovaj model prikuplja tisuće ugrađenih značajki po slici u jednu reprezentaciju, a zatim generira tekst koji odgovara na dijagnostička pitanja umjesto da samo klasificira piksele.
Podaci za obuku obuhvaćaju 2,3 milijuna cijelih slika uzoraka. Dijalog koji nadgleda dolazi iz 685,507 izvještaja o patologiji koje je Memorial Sloan Kettering Cancer Center prikupio tijekom rutinske skrbi, a koji su pretvoreni u parove pitanja i odgovora pomoću GPT-4o.
Arhitektura i dizajn ugrađivanja
Arhitektura se odvija u dvije faze. Prva faza obučava encoder za slike, podučavajući ga kako kombinirati značajke na razini pločica u jedan vektor na razini slike koji se povezuje s jezikom izvještaja.
Druga faza potpuno zamrzava taj encoder i prebacuje rad na jezični model, fino podešavajući ga na dijalog kako bi naučio konvencije izvještavanja o patologiji, a ne mehaniku encodera.
Jednostruki dijalog služi kao nadzor u ovoj drugoj fazi. Nema povijesti višekratnog dijaloga koja ulazi u signal obuke, što ograničava vrstu interaktivne komunikacije koju sustav može podržavati bez dodatnog inženjeringa.
Model PRISM2 nudi dva odvojena ugrađivanja umjesto jednog. Osnovna ugrađivanja dolaze izravno iz encodera slike i prenose se na zadatke predikcije biomarkera. Dijagnostička ugrađivanja se povlače iz skrivenog stanja jezičnog modela s 4 milijarde parametara, a izvode se tek nakon što je taj model obradio i slike i tekst.
Performanse i rezultati benchmarka
PRISM2 postiže ili premašuje uravnoteženu točnost kliničkih proizvoda kalibriranih za dijagnostiku raka prostate i dojke, testiranih na vlastitim evaluacijskim skupovima tih proizvoda. PRISM2 također nadmašuje Paige BLN u klasifikaciji limfnih čvorova dojke bez dodatne obuke na tom specifičnom zadatku.
U ranijim modelima usporedbe, PRISM i TITAN nisu se pokazali tako uspješni pod kontrastnom klasifikacijom. Razlike u performansama posebno su se povećale pri testiranju limfnih čvorova dojke.
Detekcija raka u više tipova proširuje benchmark. Dijagnostička ugrađivanja postigla su 0,967 AUC, nasuprot 0,956 za osnovno ugrađivanje na istom zadatku. PRISM je ostvario 0,947, dok je TITAN bio na 0,931.
Studija ablacijske analize izolira doprinos dijaloga. Dodavanje dijalog šablona izvornoj točki PRISM podiglo je točnost temeljenog na upitima s približno 0,498 na 0,653.
Kvaliteta podataka, stopa pogrešaka i arhitektonska ograničenja
Patolog je pregledao 50 uzoraka kako bi provjerio generirani trening tekst i PRISM2-ove vlastite rezultate. Stopama pogreške kod pitanja bila su 3 posto za otvorena i višekratna pitanja, dok su dijagnostički sažeci imali stopu pogreške od 8 posto.
Model PRISM2 ima javno dostupnu težinu na Hugging Face. Timovi koji grade na PRISM2 trebaju testirati prijenos ugrađivanja na vlastitim izlazima skenera prije nego što pretpostave paritet s osnovnim modelom obučavanim u MSK.



