Utrka za bržu AI inferenciju je počela, a tržišta su srdačno prihvatila Cerebras i njegove posebne čipove na IPO-u u svibnju. Međutim, francuski startup Kog vjeruje da se iz konvencionalnih GPU-a može izvući još mnogo snage.
Startup je u svibnju zauzeo naslovnicu Hacker Newsa s tehnološkim pregledom koji je imao cilj dokazati da je “iznimno brza dekodiranja jedne zahtjeva moguća na standardnim GPU-ima koje poduzeća već posjeduju” — poput AMD MI300X i Nvidia H200 GPU-a koji su korišteni u demonstraciji.
Neki su bili razočarani što se to ne odnosi na GPU-e u našim prijenosnicima, ali drugi su prepoznali potencijal. Budući da su brzina inferencije i troškovi sada kritična uska grla, Kogova obećanja za otključavanje novih mogućnosti na postojećem hardveru uz optimizaciju softvera privukla su više od znatiželjnika. “Imali smo 200 opipljivih poslovnih leadova”, rekao je izvršni direktor Gaël Delalleau za TechCrunch.
Na temelju ranih povratnih informacija, osnivač očekuje da će inženjering softvera biti prvi slučaj primjene. Iskusni korisnici Claude Codea svjesni su da ponekad moraju čekati sati kako bi dobili rezultate. Sam Anthropic shvaća da brzina ima svoju cijenu, pa naplaćuje višu cijenu za Claudeov Fast Mode.
Kog želi ciljati kupce koji su odustali zbog tih kašnjenja, obično zato što se oslanjaju na AI radne tokove za profesionalne zadatke. No, startup također ima dizajnerske partnere koji omogućuju korisnicima generiranje igara i aplikacija uz pomoć prompta, a za koje bi brži rezultati zahvaljujući Kog Inference Engineu (KIE) značili veći prihod, rekao je Delalleau.
Tvrtka je svjesna da ovaj tržišni segment još nije zreo. Promatrajući potražnju, Kog je saznao da njihovi potencijalni kupci nisu spremni fino podešavati male modele. “Zato smo od lansiranja u potpunosti usredotočeni na ubrzanje razvoja većih modela kako bismo zadovoljili potražnju koju smo vidjeli.”
To ostavlja Kogu s ogromnim skokom koji treba napraviti kako bi ispunio svoje obećanje o “30x bržoj LLM inferenciji.” Njihova demonstracija pokazala je impozantnih 3.000 tokena po zahtjevu u sekundi (TPS) — ali s malim modelom s samo nekih 2 milijarde parametara, Laneformer 2B.



