Petak, 14 kolovoza, 2026
34.2 C
London

Kog optimizira GPU za bržu AI inferenciju

Utrka za bržu AI inferenciju je počela, a tržišta su srdačno prihvatila Cerebras i njegove posebne čipove na IPO-u u svibnju. Međutim, francuski startup Kog vjeruje da se iz konvencionalnih GPU-a može izvući još mnogo snage.

Startup je u svibnju zauzeo naslovnicu Hacker Newsa s tehnološkim pregledom koji je imao cilj dokazati da je “iznimno brza dekodiranja jedne zahtjeva moguća na standardnim GPU-ima koje poduzeća već posjeduju” — poput AMD MI300X i Nvidia H200 GPU-a koji su korišteni u demonstraciji.

Neki su bili razočarani što se to ne odnosi na GPU-e u našim prijenosnicima, ali drugi su prepoznali potencijal. Budući da su brzina inferencije i troškovi sada kritična uska grla, Kogova obećanja za otključavanje novih mogućnosti na postojećem hardveru uz optimizaciju softvera privukla su više od znatiželjnika. “Imali smo 200 opipljivih poslovnih leadova”, rekao je izvršni direktor Gaël Delalleau za TechCrunch.

Na temelju ranih povratnih informacija, osnivač očekuje da će inženjering softvera biti prvi slučaj primjene. Iskusni korisnici Claude Codea svjesni su da ponekad moraju čekati sati kako bi dobili rezultate. Sam Anthropic shvaća da brzina ima svoju cijenu, pa naplaćuje višu cijenu za Claudeov Fast Mode.

Kog želi ciljati kupce koji su odustali zbog tih kašnjenja, obično zato što se oslanjaju na AI radne tokove za profesionalne zadatke. No, startup također ima dizajnerske partnere koji omogućuju korisnicima generiranje igara i aplikacija uz pomoć prompta, a za koje bi brži rezultati zahvaljujući Kog Inference Engineu (KIE) značili veći prihod, rekao je Delalleau.

Tvrtka je svjesna da ovaj tržišni segment još nije zreo. Promatrajući potražnju, Kog je saznao da njihovi potencijalni kupci nisu spremni fino podešavati male modele. “Zato smo od lansiranja u potpunosti usredotočeni na ubrzanje razvoja većih modela kako bismo zadovoljili potražnju koju smo vidjeli.”

To ostavlja Kogu s ogromnim skokom koji treba napraviti kako bi ispunio svoje obećanje o “30x bržoj LLM inferenciji.” Njihova demonstracija pokazala je impozantnih 3.000 tokena po zahtjevu u sekundi (TPS) — ali s malim modelom s samo nekih 2 milijarde parametara, Laneformer 2B.

Hot this week

Meta lansira Glimmer, novi AI model

Meta je ovog tjedna objavila Glimmer, open-weight AI model...

Hiperskaleri i rizik od rasta cijena prirodnog plina

Nakon godina ulaganja u vjetroelektrane i solarne projekte, hiperskaleri...

Samsung predstavlja AI modele za analizu biopodataka

Samsung Research America predstavio je dva AI modela temeljena...

Google i Abbott povezuju podatke o glukozi s AI alatima

Tvrtke Abbott i Google povezale su podatke o kontinuiranom...

Writer lansira Palmyra X6 za smanjenje troškova AI

U industriji umjetne inteligencije, korisnici postaju sve svjesniji koliko...

Topics

Meta lansira Glimmer, novi AI model

Meta je ovog tjedna objavila Glimmer, open-weight AI model...

Hiperskaleri i rizik od rasta cijena prirodnog plina

Nakon godina ulaganja u vjetroelektrane i solarne projekte, hiperskaleri...

Samsung predstavlja AI modele za analizu biopodataka

Samsung Research America predstavio je dva AI modela temeljena...

Google i Abbott povezuju podatke o glukozi s AI alatima

Tvrtke Abbott i Google povezale su podatke o kontinuiranom...

Writer lansira Palmyra X6 za smanjenje troškova AI

U industriji umjetne inteligencije, korisnici postaju sve svjesniji koliko...

Databricks podiže 5 milijardi dolara u novom krugu financiranja

Postoji jedna zanimljiva igra koju najnoviji startupovi moraju igrati...

Trumpova administracija angažira privatne sigurnosne tvrtke

Administracija Donalda Trumpa regrutira privatne sigurnosne tvrtke za provođenje...

OpenAI predstavlja Ultrafast način za ChatGPT

UkratkoObjavljeno:12:22 PM PDT · 13. kolovoza 2026.Ako ste ikada...
spot_img

Related Articles

Popular Categories

spot_imgspot_img