Alibaba je lansirao Qwen3.8-Max, svoj najveći AI model do sada, dok najnoviji V4-Flash model DeepSeek-a privlači pažnju zbog niže cijene inferencije od nekoliko konkurentskih sustava.
Qwen3.8-Max ima 2.4 trilijuna parametara i koristi arhitekturu mješavine stručnjaka, koja aktivira samo dio modela za svaki zahtjev. Alibaba je izjavila da je oko 95 milijardi parametara aktivno u isto vrijeme, što smanjuje troškove i vrijeme odgovora u usporedbi s aktiviranjem cijelog modela.
DeepSeek koristi sličnu rijetku arhitekturu na manjoj skali. Artificial Analysis navodi V4-Flash s 284 milijarde ukupnih parametara, od kojih je 13 milijardi aktivno tijekom inferencije, dok Moonshot AI-ov Kimi K3 ima 2.8 trilijuna ukupnih parametara i oko 104 milijarde aktivnih.
Qwen3.8-Max može obraditi tekst, slike i video, te podržava do milijun tokena konteksta. Alibaba je također izjavila da je model završio projekt softverskog inženjeringa u 16 dana.
Njegova veličina ga približava Kimi K3, koji je Moonshot AI objavio u srpnju. Dvije kompanije također se natječu po cijeni, pri čemu Qwen3.8-Max košta 2 USD po milijunu ulaznih tokena i 6 USD po milijunu izlaznih tokena, u usporedbi s 3 USD i 15 USD za Kimi K3.
Veličina modela sama po sebi ne određuje trošak inferencije. Arhitektura, broj aktivnih parametara, potrošnja tokena i broj poziva potrebnih za dovršetak zadatka također utječu na troškove pokretanja modela.
Qwen3.8-Max zauzeo je prvo mjesto među kineskim tekstualnim modelima na crowdsourced platformi Arena.AI nakon svog lansiranja, iako je ostao iza nekoliko Anthropic modela u općem poretku. Također je rangiran kao drugi na Arena.AI-ovoj ljestvici za modele koji analiziraju slike i drugi vizualni materijal, iza varijante Anthropic Claude Fable 5.
DeepSeek smanjuje cijene inferencije
DeepSeek je odabrao drugačiji pristup s V4-Flash. Umjesto da uskladi ukupnu skalu najnovijih modela Alibabe i Moonshot AI-a, postavio je cijenu ispod nekoliko široko korištenih AI sustava.
V4-Flash košta 0.14 USD po milijunu ulaznih tokena i 0.28 USD po milijunu izlaznih tokena, prema Artificial Analysis-u. Istraživačka firma navodi model s kontekstom od milijun tokena i 284 milijarde ukupnih parametara, od kojih je 13 milijardi aktivno tijekom inferencije.
Artificial Analysis navodi cijenu cache-hit-a od 0.003 USD po milijunu tokena za verziju Max Effort V4-Flash, što je 98% ispod standardne ulazne cijene. Keširani ulaz pokriva prethodno obrađeni kontekst koji se može ponovo koristiti u sljedećim zahtjevima.
Niže cijene tokena DeepSeek-a također su se odrazile u benchmark testiranju Artificial Analysis-a. Reuters je izvijestio da je istraživačka firma procijenila prosječni trošak V4-Flash-a na tri centa po testu, u usporedbi s 86 centi za Kimi K3, 1.86 USD za OpenAI-ov GPT-5.6 Sol, i 3.15 USD za Anthropic-ov Claude Fable 5.
Upoređivanje uzima u obzir količinu ulaza i izlaza koju svaki model koristi za dovršavanje benchmark-a. Niža cijena po tokenu ne rezultira nužno nižim troškom zadatka ako model generira više izlaza ili zahtijeva dodatne interakcije.



