Umjetna inteligencija (AI) doživljava procvat. Novi slučajevi korištenja pojavljuju se svaki dan. Kako bi iskoristile potencijal ove tehnologije, poduzeća trebaju podatke u velikim količinama. Međutim, u mnogim slučajevima, relevantne informacije su blokirane ili nestrukturirane, što ograničava njihovu upotrebu u AI modelima.
Osnove interneta nisu bile dizajnirane za automatsko otkrivanje i preuzimanje informacija, što je potrebno novim AI aplikacijama. Prevladavanje ovog inherentnog dizajnerskog ograničenja zahtijeva novu infrastrukturu podataka. Sljedeća granica u AI-u može ovisiti o novom sloju web podataka koji omogućava modelima da otkriju i mapiraju ovo neprestano širenje digitalnog prostora.
Ova infrastruktura mora biti sposobna navigirati stotinama milijuna postojećih web domena i milijardama novih URL-ova koji se svakog tjedna stvaraju, isporučujući informacije u stvarnom vremenu i prevladavajući tehničke prepreke. Prema riječima Or Lenchnara, izvršnog direktora Bright Data, platforme za prikupljanje web podataka, “Podaci sugeriraju da postoji daleko više podataka vani. Razmislite o svemiru: on je tu, ali ne znate što ne znate.”
Omogućavanje pristupa svježim, relevantnim i pouzdanim podacima postalo je ključno. Dok su raniji AI proboji bili vođeni povećanjem veličine podataka za obuku i modela, organizacije se sada suočavaju s osnovnim uskim grlom: moraju održavati korak s dinamičnom, nestrukturiranom i neprestano evoluirajućom prirodom web podataka.
Tradicionalna obuka modela oslanja se na snimke informacija prikupljenih u određenom trenutku, što više nije dovoljno. Da bi pratili promjene kao što su cijene konkurenata, potrošačko raspoloženje i tržišni trendovi, tvrtke trebaju stalni izvor novih informacija, povlačeći podatke u stvarnom vremenu. Njihova infrastruktura mora stoga biti sposobna obraditi milijune simultanih interakcija preko web stranica koje se razlikuju po geografiji, jeziku, formatu i pravilima pristupa.
Brzina nije samo pitanje pogodnosti; to je pitanje nužnosti. Današnje organizacije djeluju u okruženjima gdje se cijene, inventar, tržišta, sigurnosne prijetnje i ponašanje kupaca neprestano mijenjaju. Kašnjenje u preuzimanju podataka može smanjiti korisnost inače sofisticiranog modela.
Pristup svježim, AI-pripremljenim podacima na velikoj skali donosi tehničke i strukturne izazove. Mnogi sustavi kombiniraju javno preuzimanje podataka s API-jima, licenciranim skupovima podataka i vlasničkim internim podacima. Integracija ovih fragmentiranih izvora u pravovremeni i upotrebljiv sloj znanja zahtijeva specijalizirane sposobnosti.
Ova nova infrastruktura može zadovoljiti rastuće potrebe za jačim AI unosima omogućavanjem otkrivanja podataka, pristupa u stvarnom vremenu i prilagodbe specifičnom kontekstu. Kako Lenchner objašnjava, “Sve se svodi na prikupljanje podataka na velikoj skali, s vrlo niskom latencijom, bez blokada.”



