Zid podataka: Zašto umjetna inteligencija uskoro usporava
Modeli ostaju bez svježeg ljudskog znanja za daljnje učenje
Umjetna inteligencija napredovala je nevjerojatnom brzinom gutajući doslovno cijeli internet. Od Wikipedije do opskurnih foruma, algoritmi su konzumirali sav dostupni ljudski tekst. No, taj nezasitni apetit sada se suočava s neizbježnim fizičkim ograničenjem. Dolazimo do "zida podataka" – točke u kojoj jednostavno više nema dovoljno novog, kvalitetnog, ljudskog sadržaja za treniranje sljedeće generacije velikih jezičnih modela.
Prevladavajuća priča
Tehnološki optimisti uvjeravaju nas da je zakon velikih brojeva neumoljiv i da će skaliranje riješiti sve probleme. Ako trenutačni modeli impresivno funkcioniraju na milijardama parametara, sljedeći će na trilijunima biti još moćniji. Silicijska dolina vjeruje da će samo ulijevanje više novca u veće podatkovne centre i naprednije čipove rezultirati linearnim rastom sposobnosti umjetne inteligencije do trenutka kada ostvarimo opću umjetnu inteligenciju (AGI).
Zašto je ta priča pogrešna ili nepotpuna
Ova priča ignorira osnovni zakon ponude i potražnje informacija. Krivulja dostupnih podataka oštro se izravnava. Modeli poput GPT-4 već su trenirani na gotovo cjelokupnom javno dostupnom ljudskom znanju. Dodavanje više računalne snage ne pomaže ako nema novih knjiga, znanstvenih radova ili razgovora na kojima algoritam može učiti.
Kao rješenje se često nudi sintetički sadržaj – podaci koje stvara sama umjetna inteligencija kako bi trenirala novu generaciju umjetne inteligencije. No, istraživanja već pokazuju fenomen "kolapsa modela". Kada AI uči isključivo na sadržaju koji je stvorio drugi AI, pogreške se multipliciraju, halucinacije postaju ukorijenjene, a modeli s vremenom gube kvalitetu i kreativnost. To je digitalni ekvivalent pokušaja preživljavanja hraneći se isključivo vlastitim otpadom.
Posljedice u stvarnom svijetu
Kada rast umjetne inteligencije uspori zbog zida podataka, to će dramatično utjecati na tržište. Startupi koji su svoju budućnost kladili na eksponencijalni rast sposobnosti modela suočit će se s grubim otrežnjenjem. Investitori koji očekuju čarobna rješenja u bliskoj budućnosti počet će povlačiti kapital. S druge strane, jedinstveni, visokokvalitetni privatni podaci – poput internih arhiva velikih korporacija, zatvorenih znanstvenih baza ili specifičnih industrijskih znanja – postat će najvredniji resurs na svijetu, strmoglavo podižući cijenu pristupa tim informacijama.
Završni stav
Eksponencijalni rast sposobnosti umjetne inteligencije kakvom svjedočimo posljednjih godina nije pravilo, već anomalija omogućena jednokratnim rudarenjem cjelokupnog interneta. Budućnost ne pripada onima koji grade najveće modele, već onima koji osiguraju kontinuirani pristup ekskluzivnim i stvarnim ljudskim podacima.
Komentar objavljen na portalu Umjetna Inteligencija Blog by ShtefAI, autor: Shtef



