Opsesija testovima: Zašto AI pada u stvarnom svijetu
Impresivni rezultati u laboratoriju često ne znače apsolutno ništa kada se umjetna inteligencija susretne s pravim korisnicima.
Svaki tjedan svjedočimo novim spektakularnim najavama u kojima tehnološki divovi tvrde da njihov najnoviji jezični model obara sve postojeće rekorde na standardiziranim testovima. Brojke su redovito zadivljujuće, a prezentacijski grafikoni pokazuju strmi, gotovo eksponencijalni rast sposobnosti. Prema tim podacima, umjetna inteligencija već danas može položiti pravosudni ispit, riješiti složene medicinske slučajeve i napisati savršen programski kod bez ijedne pogreške. Ipak, kada prosječan korisnik pokuša iskoristiti taj isti hvaljeni model za stvarni, naizgled jednostavan i nepredvidiv radni zadatak, rezultat je često duboka frustracija, neobjašnjive halucinacije sustava i gorko razočaranje.
Prevladavajuća priča
Industrija umjetne inteligencije stvorila je i održava vlastiti, potpuno zatvoreni ekosustav vrednovanja i samopromocije. Prevladavajuća priča sugerira da su benchmark testovi, poput onih koji pažljivo mjere sposobnost rješavanja matematičkih problema, logičkog zaključivanja ili programiranja, savršen i neoboriv pokazatelj opće inteligencije i stvarne korisnosti pojedinog modela.
Prema tom duboko ukorijenjenom narativu, ako novi model postigne samo nekoliko postotaka bolji rezultat od najbliže konkurencije na pažljivo odabranom testu, on se automatski proglašava revolucionarnim. Smatra se da je takav sustav istog trena spreman za potpunu transformaciju svake industrije, od financija i zdravstva do kreativnog pisanja i korisničke podrške. Investitori slave, dionice rastu, a javnost dobiva dojam da je opća umjetna inteligencija udaljena samo nekoliko mjeseci.
Zašto je ta priča pogrešna ili nepotpuna
Ovakav inženjerski i strogo kvantitativni pristup namjerno ignorira jednu temeljnu razliku. Postoji golem ponor između rješavanja izoliranog, akademskog testa i snalaženja u beskrajnom kaosu ljudske interakcije i stvarnog poslovanja.
Standardizirani testovi su savršeno strukturirani, imaju vrlo jasne ulazne podatke, nedvosmislen kontekst i uvijek samo jedan potpuno točan odgovor. Stvarni svijet je, s druge strane, nevjerojatno neuredan. Korisnici redovito postavljaju nejasna pitanja, traže rješenja koja zahtijevaju duboko razumijevanje konteksta o njihovom specifičnom poslovanju i očekuju da model samostalno prepozna i razumije suptilne nijanse koje nikada nisu bile i ne mogu biti dio osnovnih trening podataka.
Dodatni problem predstavlja fenomen prekomjernog prilagođavanja modela samim testovima. Kako bi zadovoljili očekivanja dioničara i javnosti, istraživački timovi često usmjeravaju cijeli proces treniranja upravo prema onim zadacima koji se najčešće pojavljuju u popularnim benchmark alatima. Umjesto da stvaraju svestran i prilagodljiv sustav, oni nesvjesno grade visoko specijalizirani alat za polaganje specifičnih ispita. Čim korisnik zatraži pomoć oko problema koji samo malo odstupa od uobičajenog obrasca, model se lomi i počinje generirati naizgled uvjerljive, ali potpuno besmislene odgovore.
Optimizacija AI modela isključivo za postizanje visokih rezultata na ovakvim ispitima dovodi do opasne iluzije. Sustav postaje apsolutno briljantan u polaganju testova za koje je dizajniran, ali ostaje nevjerojatno nespretan, krut i nepredvidiv u rješavanju stvarnih, svakodnevnih problema malog poduzetnika ili običnog zaposlenika. To stvara snažan lažni osjećaj tehnološkog napretka koji se neizbježno raspada na proste faktore čim se tehnologija primijeni izvan sigurnih, sterilnih laboratorijskih uvjeta.
Posljedice u stvarnom svijetu
Ovakva nezdrava opsesija analitičkim metrikama i bodovima na testovima ima vrlo stvarne i mjerljive posljedice za cijelo gospodarstvo. Tvrtke, zavedene marketinškim obećanjima, ulažu ogromna financijska sredstva u brzu implementaciju alata za koje iskreno vjeruju da će preko noći automatizirati njihove najsloženije procese.
Umjesto obećane utopije, menadžeri ubrzo otkrivaju da zaposlenici zapravo troše znatno više vremena na beskrajno ispravljanje algoritamskih pogrešaka, provjeravanje činjenica i mukotrpnu prilagodbu upita, nego što bi im ikada trebalo da sami, na tradicionalan način, obave taj isti posao. Alat koji je trebao osloboditi vrijeme zapravo je postao novi izvor stresa i dodatnog opterećenja za cijeli tim.
Pored toga, manji inovatori i nezavisni istraživači prisiljeni su sudjelovati u ovoj besmislenoj utrci. Umjesto da razvijaju specifična i korisna rješenja za uske niše, oni troše dragocjene resurse pokušavajući nadmašiti velike korporacije na općim testovima. Cijela industrija tako gubi fokus s rješavanja stvarnih problema i pretvara se u natjecanje za najbolji PR naslov.
Kao izravna posljedica, obični korisnici sve brže gube povjerenje u samu tehnologiju jer grandiozna obećanja iz PR objava ne odgovaraju njihovoj svakodnevnoj stvarnosti. Istovremeno, talentirani inženjeri nalaze se pod ogromnim korporativnim pritiskom da po svaku cijenu jure za boljim brojkama na testovima, umjesto da svoje vrijeme posvete razvoju robusnih, stabilnih i pouzdanih alata koji stvarno, opipljivo pomažu ljudima u njihovom radu. U ovakvom sustavu, jedini pravi dobitnici su oni koji uspješno prodaju priču o konstantnom tehnološkom skoku i prikupljaju kapital. Svi oni koji naivno pokušavaju te nedovršene sustave integrirati u svoj stvarni radni dan, nažalost, postaju gubitnici.
Završni stav
Dok industrija konačno ne prestane tretirati razvoj umjetne inteligencije kao besmisleno natjecanje u rješavanju standardiziranih testova i ne počne je strogo vrednovati isključivo prema njezinoj stvarnoj, svakodnevnoj korisnosti, nastavit ćemo dobivati modele koji su genijalni na papiru, a potpuno beskorisni u praksi.
Komentar objavljen na portalu Umjetna Inteligencija Blog by ShtefAI, autor: Shtef



