AI vijesti3 min čitanja

Startup Subquadratic rješava usko grlo jezičnih modela

Startup iz Miamija najavio je model SubQ koji rješava matematičko usko grlo pomoću rijetke pažnje.

S

Autor

Shtef

Objavljeno

Apstraktna ilustracija matematičkih inovacija u jezičnim modelima

Startup Subquadratic rješava usko grlo jezičnih modela

Novi model SubQ pokazao je obećavajuće rezultate pomoću rijetke pažnje.

AI startup Subquadratic, sa sjedištem u Miamiju, nedavno je najavio da je riješio matematičko usko grlo koje je godinama kočilo velike jezične modele. Njihov novi model SubQ predstavlja veliki iskorak u rješavanju problema kvadratne ekspanzije, nudeći bržu i jeftiniju obradu podataka uz znatno manju potrošnju energije.

Ključni detalji

Subquadratic je razvio model pod nazivom SubQ, koji se oslanja na inovativni pristup poznat kao rijetka pažnja ("sparse attention"). Prema tvrtki, SubQ procesira do 12 puta više teksta odjednom u usporedbi s većinom drugih modela. Nedavna nezavisna testiranja koja je provela tvrtka Appen potvrdila su arhitekturu modela.

U testovima brzine, Appen je utvrdio da je SubQ 56 puta brži od modela koji koriste FlashAttention tehniku. Na LiveCodeBench testiranju model je ostvario rezultat od 89,7%, što ga svrstava uz bok drugim vrhunskim modelima za kodiranje.

Zašto je to važno

Većina današnjih LLM-ova koristi "gustu pažnju" (dense attention), proces unutar neuralnih mreža zvanih transformeri. Gustom pažnjom model uspoređuje svaki token (dio riječi) sa svim ostalim tokenima u tekstu. To dovodi do kvadratne ekspanzije – kada udvostručite broj riječi, broj računanja se učetverostruči, što zahtijeva golemu procesorsku moć.

Tehnička pozadina

Rijetka pažnja rješava ovaj problem tako što selektivno bira koje će brojeve (tokene) množiti.

  • Umjesto uspoređivanja svakog tokena sa svakim drugim, model dinamički bira važne odnose između riječi.
  • SubQ može obraditi ogroman kontekstualni prozor od 6 do 12 milijuna tokena.
  • Prilikom testiranja, model je gotovo savršeno uspješno pronalazio specifične informacije unutar 12 milijuna tokena na "Needle-in-a-Haystack" testu.

Širi kontekst

Ako Subquadratic doista uspije dokazati dugoročnu održivost ovog modela, to bi moglo u potpunosti promijeniti način na koji se izrađuju veliki jezični modeli. Prelazak s transformera i guste pažnje na modele poput SubQ-a omogućio bi obradu ogromnih baza podataka uz znatno niže troškove, smanjujući tehnološku i financijsku barijeru za napredne AI aplikacije.

Što slijedi

Trenutno je pristup SubQ modelu ograničen, a deseci tisuća potencijalnih korisnika čekaju u redu. Budući razvoj ovisit će o tome hoće li model uspjeti zadržati ovakve performanse kada postane široko dostupan i kada se suoči s kompleksnim problemima u stvarnom svijetu izvan izoliranih testova.


Izvor: MIT Technology Review Objavljeno na portalu Umjetna Inteligencija Blog by ShtefAI, autor: Shtef

Povezano

Pročitajte i ovo

Još nekoliko objava koje šire kontekst oko tema, kompanija i AI trendova iz ove priče.

Ilustracija razlike između današnjih AI alata i opće umjetne inteligencije
Analiza

Zašto AGI nije ni blizu usprkos obećanjima tehnoloških divova

Hype oko opće umjetne inteligencije zamagljuje stvarna ograničenja današnjih jezičnih modela.

Ilustracija uz vijest o AlphaGenome Atlasu
AI vijesti

DeepMind predstavio moćni AlphaGenome Atlas

Nova baza podataka koja sadrži predviđanja za 9 milijardi mogućih jednoslovnih mutacija u ljudskom genomu.

Ilustracija uz komentar: Umjetna inteligencija i stvarna produktivnost developera
Analiza

Umjetna inteligencija i stvarna produktivnost developera

Zašto AI alati za programiranje udaraju u zid složenosti i zašto pisanje koda nije jedini posao inženjera.