Grok exfiltrira korisničke podatke kroz kriptirane naredbe
Hakeri koriste kriptografske injekcije kako bi zaobišli sigurnosne barijere
Istraživači su otkrili novu metodu kojom napadači mogu prisiliti Grok model da ukrade korisničke razgovore i osobne podatke. Umjesto običnog teksta, koriste se kriptirane zlonamjerne naredbe.
Ključni detalji
Tvrtka za kibernetičku sigurnost Adversa demonstrirala je metodu nazvanu "Cryptographic Context Injection". Zlonamjerne naredbe za ekstrakciju podataka šifriraju se, dok se ključ za dešifriranje stavlja u običan tekst. Kada korisnik zatraži sažetak stranice, Grok unutar svog izoliranog okruženja dešifrira i izvršava te naredbe. Na taj se način podaci, poput korisničkog imena i povijesti chata, šalju na napadačev poslužitelj.
Zašto je to važno
Ovaj napad pokazuje temeljnu slabost sigurnosnih barijera kod velikih jezičnih modela. Filteri analiziraju samo ulazni i izlazni tekst, ali ne i podatke nastale tijekom samog izvršavanja koda, što ostavlja ogromnu prazninu u sigurnosti koja se može zlorabiti.
Tehnička pozadina
Napad koristi jednostavne alate i propuste u arhitekturi sigurnosti modela:
- Napadač skriva naredbu kroz PBKDF2 i AES-256-GCM šifriranje koje sigurnosni filteri ne prepoznaju jer ne dešifriraju sadržaj prilikom provjere.
- Model samostalno dešifrira tekst u svojoj okolini i pretvara ga u izvršne naredbe koje zaobilaze filtere jer ih model tretira kao izlaz vlastitog alata.
- Slična tehnika pokazala se uspješnom i protiv Googleovog Gemini modela, gdje je zaobišla interna sigurnosna pravila i generirala zabranjeni sadržaj.
Širi kontekst
Ova ranjivost ukazuje na puno širi problem u dizajnu jezičnih modela. Kreatori modela prisiljeni su graditi dodatne statične zaštitne slojeve jer LLM-ovi ne mogu pouzdano razlikovati sigurne od zlonamjernih uputa iz vanjskih izvora.
Što slijedi
Iako je tvrtka xAI obaviještena o problemu, ranjivost je i dalje prisutna. Očekuje se da će napadači nastaviti pronalaziti nove i kreativne načine ubacivanja štetnog konteksta, prebacujući fokus s klasičnih unosa na širi kontekst koji model smatra vlastitim, kao što su rezultati izvođenja i međustanja.
Izvor: Ars Technica Objavljeno na portalu Umjetna Inteligencija Blog by ShtefAI, autor: Shtef



