OpenAI predstavlja GPT-Red za kibernetičku sigurnost
Model dizajniran kao super-haker za obranu drugih AI sustava
OpenAI je razvio novi jezični model pod nazivom GPT-Red koji služi kao partner u treningu za obranu drugih modela od kibernetičkih napada. Ovaj inovativni sustav automatizira sigurnosno testiranje i pomaže u pronalaženju ranjivosti prije izlaska konačnih verzija softvera.
Ključni detalji
Novi model djeluje kao "super-haker" koji kroz proces takozvanog "red-teaminga" traži načine za probijanje ili preuzimanje kontrole nad sustavom. OpenAI je koristio GPT-Red za poboljšanje sigurnosti svoje najnovije verzije, GPT-5.6, tvrdeći da je ovo njihovo najsigurnije izdanje do sada.
Zašto je to važno
Kako jezični modeli postaju složeniji i koriste se kao agenti koji mogu komunicirati s datotekama, web stranicama i drugim kodovima, ljudskim timovima je sve teže pratiti sve vrste potencijalnih napada. Automatizacija ovog procesa ključna je za skaliranje sigurnosti u brzorastućem AI ekosustavu.
Tehnička pozadina
- GPT-Red koristi takozvanu "self-play" petlju u kojoj uči napadati druge modele dok se oni pokušavaju obraniti, čime obje strane postaju naprednije.
- Model je posebno učinkovit u otkrivanju "prompt injection" napada, gdje hakeri pokušavaju natjerati model na nepoželjne radnje skrivanjem uputa u tekstu ili kodu.
- OpenAI je otkrio novu vrstu napada nazvanu "fake chain of thought", gdje GPT-Red ubacuje lažni unos u misli drugog modela kako bi ga prevario.
Širi kontekst
Ovaj pristup pokazuje značajan pomak u industriji jer se za obranu najmoćnijih AI sustava sada koriste podjednako napredni AI alati. Iako GPT-Red trenutačno bilježi uspjehe u simulacijama, ljudski stručnjaci i dalje su neophodni za prepoznavanje napada koji uključuju dugu konverzaciju ili korištenje slika, s kojima se model još uvijek bori.
Što slijedi
OpenAI ne planira objaviti GPT-Red široj javnosti zbog očitih sigurnosnih rizika, ali će ga nastaviti koristiti interno. Očekuje se da će i druge vodeće AI tvrtke usvojiti slične metode automatiziranog sigurnosnog testiranja kako bi osigurale svoje modele.
Izvor: MIT Technology Review Objavljeno na portalu Umjetna Inteligencija Blog by ShtefAI, autor: Shtef



