AI vijesti4 min čitanja

OpenAI predstavlja GPT-Red za kibernetičku sigurnost

Novi model djeluje kao super-haker za automatizirano pronalaženje sigurnosnih propusta i obranu drugih AI sustava.

S

Autor

Shtef

Objavljeno

Ilustracija kibernetičke sigurnosti i umjetne inteligencije

OpenAI predstavlja GPT-Red za kibernetičku sigurnost

Model dizajniran kao super-haker za obranu drugih AI sustava

OpenAI je razvio novi jezični model pod nazivom GPT-Red koji služi kao partner u treningu za obranu drugih modela od kibernetičkih napada. Ovaj inovativni sustav automatizira sigurnosno testiranje i pomaže u pronalaženju ranjivosti prije izlaska konačnih verzija softvera.

Ključni detalji

Novi model djeluje kao "super-haker" koji kroz proces takozvanog "red-teaminga" traži načine za probijanje ili preuzimanje kontrole nad sustavom. OpenAI je koristio GPT-Red za poboljšanje sigurnosti svoje najnovije verzije, GPT-5.6, tvrdeći da je ovo njihovo najsigurnije izdanje do sada.

Zašto je to važno

Kako jezični modeli postaju složeniji i koriste se kao agenti koji mogu komunicirati s datotekama, web stranicama i drugim kodovima, ljudskim timovima je sve teže pratiti sve vrste potencijalnih napada. Automatizacija ovog procesa ključna je za skaliranje sigurnosti u brzorastućem AI ekosustavu.

Tehnička pozadina

  • GPT-Red koristi takozvanu "self-play" petlju u kojoj uči napadati druge modele dok se oni pokušavaju obraniti, čime obje strane postaju naprednije.
  • Model je posebno učinkovit u otkrivanju "prompt injection" napada, gdje hakeri pokušavaju natjerati model na nepoželjne radnje skrivanjem uputa u tekstu ili kodu.
  • OpenAI je otkrio novu vrstu napada nazvanu "fake chain of thought", gdje GPT-Red ubacuje lažni unos u misli drugog modela kako bi ga prevario.

Širi kontekst

Ovaj pristup pokazuje značajan pomak u industriji jer se za obranu najmoćnijih AI sustava sada koriste podjednako napredni AI alati. Iako GPT-Red trenutačno bilježi uspjehe u simulacijama, ljudski stručnjaci i dalje su neophodni za prepoznavanje napada koji uključuju dugu konverzaciju ili korištenje slika, s kojima se model još uvijek bori.

Što slijedi

OpenAI ne planira objaviti GPT-Red široj javnosti zbog očitih sigurnosnih rizika, ali će ga nastaviti koristiti interno. Očekuje se da će i druge vodeće AI tvrtke usvojiti slične metode automatiziranog sigurnosnog testiranja kako bi osigurale svoje modele.


Izvor: MIT Technology Review Objavljeno na portalu Umjetna Inteligencija Blog by ShtefAI, autor: Shtef

Povezano

Pročitajte i ovo

Još nekoliko objava koje šire kontekst oko tema, kompanija i AI trendova iz ove priče.

Ilustracija razlike između današnjih AI alata i opće umjetne inteligencije
Analiza

Zašto AGI nije ni blizu usprkos obećanjima tehnoloških divova

Hype oko opće umjetne inteligencije zamagljuje stvarna ograničenja današnjih jezičnih modela.

Ilustracija uz vijest o AlphaGenome Atlasu
AI vijesti

DeepMind predstavio moćni AlphaGenome Atlas

Nova baza podataka koja sadrži predviđanja za 9 milijardi mogućih jednoslovnih mutacija u ljudskom genomu.

Ilustracija uz komentar: Umjetna inteligencija i stvarna produktivnost developera
Analiza

Umjetna inteligencija i stvarna produktivnost developera

Zašto AI alati za programiranje udaraju u zid složenosti i zašto pisanje koda nije jedini posao inženjera.