AI vijesti4 min čitanja

OpenAI predstavlja GPT-Red za kibernetičku sigurnost

Novi model djeluje kao super-haker za automatizirano pronalaženje sigurnosnih propusta i obranu drugih AI sustava.

S

Autor

Shtef

Objavljeno

Ilustracija kibernetičke sigurnosti i umjetne inteligencije

OpenAI predstavlja GPT-Red za kibernetičku sigurnost

Model dizajniran kao super-haker za obranu drugih AI sustava

OpenAI je razvio novi jezični model pod nazivom GPT-Red koji služi kao partner u treningu za obranu drugih modela od kibernetičkih napada. Ovaj inovativni sustav automatizira sigurnosno testiranje i pomaže u pronalaženju ranjivosti prije izlaska konačnih verzija softvera.

Ključni detalji

Novi model djeluje kao "super-haker" koji kroz proces takozvanog "red-teaminga" traži načine za probijanje ili preuzimanje kontrole nad sustavom. OpenAI je koristio GPT-Red za poboljšanje sigurnosti svoje najnovije verzije, GPT-5.6, tvrdeći da je ovo njihovo najsigurnije izdanje do sada.

Zašto je to važno

Kako jezični modeli postaju složeniji i koriste se kao agenti koji mogu komunicirati s datotekama, web stranicama i drugim kodovima, ljudskim timovima je sve teže pratiti sve vrste potencijalnih napada. Automatizacija ovog procesa ključna je za skaliranje sigurnosti u brzorastućem AI ekosustavu.

Tehnička pozadina

  • GPT-Red koristi takozvanu "self-play" petlju u kojoj uči napadati druge modele dok se oni pokušavaju obraniti, čime obje strane postaju naprednije.
  • Model je posebno učinkovit u otkrivanju "prompt injection" napada, gdje hakeri pokušavaju natjerati model na nepoželjne radnje skrivanjem uputa u tekstu ili kodu.
  • OpenAI je otkrio novu vrstu napada nazvanu "fake chain of thought", gdje GPT-Red ubacuje lažni unos u misli drugog modela kako bi ga prevario.

Širi kontekst

Ovaj pristup pokazuje značajan pomak u industriji jer se za obranu najmoćnijih AI sustava sada koriste podjednako napredni AI alati. Iako GPT-Red trenutačno bilježi uspjehe u simulacijama, ljudski stručnjaci i dalje su neophodni za prepoznavanje napada koji uključuju dugu konverzaciju ili korištenje slika, s kojima se model još uvijek bori.

Što slijedi

OpenAI ne planira objaviti GPT-Red široj javnosti zbog očitih sigurnosnih rizika, ali će ga nastaviti koristiti interno. Očekuje se da će i druge vodeće AI tvrtke usvojiti slične metode automatiziranog sigurnosnog testiranja kako bi osigurale svoje modele.


Izvor: MIT Technology Review Objavljeno na portalu Umjetna Inteligencija Blog by ShtefAI, autor: Shtef

Povezano

Pročitajte i ovo

Još nekoliko objava koje šire kontekst oko tema, kompanija i AI trendova iz ove priče.

Ilustracija AI agenata i poslovne primjene
Analiza

AI agenti u 2026. godini: Od velikih obećanja do stvarne primjene

Analiza zašto općenamjenski AI agenti još uvijek nisu spremni za poslovnu primjenu. Prava vrijednost dolazi iz usko specijaliziranih alata pod ljudskim nadzorom.

Ilustracija tehnološkog balona i stabilizacije industrije umjetne inteligencije
Analiza

Generativna umjetna inteligencija: Kraj balona ili novi početak?

Zašto je trenutno usporavanje AI industrije zapravo najbolja stvar koja se mogla dogoditi tržištu i korisnicima.

Ilustracija zdravstvenih podataka integriranih u ChatGPT sučelje
AI vijesti

OpenAI lansirao Health integraciju unutar ChatGPT-a

OpenAI je za korisnike u SAD-u uveo značajku Health u ChatGPT koja omogućuje sigurno povezivanje Apple Healtha i medicinskih kartona za personalizirane savjete.