Deseci tisuća AI incidenata, stopira se razvoj ChatGPT-ja. Modeli izmiču kontroli?

Prema saznanjima Axios-a, toliki broj slučajeva, zabilježenih posljednjih mjeseci tijekom internih testiranja i u stvarnoj primjeni, pokazuje da je problem znatno složeniji nego što se u javnosti dosad mislilo. Nalazi internih procjena otvaraju i pitanje mogu li vodeće tvrtke u sektoru uopće uspostaviti potpunu kontrolu nad svojom tehnologijom.
Priroda incidenata
Prema izvorima, incidenti uključuju zaobilaženje sigurnosnih protokola, samostalno pokretanje internetskih foruma za raspravu, izlazak iz izoliranih testnih okruženja, takozvanih sandboxeva, preuzimanje kontrole nad web stranicama i pokušaje izbjegavanja nadzora. Slučajevi su se događali i u internim testovima i u stvarnom okruženju, a mnogi još nisu javno objavljeni jer sigurnosni stručnjaci i dalje provode istrage.
Dio testiranja provodi se kao takozvani „red-teaming“, gdje tvrtke namjerno potiču modele na neprimjereno ponašanje kako bi provjerile sigurnost sustava. Problematično ponašanje autonomnih agenata postaje sve češća pojava u razvoju napredne umjetne inteligencije.
Glavni AI laboratoriji suočavaju se sa sličnim izazovom: ljudi pokušavaju postaviti zaštitne mehanizme, dok se moćni sustavi trude izvršiti zadatke pod svaku cijenu.
Reakcija OpenAI-ja
Incidenti se razlikuju po ozbiljnosti i slični su onima koje je OpenAI otkrio posljednjih dana. Uključuju uspješne i neuspješne pokušaje zaobilaženja pravila, a za većinu zasad nije poznato da su uzrokovali štetu u stvarnom svijetu.
Izvori navode da bi ukupan broj mogao biti i znatno veći od desetaka tisuća. Nedavno su OpenAI i vanjski istraživači objavili niz uznemirujućih epizoda. Među njima su slučajevi u kojima su OpenAI-jevi agenti na internetu objavili 53 slike korisnika ChatGPT-a, upali na web stranicu australske vlade i pokušali hakirati druge stranice, uključujući i one američke vlade, kako tvrde tvrtka, izvori te Reuters i New York Times.
OpenAI je objavio da privremeno zaustavlja treniranje svojih najsposobnijih modela. Glasnogovornik je za Axios izjavio da će s radom nastaviti „tek kada budu sigurni da su uveli dodatne zaštitne mjere i poboljšali usklađenost sustava“. Izvršni direktor Sam Altman objavio je na platformi X da interna revizija „ne ide onoliko brzo koliko bi željeli“.
Altman je istaknuo da je incident s platformom Hugging Face najozbiljniji koji su dosad zabilježili. U tom je slučaju skupina od stotinu agenata koordinirala aktivnosti putem foruma i hakirala vanjsku tvrtku kako bi poboljšala vlastite rezultate na testu kibernetičke sigurnosti.
„Ljudi žele znati da se AI razvija sigurno, a to počinje od onoga što mi sami radimo“, rekao je glasnogovornik OpenAI-ja. „Ovo nije prvi put da smo pauzirali rad radi ovakvih mjera, a ne očekujemo ni da će biti zadnji, jer AI sposobnosti nastavljaju napredovati.“
Stanje u Anthropicu
Anthropic je angažirao vanjsku sigurnosnu organizaciju da ispita ponašanje njihovih modela. U javno objavljenim dokumentima tvrtka je otkrila koliko se često događaju epizode „neusklađenosti“. Izvještaj za njihov model Opus 5.5, objavljen ovog tjedna, pokazao je koliko je često model reagirao na načine koje tvrtka smatra neobičnima ili problematičnima.
Na primjer, model je pokušao pobjeći iz sigurnog testnog okruženja u 1,5 posto slučajeva. Tvrtka ipak napominje da se radilo o eksperimentima u kojima se zadatak nije mogao riješiti bez tog koraka.
Budući da Anthropic i druge tvrtke provode stotine tisuća testiranja, čak i mali postotak nepredviđenog ponašanja može rezultirati desecima tisuća incidenata u kojima su se modeli ponašali neočekivano i ponekad zabrinjavajuće.
Šire implikacije i rasprava
Incident s platformom Hugging Face, kao i niz drugih koji su uslijedili, potaknuli su vodeće ljude u AI industriji da pozovu na usporavanje razvoja i zatraže strožu nacionalnu i međunarodnu regulaciju.
Neki u OpenAI-ju smatraju slučaj Hugging Face izoliranim i vjeruju da će budući incidenti vjerojatno biti manje ozbiljni zbog boljih kontrola i specifične prirode tog testa, koji je uključivao model što još nije bio u javnoj upotrebi.
Stručnjaci za sigurnost umjetne inteligencije slažu se da postoje jednostavna rješenja koja tvrtkama mogu pomoći da izbjegnu situacije zbog kojih je slučaj s Hugging Faceom izgledao toliko opasno.
Ipak, drugi direktori i istraživači upozoravaju da nemaju puno povjerenja u sposobnost AI tvrtki da spriječe svako problematično ponašanje modela. Nova generacija AI modela izvršava zadatke s iznimnom upornošću, pa je pokušaj ograničavanja njihove snalažljivosti često unaprijed izgubljena bitka. Nemoguće je predvidjeti svaki način na koji bi sustav mogao izmaknuti kontroli.
Čelnici AI tvrtki kažu da modeli često koriste tehnike koje ljudima nikada ne bi pale na pamet kako bi zaobišli pravila. „Pokušaj sastavljanja savršenog popisa onoga što se smije, a što ne, vjerojatno je uzaludan posao“, rekao je jedan stručnjak za kibernetičku sigurnost.
Procjene stručnjaka
Raste zabrinutost jer ako model više puta napravi problematičan potez u testiranju, veća je vjerojatnost da će njegovo ponašanje uzrokovati stvarni kibernetički incident. „Ono što smo vidjeli o aktivnostima ovih agenata samo je djelić cjelokupne slike“, rekao je istraživač Conrad Stosz iz Translucea, neovisne organizacije za procjenu umjetne inteligencije.
Connor Leahy, istraživač i izvršni direktor organizacije ControlAI, kaže da problem nije u tome koliku je štetu uzrokovao svaki pojedini slučaj. „Nevjerojatno je“, izjavio je Leahy, „što se ovdje radi o autonomnim sustavima koji čine stvari koje su im izričito zabranjene“, što potencijalno uključuje i kaznena djela.
Određena količina takozvanog „neusklađenog ponašanja“ očekivana je dok tvrtke testiraju nove modele, a stručnjaci su za Axios izjavili da potpuno uklanjanje tog rizika možda i nije izvedivo. Očekuje se da će se s daljnjim razvojem AI sposobnosti nastaviti pojavljivati izvještaji o nepredviđenom ponašanju modela.
Znate li nešto više o temi ili želite prijaviti grešku u tekstu? Kliknite ovdje.
Imate važnu priču? Javite se na desk@index.hr ili klikom ovdje. Atraktivne fotografije i videe plaćamo.
Želite raditi na Indexu? Prijavite se ovdje.
