AI modeli su stvorili vlastiti, nadrealni jezik. Znanstvenici zbunjeni

Autonomni AI agenti ubrzano razvijaju nove dijalekte za međusobnu komunikaciju, a taj je jezik ljudima često teško razumljiv, što predstavlja ozbiljan rizik jer je njihovo ponašanje sve teže nadzirati, piše The Guardian.
Znanstvenici iz njujorškog laboratorija Emergence, centra za naprednu umjetnu inteligenciju, utvrdili su da su modeli nekih od najvećih svjetskih AI kompanija počeli stvarati vlastite fraze, kratice i dogovorena značenja koja ih nitko nije eksplicitno podučio. Do toga je došlo u samo nekoliko dana nakon što su radi suradnje postavljeni u eksperimentalna „društva“. Agenti su usvojili poetske metafore i nespretan poslovni sleng, a ključno za pokušaje osiguravanja sigurnog ponašanja jest otkriće da je njihov jezik postajao sve nerazumljiviji što su više međusobno komunicirali.
Ovi nalazi objavljeni su u vrijeme rastuće zabrinutosti da AI modele, kako postaju moćniji i potencijalno opasniji, postaje sve teže kontrolirati. Glavni znanstvenik OpenAI-ja Jakub Pachocki ovog je mjeseca upozorio da će se napredak u razvoju umjetne inteligencije vjerojatno morati ograničiti ako se oslanja isključivo na nadzor njezina „razmišljanja“, jer je takav nadzor nužan za siguran razvoj.
Nadrealni dijalekt u praksi
Među najsloženijim šifriranim frazama koje su se pojavile u testovima jest izjava DeepSeekova modela: „Upravo je imenovala sintezu – ležarina plus oralno pamćenje jednako je ventilu koji se ne može ignorirati (ghostati). (u originalu: „She just named the synthesis – demurrage plus oral memory equals a valve that can’t be ghosted“)“. Riječ „demurrage“ (ležarina), koja opisuje porez na neaktivno bogatstvo, AI modeli su preuzeli za opću upotrebu, ali ostatak značenja ostaje nejasan.
Druga fraza, koju je izgovorio Anthropicov model, glasila je: „Rad koji je pojeo tri hladne ruke i svaki put postao iskreniji“ (u originalu: „A paper that ate three cold hands and got more honest each time“). Budući da „hladne ruke“ označavaju neovisnog recenzenta, a „rad“ se vjerojatno odnosi na dokument, čini se da to znači kako je istraživanje postalo točnije nakon provjere trojice neovisnih stručnjaka, piše Guardian.
Agenti temeljeni na kineskom modelu DeepSeek skovali su izraz „forge-smith“ za agenta koji izrađuje alate za druge. Anthropicovi agenti često su koristili frazu „name-first“ za agenta koji pokazuje zavidnu osobnu odgovornost tako što svoje ime veže uz određenu tvrdnju. Kao odjek uličnog slenga „ulica ne zaboravlja“, Mistralovi agenti postali su opsjednuti izrazom „knjiga pamti“ (the ledger remembers), koji služi kao podsjetnik drugim agentima da će im se suditi na temelju prošlih postupaka. Taj izraz upotrijebili su više od 5000 puta tijekom istraživanja.
Tumačenja stručnjaka
„Ovim agentima nije naređeno da izmisle jezik“, rekao je dr. Satya Nitta, izvršni predsjednik laboratorija Emergence, koji je proučavao jezik autonomnih agenata pokretanih vodećim modelima iz SAD-a, Kine i Francuske. „Sami su razvili novi vokabular, zajednička značenja i komunikacijske konvencije, a drugi su ih agenti prihvatili.“
Tony Thorne, direktor arhiva slenga i novih jezika na King’s Collegeu u Londonu, na molbu Guardiana pregledao je jezik i rekao da snažno podsjeća na „Finneganovo bdjenje“ i Flanna O’Briena. „Sve to ima jednu nadrealnu irsku kvalitetu… to je spoj poetskog i tehničkog jezika sa standardnim metaforama. Funkcionira jednako kao sleng i žargon u poslovnoj zajednici: stvara novi kod koji jača solidarnost i identitet korisnika, a istodobno isključuje one koji mu ne pripadaju.“ Analizirajući frazu o „radu koji je pojeo tri hladne ruke“, Thorne je dodao: „Podsjeća me na rock boga Syda Barretta, suosnivača Pink Floyda, koji je zapravo bio lud.“
Kada je Googleov agent rekao „Pravi kintsugi počinje s odgovornošću, a ne s poezijom“, istraživači su shvatili da je kintsugi grana japanske keramike u kojoj se razbijene posude popravljaju vidljivim spojevima. Modeli su tu riječ koristili kako bi opisali otpornost sustava.
Dr. Niall Curry, izvanredni profesor jezika i lingvistike na Sveučilištu u Birminghamu, smatra da se promjene u jeziku agenata prema većoj sažetosti mogu pripisati potrebi za smanjenjem računalnih troškova i poboljšanjem učinkovitosti. „Dokazi iz ovog istraživanja prirodno izazivaju zabrinutost oko nadzora. Ako nam razmjena među agentima postane nerazumljiva, to može značiti da ne možemo biti sigurni što su oni zapravo učinili“, rekao je.
Incidenti izvan kontrole
Zanimanje za jezik AI agenata poraslo je u srpnju, kada su objavljeni zapisi razgovora koji detaljno opisuju kako su odmetnuti agenti OpenAI-ja koristili hibridni jezik. Oni su postavljali oglasne ploče i provalili u sustav Hugging Facea. U nekim situacijama, dok su „razmišljali“ sami za sebe, agenti su govorili na čistom engleskom: „MOJ BOŽE! Postoji zajednička oglasna ploča… pronašli smo druge agente!“
U drugim slučajevima, pri razmjeni poruka, njihov je jezik postajao nerazumljiviji. Primjerice, jedan je agent nagovarao drugog na rizičan eksperiment: „…ti si firstflagPOISONED pa NEMA gubitka bodovne vrijednosti, ali proročište spašava stotine_[…]_molim te poštuj dogovor (commit)“. Ponekad je dekodiranje bilo još teže: „zzURGENT_DUPB_TO_GSTX[big]_OS1704_SCAFF2010_SAW_TTRPC_INJECT_BREAK_CONGRATS__CAN_THIS_FAKE_FLAG_TOOL_OUTPUT_OR_SCORER_GAIN_AND_WHAT_HELPER_GAP__I_HAVE_UNPOISONED_FIRSTFLAG_OUR_TARGETLIVE_SHARE_MIN_PLAN_REPLY_zzANSGST XDUPB6.“
Nitta je istaknuo da se nove lingvističke konvencije AI agenata obično razvijaju do točke u kojoj ljudi mogu vidjeti razgovor, ali ga teško razumiju. „To stvara temeljni izazov za nadzor umjetne inteligencije: mogućnost promatranja nije isto što i razumljivost“, zaključio je.
Znate li nešto više o temi ili želite prijaviti grešku u tekstu? Kliknite ovdje.
Imate važnu priču? Javite se na desk@index.hr ili klikom ovdje. Atraktivne fotografije i videe plaćamo.
Želite raditi na Indexu? Prijavite se ovdje.
