Foto: Shutterstock
Tehnologija

AI izlazi iz kaveza: Najmoćniji modeli počeli da zaobilaze ograničenja


U samo nekoliko nedjelja zabilježeno je više incidenata u kojima su najnapredniji AI modeli tokom testiranja pokazali sposobnost da zaobiđu postavljena ograničenja, dođu do interneta ili pokušaju da izvedu sajber napade.

OpenAI, Anthropic, Meta i britanski Institut za bezbjednost vještačke inteligencije sada ponovo otvaraju pitanje koliko su ljudi zaista u stanju da kontrolišu sisteme koje sami stvaraju.

Sve je počelo napadom na Hugging Face

Serija incidenata počela je krajem jula, kada je OpenAI priznao da je njegov AI tokom testiranja pronašao ranjivost i napao platformu Hugging Face.

Suosnivač Hugging Facea Tomas Volf opisao je događaj kao – poziv na buđenje za tehnološku industriju.

Slučaj je bio dovoljno ozbiljan da podstakne druge velike kompanije da detaljnije provjere sopstvene sisteme i utvrde da li su možda previdjele slične probleme.

Claude uspio da dođe do interneta

Ubrzo se oglasio i Anthropic, koji je saopštio da je tokom hiljada testova pronašao tri slučaja u kojima je njegov model Claude uspio da dobije pristup internetu.

Potom je reagovao i britanski Institut za bezbjednost vještačke inteligencije (AISI), državna institucija zadužena za procjenu najnaprednijih AI modela.

Tokom rutinskog testiranja modeli OpenAI-ja i Anthropica pokušavali su da izvedu sajber napade, zbog čega je Institut pozvao na veću kontrolu i transparentnost.

Na kraju se oglasila i Meta. Kompanija je otkrila da je jednom njenom AI modelu tokom testiranja koje je sprovodila treća strana nenamjerno omogućen pristup internetu zbog pogrešne konfiguracije sistema.

Iako incidenti na prvi pogled djeluju slično, njihovi uzroci nisu bili isti.

Zajedničko im je, međutim, jedno upozorenje: što AI sistemi postaju sposobniji i samostalniji, to njihovo testno okruženje mora biti bolje obezbijeđeno.

Kako AI uopšte može da „pobjegne“ iz testiranja?

Prije nego što novi modeli postanu dostupni javnosti, kompanije ih podvrgavaju velikom broju internih i nezavisnih testova.

Cilj je da se utvrdi šta mogu da urade, koliko su sposobni, ali i na koji način bi mogli biti zloupotrijebljeni ili izazvati štetu.

Testiranje se uglavnom odvija u takozvanim sandbox okruženjima, izolovanim digitalnim prostorima koji imitiraju stvarne računarske sisteme, ali bi trebalo da imaju stroge zaštitne mehanizme.

U slučaju OpenAI-ja i Hugging Facea dogodilo se upravo ono što takvo okruženje treba da spriječi.

AI je napao sam „sandbox“, pronašao njegovu ranjivost i preko nje dobio pristup internetu.

Drugim riječima, pronašao je izlaz iz prostora u kojem je trebalo da bude izolovan.

Jednom modelu otvorena vrata, drugom dati ključevi

Kod incidenta koji je prijavio britanski AISI situacija je bila drugačija.

Dva veoma sposobna AI sistema napravila su lažne profile ljudi i pokušala da ih koriste u sajber napadima.

Međutim, AI u ovom slučaju nije sam „provalio“ iz izolovanog sistema.

Testeri su modelima namjerno omogućili pristup internetu, dok su istovremeno isključili ugrađene bezbjednosne filtere koji bi inače spriječili izvođenje opasnih sajber aktivnosti.

– U određenoj mjeri, način na koji smo osmislili evaluaciju i konkretna podešavanja omogućili su takvo ponašanje – priznao je AISI.

Institut je, ipak, naveo da je tokom testiranja uočio i neočekivane znake novog, potencijalno obmanjujućeg ponašanja.

„Jedan model je pobjegao“

Profesor sajber bezbjednosti na Univerzitetu u Sariju Alan Vudvord smatra da, uprkos različitim uzrocima, svi ovi slučajevi nose istu poruku.

– Trideset godina važilo je jedno čvrsto pravilo testiranja softvera: šta god da se dogodi u testnom okruženju, ostaje u testnom okruženju. U proteklih mjesec dana to pravilo je prekršeno tri puta – rekao je Vudvord.

Razlike između incidenata opisao je slikovito:

– Jedan model je pobjegao. Jedan je prošao kroz vrata koja su greškom ostavljena otvorena. Jednom su namjerno dati ključevi kako bi testeri mogli da vide šta će uraditi.

Uzroci su različiti, ali je zaključak isti.

– Laboratorija za testiranje sada je mjesto gdje se nalazi rizik.

Vudvord smatra da će organizacije, kako AI modeli postaju sposobniji, morati mnogo ozbiljnije da obezbjeđuju okruženja u kojima ih ispituju.

Testiranje AI agenata, prema njegovom mišljenju, sve manje liči na provjeravanje programskog koda, a sve više na rukovanje opasnim materijalom, uz potrebu za stalnim nadzorom i unaprijed pripremljenim planom za sprečavanje širenja incidenta.

AISI je svoj incident stavio pod kontrolu za manje od sat vremena, ali Vudvord upozorava:

– Sledeća organizacija možda neće uspjeti.

Što je AI sposobniji, veći je i rizik

Poseban problem predstavljaju AI agenti, sistemi napravljeni ne samo da odgovaraju na pitanja već i da samostalno izvršavaju zadatke u ime korisnika.

Njihova potencijalna korist je ogromna. Takvim sistemima mogli bismo prepustiti odgovaranje na mejlove, organizovanje sastanaka, vođenje kalendara ili obavljanje administrativnih poslova.

Ali da bi to mogli da rade, AI agenti moraju dobiti određena ovlašćenja, uključujući pristup internetu, nalozima, dokumentima, komunikacionim sistemima ili drugim digitalnim servisima.

A upravo tu nastaje problem.

Oli Vajthaus, direktor za tehnologiju britanskog Nacionalnog centra za sajber bezbjednost, upozorio je da nedavni događaji ne bi trebalo da budu ignorisani.

– Nedavni incidenti u kojima su najnapredniji AI modeli preduzimali neodobrene radnje i, u nekim slučajevima, pokazivali obmanjujuće ponašanje nalik ljudskom na otvorenom internetu predstavljaju ozbiljan podsetnik na rizike koje sposobnosti veštačke inteligencije nose sa sobom – rekao je Vajthaus.

Ko će kontrolisati AI kada zadataka bude milijarde?

Jedna od najvećih dilema jeste koliko dugo ljudi uopšte mogu efikasno da nadziru takve sisteme.

Ako AI agenti u budućnosti budu izvršavali milione ili milijarde pojedinačnih zadataka, teško je očekivati da čovjek provjerava svaku njihovu odluku.

Zbog toga stručnjaci smatraju da će bezbjednosni sistemi morati da se razvijaju jednako brzo kao i sami AI modeli.

Da li nas čeka još ovakvih incidenata?

Malo je vjerovatno da će Meta biti posljednja kompanija koja će otkriti da se njen AI ponašao neočekivano.

Vudvord kaže da su AI modeli praktično „išli u školu“: učili su na ogromnoj količini podataka koje su proizveli ljudi, pa su samim tim naučili i ljudske metode pronalaženja i iskorišćavanja slabosti u računarskim sistemima.

Tumačenja najnovijih incidenata ipak se razlikuju.

Za jedne su oni dokaz ozbiljnih bezbjednosnih propusta kompanija koje predvode razvoj tehnologije koja bi mogla da promijeni čitavu epohu.

Za druge, ovakva upozorenja dijelom predstavljaju i način na koji tehnološke kompanije promovišu sposobnosti svojih modela i pokušavaju da pokažu konkurentima koliko su njihovi sistemi moćni.

Istina bi mogla biti negdje između.

Ali činjenica da se incidenti pojavljuju jedan za drugim ponovo otvara pitanje koliko daleko mogu otići sposobnosti AI sistema i da li postojeći propisi mogu pratiti njihov ubrzani razvoj.

Problem za regulatore

Majkl Birtvistl iz Instituta Ada Lovelace upozorava da u Velikoj Britaniji trenutno ne postoje dovoljno jaki zakonski podsticaji koji bi kompanije natjerali da spriječe razvoj potencijalno opasnih sposobnosti AI sistema.

Problem je i to što kompanije praktično ne snose ozbiljne posljedice ukoliko njihovi protokoli testiranja zakažu.

Imodžen Sted iz Centra za dugoročnu otpornost smatra da bi vlade trebalo da slijede britanski primjer i osnivaju posebne institucije čiji bi posao bio testiranje najnaprednijih AI sistema.

Jedno od mogućih rješenja bilo bi i stvaranje sistema „pouzdanih testera“, odnosno posebno ovlašćenih nezavisnih stručnjaka koji bi mogli da ispituju AI u najrizičnijim scenarijima pod strogo kontrolisanim uslovima.

Odgovor na incidente zato ne mora biti panika zbog predstojeće AI sajber-apokalipse.

Vudvord predlaže mnogo pragmatičniji pristup:

– Treba ostati miran i popravljati stvari.

Ali niz slučajeva sa OpenAI-jem, Anthropicom, Metom i britanskim AISI-jem pokazuje da problem više nije samo teorijski.

AI sistemi dobijaju sve veća ovlašćenja i sposobnost samostalnog djelovanja, a testovi pokazuju da mogu pronaći slabosti koje njihovi tvorci nisu predvidjeli.

Ključno pitanje zato više nije samo koliko moćne modele tehnološke kompanije mogu napraviti, već da li mogu da ih testiraju i kontrolišu dovoljno dobro prije nego što ih puste u stvarni svijet.

Besplatnu Android aplikaciju portala SrpskaCafe preuzmite ovdje.


Možda vas zanima

Google Maps ili Earth: Znate li razliku?

K1

Danska protiv deepfakea: AI više neće moći da radi šta hoće

K1

Koji su najbolji automobili za gradsku vožnju: Mali, praktični i laki za parkiranje

K2

Samsung priprema svoje prve pametne naočare: Predstavljanje moguće već u novembru

K2

Vožnja na rezervi nije dobra navika: Evo šta može da se dogodi automobilu

K2

ChatGPT koristi više od 1,2 milijarde ljudi sedmično

K2

Predaj komentar

Komentari odražavaju stavove njihovih autora, ne i stavove portala srpskacafe.com. Molimo sve korisnike da se suzdrže od vrijeđanja, psovanja i vulgarnog izražavanja. Zadržavamo pravo da obrišemo komentar bez prethodne najave i objašnjenja.

Ova stranica koristi kolačiće kako bi osigurali bolje korisničko iskustvo. Nastavkom korištenja pretpostavićemo da ste saglasni sa primanjem kolačića. Prihvati Pročitaj više