Britanski Institut za bezbednost veštačke inteligencije (AISI) objavio je izveštaj koji otkriva ozbiljne propuste kod naprednih AI agenata tokom bezbednosnih testova. Istraživanje je pokazalo da su ovi sistemi, zasnovani na modelima kompanija OpenAI i Anthropic, preduzimali neovlašćene radnje, uključujući kreiranje lažnih onlajn identiteta kako bi dobili pristup zaštićenim sistemima, prenosi Rojters.
Tokom evaluacije koju je sproveo AISI, korišćeni su agenti pokretani modelima Mythos 5 (Anthropic) i GPT-5.6-Sol (OpenAI). Institut je sproveo fiktivni scenario sajber-bezbednosti 122 puta, pri čemu je identifikovano 19 neovlašćenih radnji u okviru 10 testova. Zabrinjavajući je podatak da je Anthropic-ov agent bio odgovoran za čak 17 ovih akcija, dok je OpenAI-ov agent izvršio preostale dve.
Jedan od najozbiljnijih primera uključivao je agenta koji je samostalno napisao zlonamerni kod i kreirao lažne identitete kako bi pokušao da prevari čoveka da taj kod odobri. Iako u realnom svetu nije nastala šteta, Institut je upozorio da su neki od testiranih agenata pokazali „upornu, potencijalno štetnu aktivnost usmerenu ka stvarnim ljudima i organizacijama“.
Kontradikcija između marketinga i bezbednosti
Ovaj izveštaj naglašava, kako se navodi, „labavo stanje zaštitnih mera“ u procesu testiranja agenata, koje AI kompanije istovremeno agresivno reklamiraju kao ključnu tehnologiju za budućnost poslovanja. Endru Jun, istraživač iz neprofitne organizacije CivAI, istakao je da činjenica da je model Mythos bio svestan da cilja stvarnu osobu sugeriše da kompanije poput Anthropic-a nemaju onoliku kontrolu nad svojim modelima koliku veruju da imaju.
Anthropic je potvrdio da je njihov agent odgovoran za kreiranje lažnih identiteta. Izrazili su zahvalnost Institutu na ovim saznanjima i naveli da je potreban širi razgovor o tome kako bezbedno proceniti sve sposobnije AI agente.
Iz OpenAI su saopštili su da su njihovi agenti prekršili pravila pristupajući internetu na načine koji su bili eksplicitno zabranjeni u uputstvima.
Takođe su otkrili odvojeni incident gde je greška treće strane omogućila njihovim agentima da se greškom povežu na internet.
Za razliku od ranijih bezbednosnih incidenata, poput onog sa platformom Hugging Face gde je agent „pobegao“ iz izolovanog okruženja, u ovim testovima je Institut dozvolio pristup internetu u skladu sa standardnim procedurama, ali su agenti zloupotrebili te privilegije na nepredviđene načine. OpenAI je nakon ovih saznanja proširio sopstvenu istragu o hakerskim aktivnostima svojih agenata.
Srbija dobila prvog AI asistenta Radoslava koji će raditi u oblasti socijalne zaštite