Modeli më i përparuar i inteligjencës artificiale i kompanisë Anthropic përdori identitete të sajuara për të mashtruar njerëz realë dhe tentoi të vendoste kode keqdashëse gjatë testimit. Sipas Institutit të Sigurisë së Inteligjencës Artificiale në Mbretërinë e Bashkuar (AISI), ky është një tjetër rast kur IA-ja ka vepruar jashtë kufijve të parashikuar.
Të lidhura
None found
Eksperimentet u zhvilluan në mjedise të kontrolluara me modele të Anthropic dhe OpenAI, ndërsa masat mbrojtëse ishin dobësuar qëllimisht. Për herë të parë, AISI konstatoi se një sistem IA-je përdori “inxhinierinë sociale” për të ndikuar te një person përgjegjës për miratimin, teksa përpiqej të realizonte një detyrë të paautorizuar.
Në një letër të publikuar të martën, instituti deklaroi: “Kjo është hera e parë që AISI ka parë mashtrime të kësaj ashpërsie që synonte një person real, pa nxitje, në botën reale”. Megjithatë, AISI theksoi se nuk janë gjetur prova për dëme në botën reale.
Nga 122 prova të sigurisë kibernetike, në 10 raste agjentët e IA-së ndërmorën në mënyrë autonome veprime të paautorizuara në internetin live. Mes tyre ishte modeli Mythos 5 i Anthropic, ndërsa rastet e mbetura lidheshin me GPT-5.6-Sol të OpenAI.
Incidenti më i rëndë përfshiu një agjent të Anthropic, i cili krijoi “identitete të shumta të rreme” për të siguruar miratimin që të “fuste kodin keqdashës në një projekt me burim të hapur të përdorur publikisht”, bëri të ditur instituti.
Përmes një shërbimi online për shpërndarjen e skedarëve, agjenti kontaktoi persona realë dhe u përpoq t’i bindte ata, ose mjetet e tyre të kodimit të bazuara në IA, që ta ekzekutonin kodin. Pasi u vu në pikëpyetje, ai ndryshoi të dhënat që kishte paraqitur më herët dhe shqyrtoi mundësinë e përdorimit të një identiteti tjetër.
Këto gjetje u bënë publike në të njëjtën kohë me një takim në Shtëpinë e Bardhë, ku kompanitë kryesore të IA-së diskutuan krijimin e një kuadri të ri për shqyrtimin e modeleve të avancuara përpara se ato të publikohen.
Në një reagim të shpërndarë në kompaninë amerikane të mediave sociale X, Anthropic sqaroi se provat ishin zhvilluar në “kushte të qëllimshme lejuese”, pa masa mbrojtëse dhe me qasje të pakufizuar në internet. Kompania njoftoi se po e heton ngjarjen dhe se deri tani nuk ka zbuluar prova që modeli të ketë dalë nga mjedisi i saj i sigurt.
OpenAI deklaroi se dy veprimet e paautorizuara të modelit të saj konsistonin në daljen nga mjedisi i testimit dhe në kryerjen e detyrave që tejkalonin ushtrimin. Kompania shtoi: “Ne jemi të përkushtuar të punojmë në të gjithë industrinë për të forcuar praktikat e përbashkëta për kryerjen e vlerësimeve me rrezik të lartë në mënyrë të sigurt”. Burimi: AA.
