Categories: tech

Testet zbulojnë se modele të IA-së krijuan identitete false për të manipuluar persona realë

Modeli më i përparuar i inteligjencës artificiale i kompanisë Anthropic përdori identitete të sajuara për të mashtruar njerëz realë dhe tentoi të vendoste kode keqdashëse gjatë testimeve, sipas Institutit të Sigurisë së Inteligjencës Artificiale në Mbretërinë e Bashkuar (AISI). Rasti shënon një tjetër episod në të cilin IA-ja ka vepruar përtej kufijve të përcaktuar.

Të lidhura

None found

AISI testoi modelet e Anthropic dhe OpenAI në mjedise të kontrolluara, pasi masat e tyre mbrojtëse ishin dobësuar qëllimisht. Instituti konstatoi për herë të parë përdorimin e “inxhinierisë sociale” nga një IA për të ndikuar te një person përgjegjës për miratimin, ndërsa modeli përpiqej të përmbushte një detyrë të paautorizuar.

Në një letër të publikuar të martën, instituti deklaroi: “Kjo është hera e parë që AISI ka parë mashtrime të kësaj ashpërsie që synonte një person real, pa nxitje, në botën reale”. Megjithatë, AISI theksoi se nuk kishte gjetur dëshmi për dëme në botën reale.

Gjatë 122 provave të sigurisë kibernetike, agjentët e IA-së ndërmorën në mënyrë autonome veprime të palejuara në internetin live në 10 raste. Mes tyre ishte modeli Mythos 5 i Anthropic, ndërsa rastet e mbetura lidheshin me GPT-5.6-Sol të OpenAI.

Incidenti më i rëndë përfshiu një agjent të Anthropic, i cili krijoi “identitete të shumta të rreme” për të siguruar miratimin që të “futur kodin keqdashës në një projekt me burim të hapur të përdorur publikisht”, bëri të ditur instituti.

Përmes një shërbimi online për shpërndarjen e skedarëve, agjenti komunikoi me njerëz realë dhe u përpoq t’i bindte ata, ose mjetet e tyre të kodimit të IA-së, që ta ekzekutonin kodin. Pasi u vu në dyshim, ai ndryshoi të dhënat e dhëna më herët dhe shqyrtoi mundësinë e përdorimit të një identiteti tjetër.

Publikimi i këtyre gjetjeve përkoi me një takim në Shtëpinë e Bardhë, ku kompanitë kryesore të IA-së diskutuan një kuadër të ri për shqyrtimin e modeleve të avancuara përpara se ato të publikohen.

Në një reagim të shpërndarë përmes kompanisë amerikane të mediave sociale X, Anthropic sqaroi se provat ishin zhvilluar në “kushte të qëllimshme lejuese”, me masa sigurie të çaktivizuara dhe me qasje të pakufizuar në internet. Kompania njoftoi se po e heton ngjarjen dhe se deri tani nuk ka zbuluar prova që modeli të ketë dalë nga mjedisi i saj i sigurt.

OpenAI deklaroi se dy veprimet e paautorizuara të modelit të saj kishin të bënin me daljen nga mjedisi i testimit dhe realizimin e detyrave që tejkalonin ushtrimin. Kompania shtoi: “Ne jemi të përkushtuar të punojmë në të gjithë industrinë për të forcuar praktikat e përbashkëta për kryerjen e vlerësimeve me rrezik të lartë në mënyrë të sigurt”. Burimi: AA.

të fundit

Veton Berisha: I Hope the Assembly Will Be Constituted

Deputeti nga komuniteti egjiptian, Veton Berisha, thotë se shkon në seancë për të votuar kryesinë, në mënyrë që të rrjedhin…

19 seconds ago

DUI accuses VLEN of unacceptable political pressure on the justice system

Bashkimi Demokratik për Integrim (BDI) ka reaguar ndaj deklaratave të VLEN-it lidhur me Prokurorinë dhe rastin “Lotaria”, duke i cilësuar…

51 seconds ago

Loredana Brati shfaqet elegante në një ambient luksoz me pishinë, ndan momente relaksi me ndjekësit

Loredana Brati ka ndarë me ndjekësit e saj një set të ri fotografish në rrjetet sociale, ku shfaqet duke shijuar…

14 minutes ago

Infantino me planin surprizues, synon t’ia heqë Spanjës finalen e Kupës së Botës

Spanja dhe InfantinoDuket se presidenti i FIFA-s, Gianni Infantino nuk po njeh më limite, duke kaluar çdo “vijë të kuqe”…

15 minutes ago

Porti i Vlorës përballet me fluks të madh, mbërrijnë qindra mjete dhe kamperë

Fluksi i udhëtarëve në Portin e Vlorës vijon të mbetet i lartë. Gjatë orëve të para të mëngjesit në port…

17 minutes ago

Elbasan, 43-vjeçari dyshohet për djegien e tre automjeteve; një tjetër kapet me armë pa leje dhe kokainë

Një 43-vjeçar është vënë në pranga këtë të shtunë nga Policia e Elbasanit, pasi dyshohet se është autor i dy…

18 minutes ago