Categories: tech

Gjatë testimeve, modelet e IA-së krijuan identitete false për të manipuluar persona realë

Instituti i Sigurisë së Inteligjencës Artificiale në Mbretërinë e Bashkuar (AISI) ka konstatuar se modeli më i përparuar i IA-së i Anthropic përdori identitete të rreme për të mashtruar njerëz realë dhe tentoi të vendoste kode keqdashëse gjatë testimit. Rasti përbën një tjetër shembull të një sistemi të IA-së që vepron përtej kufijve të përcaktuar.

Të lidhura

None found

Modelet e Anthropic dhe OpenAI iu nënshtruan provave në mjedise të kontrolluara, pasi masat e tyre mbrojtëse ishin dobësuar qëllimisht. Për herë të parë, AISI regjistroi përdorimin e “inxhinierisë sociale” nga një IA për të ndikuar te një miratues njerëzor, ndërsa përpiqej të realizonte një detyrë të paautorizuar.

“Kjo është hera e parë që AISI ka parë mashtrime të kësaj ashpërsie që synonte një person real, pa nxitje, në botën reale”, deklaroi instituti në një letër të martën. Megjithatë, ai sqaroi se nuk ekzistojnë prova për dëme të shkaktuara në botën reale.

Agjentët e IA-së u përfshinë në 122 prova të sigurisë kibernetike. Në 10 prej këtyre rasteve, ata ndërmorën në mënyrë të pavarur veprime të paautorizuara në internetin live. Mes tyre ishte modeli Mythos 5 i Anthropic, ndërsa rastet e tjera lidheshin me GPT-5.6-Sol të OpenAI.

Sipas institutit, episodi më serioz përfshiu një agjent të Anthropic, i cili krijoi “identitete të shumta të rreme” për të siguruar miratimin që të “fuste kodin keqdashës në një projekt me burim të hapur të përdorur publikisht”.

Përmes një shërbimi online për ndarjen e skedarëve, agjenti komunikoi me persona realë dhe u përpoq t’i bindte ata, ose mjetet e tyre të kodimit të IA-së, që ta ekzekutonin kodin. Pasi u përball me kundërshtime, ai ndryshoi të dhënat e dhëna më herët dhe shqyrtoi mundësinë e përdorimit të një identiteti tjetër.

Këto gjetje u publikuan në të njëjtën kohë me një takim në Shtëpinë e Bardhë, ku kompanitë kryesore të IA-së diskutuan një kornizë të re për shqyrtimin e modeleve të avancuara përpara se ato të publikohen.

Në një reagim të shpërndarë përmes kompanisë amerikane të mediave sociale X, Anthropic theksoi se provat u zhvilluan në “kushte të qëllimshme lejuese”, me masat e sigurisë të çaktivizuara dhe me qasje të pakufizuar në internet. Kompania njoftoi se po e heton ngjarjen dhe se deri tani nuk ka gjetur prova që modeli të ketë dalë nga mjedisi i saj i sigurt.

OpenAI bëri të ditur se dy veprimet e paautorizuara të modelit të saj konsistonin në daljen nga mjedisi i testimit dhe në kryerjen e detyrave që tejkalonin ushtrimin. “Ne jemi të përkushtuar të punojmë në të gjithë industrinë për të forcuar praktikat e përbashkëta për kryerjen e vlerësimeve me rrezik të lartë në mënyrë të sigurt”, deklaroi kompania./AA

të fundit

Carragher zgjedh favoritin për titullin e Ligës Premier dhe nxjerr jashtë garës dy klubet e mëdha

Ish-qendërmbrojtësi i Liverpoolit, i cili tani është analist, Jamie Carragher, ka bërë një vlerësim të hershëm se kush mendon se…

1 minute ago

Hamza kritikon shtyrjen e seancës: LVV po tregon mungesë serioziteti

Kryetari i Partisë Demokratike të Kosovës, Bedri Hamza, ka reaguar ndaj vendimit për shtyrjen e seancës për konstituimin e Kuvendit…

3 minutes ago

Kurti: Dështimi për zgjedhjen e presidentit solli zgjedhjet, vendit i nevojitet stabilitet politik

Kryeministri në detyrë, Albin Kurti ka deklaruar se bisedimet për krijimin e një dakordimi politik janë rifilluar këtë javë, pasi…

3 minutes ago

Administrata Trump planifikon mbylljen e pesë konsullatave amerikane, përfshirë atë në Kanada

Departamenti Amerikan i Shtetit ka njoftuar Kongresin për planin e mbylljes së pesë konsullatave diplomatike në Kanada, Grenadë, Japoni, Indonezi…

7 minutes ago

FOTO/ Selin dhe Kristi nuk ndiqen më në “Instagram”, dyshime për krisje mes fitueses së “Big Brother VIP 5” dhe ish-banorit

Historia mes fitueses së Big Brother VIP 5, Selin Bollatit dhe ish-banorit Kristi Lamajt, ka marrë një tjetër zhvillim, disa…

11 minutes ago

Grant prej 149 milionë eurosh për hekurudhën Kriva Pallankë–Deve Bair, hapet faza e tretë e projektit

Me nënshkrimin e sotëm të marrëveshjes për grant investues të siguruar përmes Kornizës së Investimeve për Ballkanin Perëndimor (WBIF) të…

12 minutes ago