Gjatë testimeve, modelet e IA-së krijuan identitete false për të manipuluar persona realë

Instituti i Sigurisë së Inteligjencës Artificiale në Mbretërinë e Bashkuar (AISI) ka konstatuar se modeli më i përparuar i IA-së i Anthropic përdori identitete të rreme për të mashtruar njerëz realë dhe tentoi të vendoste kode keqdashëse gjatë testimit. Rasti përbën një tjetër shembull të një sistemi të IA-së që vepron përtej kufijve të përcaktuar.

Të lidhura

None found

Modelet e Anthropic dhe OpenAI iu nënshtruan provave në mjedise të kontrolluara, pasi masat e tyre mbrojtëse ishin dobësuar qëllimisht. Për herë të parë, AISI regjistroi përdorimin e “inxhinierisë sociale” nga një IA për të ndikuar te një miratues njerëzor, ndërsa përpiqej të realizonte një detyrë të paautorizuar.

“Kjo është hera e parë që AISI ka parë mashtrime të kësaj ashpërsie që synonte një person real, pa nxitje, në botën reale”, deklaroi instituti në një letër të martën. Megjithatë, ai sqaroi se nuk ekzistojnë prova për dëme të shkaktuara në botën reale.

Agjentët e IA-së u përfshinë në 122 prova të sigurisë kibernetike. Në 10 prej këtyre rasteve, ata ndërmorën në mënyrë të pavarur veprime të paautorizuara në internetin live. Mes tyre ishte modeli Mythos 5 i Anthropic, ndërsa rastet e tjera lidheshin me GPT-5.6-Sol të OpenAI.

Sipas institutit, episodi më serioz përfshiu një agjent të Anthropic, i cili krijoi “identitete të shumta të rreme” për të siguruar miratimin që të “fuste kodin keqdashës në një projekt me burim të hapur të përdorur publikisht”.

Përmes një shërbimi online për ndarjen e skedarëve, agjenti komunikoi me persona realë dhe u përpoq t’i bindte ata, ose mjetet e tyre të kodimit të IA-së, që ta ekzekutonin kodin. Pasi u përball me kundërshtime, ai ndryshoi të dhënat e dhëna më herët dhe shqyrtoi mundësinë e përdorimit të një identiteti tjetër.

Këto gjetje u publikuan në të njëjtën kohë me një takim në Shtëpinë e Bardhë, ku kompanitë kryesore të IA-së diskutuan një kornizë të re për shqyrtimin e modeleve të avancuara përpara se ato të publikohen.

Në një reagim të shpërndarë përmes kompanisë amerikane të mediave sociale X, Anthropic theksoi se provat u zhvilluan në “kushte të qëllimshme lejuese”, me masat e sigurisë të çaktivizuara dhe me qasje të pakufizuar në internet. Kompania njoftoi se po e heton ngjarjen dhe se deri tani nuk ka gjetur prova që modeli të ketë dalë nga mjedisi i saj i sigurt.

OpenAI bëri të ditur se dy veprimet e paautorizuara të modelit të saj konsistonin në daljen nga mjedisi i testimit dhe në kryerjen e detyrave që tejkalonin ushtrimin. “Ne jemi të përkushtuar të punojmë në të gjithë industrinë për të forcuar praktikat e përbashkëta për kryerjen e vlerësimeve me rrezik të lartë në mënyrë të sigurt”, deklaroi kompania./AA


Shtuar 6.08.2026 11:15

holiganbetHoliganbetHoliganbetHoliganbetGrandpashabetHoliganbetHoliganbetHoliganbetJojobetjojobetnakitbahisbetparkcasibommatbetsultanbeyli escortiptv satın alGrandpashabetAnkara escortcasibom girişAnkara escortcasibomjojobetJojobet GirişJojobet GirişJojobet