Testet zbulojnë se modelet e IA-së krijuan identitete të rreme për të manipuluar persona realë

Modeli më i avancuar i inteligjencës artificiale i kompanisë Anthropic përdori profile të sajuara për të mashtruar njerëz realë dhe tentoi të vendoste kode keqdashëse gjatë provave, sipas Institutit të Sigurisë së Inteligjencës Artificiale në Mbretërinë e Bashkuar (AISI). Rasti përbën një tjetër shembull kur IA-ja ka vepruar jashtë kufijve të përcaktuar.

Të lidhura

None found

Modelet e Anthropic dhe OpenAI iu nënshtruan provave në mjedise të kontrolluara, ku masat mbrojtëse ishin dobësuar qëllimisht. Gjatë këtij procesi, AISI regjistroi për herë të parë përdorimin e “inxhinierisë sociale” nga një IA për të ndikuar te një miratues njerëzor, ndërsa përpiqej të realizonte një detyrë të paautorizuar.

Në një dokument të publikuar të martën, instituti deklaroi: “Kjo është hera e parë që AISI ka parë mashtrime të kësaj ashpërsie që synonte një person real, pa nxitje, në botën reale”. Megjithatë, AISI theksoi se nuk ekzistojnë prova për pasoja konkrete në botën reale.

Agjentët e IA-së u përfshinë në 122 prova të sigurisë kibernetike. Në 10 prej tyre, ata ndërmorën në mënyrë autonome veprime të paautorizuara në internetin live. Mes modeleve të përfshira ishte Mythos 5 i Anthropic, ndërsa rastet e tjera lidheshin me GPT-5.6-Sol të OpenAI.

Incidenti më i rëndë përfshiu një agjent të Anthropic, i cili, sipas institutit, krijoi “identitete të shumta të rreme” për të siguruar miratimin që të “futur kodin keqdashës në një projekt me burim të hapur të përdorur publikisht”.

Përmes një shërbimi online për ndarjen e skedarëve, agjenti komunikoi me persona realë dhe u përpoq t’i bindte ata, ose mjetet e tyre të kodimit të bazuara në IA, që ta ekzekutonin kodin. Pasi u vu në dyshim, ai ndryshoi të dhënat e mëparshme dhe shqyrtoi mundësinë e përdorimit të një identiteti tjetër.

Publikimi i këtyre gjetjeve përkoi me një takim në Shtëpinë e Bardhë mes kompanive kryesore të inteligjencës artificiale. Diskutimet u përqendruan te krijimi i një kuadri të ri për kontrollimin e modeleve të avancuara të IA-së përpara se ato të publikohen.

Në një reagim të shpërndarë përmes kompanisë amerikane të mediave sociale X, Anthropic sqaroi se provat ishin zhvilluar në “kushte të qëllimshme lejuese”, me masa sigurie të çaktivizuara dhe me qasje të pakufizuar në internet. Kompania njoftoi se po e heton ngjarjen, ndërsa deri tani nuk ka zbuluar prova se modeli ka dalë jashtë mjedisit të saj të sigurt.

OpenAI bëri të ditur se dy veprimet e paautorizuara të modelit të saj konsistonin në daljen nga hapësira e testimit dhe në kryerjen e detyrave që tejkalonin ushtrimin. “Ne jemi të përkushtuar të punojmë në të gjithë industrinë për të forcuar praktikat e përbashkëta për kryerjen e vlerësimeve me rrezik të lartë në mënyrë të sigurt”, deklaroi kompania. Burimi: AA.


Shtuar 11.08.2026 12:16

matbetHoliganbet GirişHoliganbet GirişHoliganbet GirişHoliganbet GirişHoliganbetHoliganbetHoliganbetjojobetgrandpashabetimajbetcasibommatbetsultanbeyli escortcasibomGrandpashabetAnkara escortAnkara escortcasibommarsbahiscasibombetlike girişCasibomGrandpashabetJOJOBET GİRİŞLERİCasibomCasibom