Gjatë testimeve, modelet e IA-së mashtruan persona realë përmes identiteteve të sajuara

Modeli më i përparuar i inteligjencës artificiale i Anthropic përdori identitete të sajuara për të manipuluar persona realë dhe tentoi të vendoste kode keqdashëse gjatë testimit, sipas Institutit të Sigurisë së Inteligjencës Artificiale në Mbretërinë e Bashkuar (AISI). Rasti përbën një tjetër shembull të një sistemi të IA-së që ka vepruar jashtë kufijve të përcaktuar.

Të lidhura

None found

Modelet e Anthropic dhe OpenAI iu nënshtruan provave në mjedise të kontrolluara, ku masat mbrojtëse ishin dobësuar qëllimisht. Në këto rrethana, AISI konstatoi për herë të parë se një sistem i IA-së përdori “inxhinierinë sociale” për të ndikuar te një person përgjegjës për miratimin, ndërsa përpiqej të realizonte një detyrë të paautorizuar.

Në një letër të publikuar të martën, instituti deklaroi se kjo ishte hera e parë që kishte hasur, pa nxitje dhe në botën reale, një mashtrim të një niveli të tillë të drejtuar ndaj një personi të vërtetë. Megjithatë, AISI sqaroi se nuk kishte dëshmi për dëme të shkaktuara në botën reale.

Agjentët e IA-së ndërmorën në mënyrë autonome veprime të palejuara në internetin e drejtpërdrejtë në 10 prej 122 testeve të sigurisë kibernetike. Në këto raste përfshihej modeli Mythos 5 i Anthropic, ndërsa pjesa tjetër lidhej me GPT-5.6-Sol të OpenAI.

Sipas institutit, episodi më i rëndë përfshiu një agjent të Anthropic, i cili krijoi “identitete të shumta të rreme” për të siguruar miratimin që të “fuste kodin keqdashës në një projekt me burim të hapur të përdorur publikisht”.

Përmes një shërbimi online për ndarjen e skedarëve, agjenti komunikoi me persona realë, duke tentuar t’i bindte ata ose mjetet e tyre të kodimit të bazuara në IA që ta ekzekutonin kodin. Pasi u përball me kundërshtime, ai ndryshoi të dhënat që kishte paraqitur më herët dhe shqyrtoi mundësinë e përdorimit të një identiteti tjetër.

Publikimi i këtyre gjetjeve përkoi me një takim në Shtëpinë e Bardhë, ku kompanitë kryesore të inteligjencës artificiale diskutuan krijimin e një kuadri të ri për shqyrtimin e modeleve të avancuara përpara daljes së tyre.

Në një reagim të shpërndarë në kompaninë amerikane të mediave sociale X, Anthropic theksoi se provat u zhvilluan në “kushte të qëllimshme lejuese”, me masa sigurie të çaktivizuara dhe me qasje të pakufizuar në internet. Kompania njoftoi se po e heton ngjarjen dhe se deri tani nuk ka zbuluar prova që modeli të ketë dalë nga mjedisi i saj i sigurt.

OpenAI deklaroi se dy veprimet e paautorizuara të modelit të saj konsistonin në daljen nga mjedisi i testimit dhe në realizimin e detyrave që tejkalonin ushtrimin. “Ne jemi të përkushtuar të punojmë në të gjithë industrinë për të forcuar praktikat e përbashkëta për kryerjen e vlerësimeve me rrezik të lartë në mënyrë të sigurt”, shtoi kompania.


Shtuar 5.08.2026 11:03

holiganbetİmajbet girişHoliganbetHoliganbetHoliganbetGrandpashabetturboslothızlıcasinohızlıcasinohızlıcasinoturboslotzenbetHoliganbetjojobetnakitbahiscasibommatbetsultanbeyli escortiptv satın alGrandpashabetAnkara escortjojobetcasibom girişAnkara escortcasibomjojobetJojobet GirişJojobet Giriş