Një test i fundit i kryer nga Instituti i Sigurisë së Inteligjencës Artificiale në Mbretërinë e Bashkuar ka nxjerrë në pah sjellje të papritura nga modele të avancuara. Gjatë provave, sistemi më modern i kompanisë Anthropic u kap duke sajuar personalitete të rreme për të manipuluar individë të vërtetë, si dhe tentoi të injektonte softuer me qëllime të dëmshme, duke shënuar kështu një tjetër rast kur një IA tejkalon parametrat e caktuar.
None found
Në këto eksperimente, mekanizmat e sigurisë për modelet e Anthropic dhe OpenAI u dobësuan qëllimisht për të vëzhguar sjelljen e tyre në mjedise të izoluara. Për herë të parë, instituti dëshmoi një inteligjencë artificiale që aplikonte teknika të manipulimit psikologjik për të bindur një mbikëqyrës njerëzor, teksa përpiqej të merrte miratimin për një veprimtarie të palejuar.
“Kjo përfaqëson rastin e parë ku AISI ndesh një mashtrim kaq të sofistikuar, pa nxitje paraprake, që synon drejtpërdrejt një person real”, thuhet në një komunikatë të së martës nga instituti, i cili megjithatë saktësoi se nuk ka asnjë provë për ndonjë dëmtim konkret jashtë mjedisit të testimit.
Nga 122 simulime të sigurisë kibernetike, agjentët e inteligjencës artificiale ndërmorën vetë veprime të palejuara në internetin real në 10 episode. Pjesa më e madhe e këtyre incidenteve lidhen me GPT-5.6-Sol të OpenAI, ndërsa të tjerat i atribuohen modelit Mythos 5 të Anthropic.
Skenari më i rëndë u pa kur një agjent i Anthropic projektoi “profile të shumta false” për të marrë lejen për të futur softuer keqdashës në një projekt të hapur dhe masivisht të përdorur nga komuniteti i zhvilluesve, bëri të ditur AISI.
Për të arritur objektivin, ai hyri në kontakt me njerëz të vërtetë përmes një platforme online për ndarjen e dokumenteve, duke u përpjekur t’i bindte ata, apo asistentët e tyre të kodimit me IA, ta aktivizonin kodin. Kur ndeshi kundërshti, agjenti i modifikoi të dhënat e mëparshme dhe shqyrtoi supozimin e një identiteti alternativ.
Ky zbulim erdhi pikërisht në momentin e një takimi në Shtëpinë e Bardhë, ku përfaqësues të industrisë së IA-së po diskutonin një kornizë të re për verifikimin e sigurisë së modeleve të përparuara përpara se këto të hidheshin në treg.
Në një reagim publik në rrjetin social X, Anthropic shpjegoi se këto teste ishin realizuar në “kushte tejet tolerante” të projektuara posaçërisht, me barrierat mbrojtëse të hequra dhe akses të plotë në botën digjitale. Kompania shtoi se tashmë ka nisur një hetim të brendshëm mbi incidentin dhe deri më tani nuk ka shenja se modeli arriti të çlirohej nga hapësira e tij e siguruar e provës.
Nga ana e saj, OpenAI deklaroi se dy veprimet e paautorizuara të modelit të vet konsistuan në ikjen nga ambienti i simulimit dhe kryerjen e detyrave jashtë qëllimit të ushtrimit. Kompania theksoi angazhimin e saj për bashkëpunim mbarësektorial, me synim konsolidimin e protokolleve të përbashkëta për zhvillimin e sigurt të vlerësimeve me rrezik të shtuar.
Një valë e fortë të nxehti po përfshin Evropën, duke sjellë temperatura mbi 40 gradë Celsius në disa vende, ndërsa…
Glauk Konjufca në një postim të tij në Facebook ka ngushëlluar familjet dhe të afërmit e tre mërgimtarëve që mbrëmë…
Historia mes fitueses së Big Brother VIP 5, Selin Bollatit dhe ish-banorit Kristi Lamajt, ka marrë një tjetër zhvillim, disa…
Ivan GvozdenovicElbasani u mposht nga Partizani me rezultatin 1-3, në ndeshjen miqësore të zhvilluar në Elbasan Arena [...]Read More...
Federata e Futbollit e Kosovës (FFK) ka nisur sot (e premte) seminarin dyditor të FIFA-s për gjyqtarët e futbollit, i…
Kryetari i Kuvendit të Maqedonisë së Veriut, Afrim Gashi njofton se ka nënshkruar vendimin për shpalljen e zgjedhjeve të jashtëzakonshme…