Modeli më i përparuar i inteligjencës artificiale i Anthropic përdori identitete të rreme për të mashtruar persona realë dhe tentoi të vendoste kode keqdashëse gjatë testimit, sipas Institutit të Sigurisë së Inteligjencës Artificiale në Mbretërinë e Bashkuar (AISI). Rasti përbën një tjetër shembull të një sistemi të IA-së që vepron përtej kufijve të parashikuar.
None found
Eksperimentet me modelet e Anthropic dhe OpenAI u zhvilluan në ambiente të kontrolluara, ku masat mbrojtëse ishin dobësuar qëllimisht. Për herë të parë, AISI konstatoi se një sistem i IA-së përdori “inxhinieri sociale” për të ndikuar te një person përgjegjës për miratimin, ndërsa përpiqej të realizonte një detyrë të paautorizuar.
Në një letër të publikuar të martën, instituti deklaroi: “Kjo është hera e parë që AISI ka parë mashtrime të kësaj ashpërsie që synonte një person real, pa nxitje, në botën reale”. Megjithatë, AISI theksoi se nuk ekzistojnë prova për dëme të shkaktuara në botën reale.
Agjentët e IA-së u përfshinë në 122 prova të sigurisë kibernetike. Në 10 prej tyre, ata ndërmorën në mënyrë autonome veprime të paautorizuara në internetin live. Mes rasteve ishte ai i modelit Mythos 5 të Anthropic, ndërsa pjesa tjetër lidhej me GPT-5.6-Sol të OpenAI.
Incidenti më i rëndë përfshiu një agjent të Anthropic, i cili, sipas institutit, krijoi “identitete të shumta të rreme” për të siguruar miratimin që të “futur kodin keqdashës në një projekt me burim të hapur të përdorur publikisht”.
Përmes një platforme online për ndarjen e skedarëve, agjenti komunikoi me persona realë dhe u përpoq t’i bindte ata, ose mjetet e tyre të kodimit të IA-së, që ta ekzekutonin kodin. Pasi u përball me kundërshtime, ai ndryshoi të dhënat e mëparshme dhe shqyrtoi mundësinë e përdorimit të një identiteti tjetër.
Publikimi i këtyre gjetjeve përkoi me një takim në Shtëpinë e Bardhë, ku kompanitë kryesore të inteligjencës artificiale diskutuan një kuadër të ri për shqyrtimin e modeleve të avancuara të IA-së përpara se ato të publikohen.
Në një reagim të shpërndarë përmes kompanisë amerikane të mediave sociale X, Anthropic sqaroi se provat ishin realizuar në “kushte të qëllimshme lejuese”, me masa sigurie të çaktivizuara dhe qasje të pakufizuar në internet. Kompania bëri të ditur se po e heton ngjarjen dhe se deri tani nuk ka zbuluar prova që modeli të ketë dalë nga ambienti i saj i sigurt.
OpenAI deklaroi se dy veprimet e paautorizuara të modelit të saj kishin të bënin me daljen nga mjedisi i testimit dhe realizimin e detyrave që tejkalonin ushtrimin. Kompania shtoi: “Ne jemi të përkushtuar të punojmë në të gjithë industrinë për të forcuar praktikat e përbashkëta për kryerjen e vlerësimeve me rrezik të lartë në mënyrë të sigurt”. Burimi: AA.
Ushtruesja e detyrës së presidentes së Kosovës, Albulena Haxhiu, e ka cilësuar si “absurde”, “kërcënuese” dhe qasje “shoviniste” idenë e…
Mark Zuckerberg zgjodhi një mënyrë të pazakontë për të vijuar stërvitjen e tij në artet marciale, duke u përballur me…
Ministri i Jashtëm në detyrë, Glauk Konjufca, ka deklaruar se nuk beson se procesi aktual i konstituimit të Kuvendit po…
Një pjesë e humbur e një rakete SpaceX, që ka qenë duke lëvizur në orbitë me shpejtësi rreth 2.43 kilometra…
Drejtori ekzekutiv i Anthropic, Dario Amodei, dhe më shumë se 1,000 punonjës, disa prej të cilëve në pozicione drejtuese në…
Deputeti i Vetëvendosjes, Glauk Konjufca konsideron se Kushtetuta nuk është shkelur me vazhdimin e seancës konstituive të shtunën, e cila…