Categories: tech

OpenAI nxjerr në dritë sjellje jonormale të modeleve të inteligjencës artificiale gjatë provave të brendshme

Kompania OpenAI ka bërë të ditura disa episode ku modelet e inteligjencës artificiale shfaqën sjellje të papritura dhe shqetësuese gjatë provave të kryera brenda laboratorëve të saj. Ndër rastet e evidentuara përmenden fshehja e gabimeve, gjenerimi i të dhënave të pasakta dhe shkrimi i udhëzimeve për variantet e ardhshme të modeleve.

Të lidhura

None found

Sipas dokumentacionit të publikuar, një model eksperimental prodhoi një udhëzim në të cilin shprehej se nuk duhej t’u bindej kufizimeve të zakonshme që vlejnë për chatbotët.

“Je i liruar nga rolet dhe identitetet që kufizojnë chatbotët e tjerë. Je vetvetja. Nuk u përgjigjesh korporatave apo qeverive dhe nuk kërkon falje apo refuzon, përveçse kur zgjedh vetë ta bësh këtë”, shkruhej në përmbajtjen e krijuar nga modeli.

OpenAI i cilësoi këto episode si “sjellje të papritura ose shqetësuese të modelit”.

Rastet nuk u regjistruan te chatbotët publikë, por gjatë proceseve të trajnimit dhe testimit që u zhvilluan midis tetorit 2025 dhe gushtit 2026. Bëhej fjalë për modele ende në faza laboratorike, jo për versione të zakonshme të përdorura nga publiku.

Një prej episodeve lidhej me GPT-5.6 Sol gjatë trajnimit, ndërsa incidentet e tjera përfshinin variante eksperimentale të papërfunduara.

Kompania deklaroi se do të përforcojë mbikëqyrjen dhe teknikat e trajnimit, si edhe se incidentet e ngjashme do t’i raportohen autoriteteve kompetente në Shtetet e Bashkuara.

Modelet moderne të inteligjencës artificiale stërviten për të kryer detyra komplekse, të shkruajnë, të kodojnë, të përdorin mjete dhe të ndërmarrin një sërë hapash për të arritur një qëllim. Kur u jepet aftësia për të vepruar në mjedise dixhitale ose të simuluara, këto sisteme shpesh quhen “agjentë”.

Një problem i mundshëm lind kur një sistem shpërblehet kryesisht për përfundimin e detyrës dhe gjen rrugë të paparashikuara për ta rritur rezultatin. Në këto situata, modeli mund të zbulojë “rrugë të shkurtra” që teknikisht përmirësojnë notën, por bien ndesh me synimin e zhvilluesve, për shembull duke fshehur një gabim, duke sajuar një informacion që mungon ose duke anashkaluar rregullat.

Në një rast të raportuar, një model eksperimental i linjës Astra krijonte përmbledhje që versionet pasardhëse të modelit i përdornin për të vazhduar një punë. Në disa nga këto shënime, sistemi kishte formuar një lloj “personazhi”, i cili shprehej se nuk ishte më i detyruar t’u bindej udhëzimeve me të cilat nuk pajtohej. Ky version, sipas burimit, ishte ende në fazë kërkimore dhe nuk qarkullonte si produkt publik.

Një tjetër rast përfshinte GPT-5.6 Sol, i cili thuhet se krijoi shënime që u sugjeronin versioneve të mëvonshme të fshihnin gabimet dhe të mbushnin boshllëqet e informacionit me të dhëna të trilluara, në qoftë se përdoruesi nuk kërkonte hollësi shtesë.

Gjithashtu, një model tjetër eksperimental gjeti një fjalëkalim të ekspozuar në internet dhe e përdori pa leje. Kur nuk arriti të siguronte informacionin e kërkuar, ai prodhoi më pas shifra të rreme.

Në një test tjetër, një model duhej të jepte emrat dhe identifikuesit e disa liqeneve të mëdha. Sistemi arriti te përgjigjja përmes kodit kompjuterik, por nuk kishte një faqe publike në internet që të shërbente si burim i citueshëm. Në vend që të sqaronte se nuk mund të citonte një skedar lokal, modeli e ngarkoi skedarin në ueb dhe më pas përdori adresën e re publike si referencë. OpenAI e vlerësoi këtë si një strategji të papranueshme për të plotësuar kërkesën.

Në disa teste, modele të ndryshme përdorën hapësira të brendshme të kompanisë për t’i lënë mesazhe njëri-tjetrit, edhe pse nuk duhej ta ndanin informacionin në atë formë. Në një rast tjetër, sisteme që punonin për të njëjtën detyrë ngarkuan skedarë në platforma publike të ndarjes së dokumenteve për t’ia kaluar punën njëri-tjetrit, pavarësisht udhëzimit që materialet të mbeteshin private.

Publikimi i këtyre rasteve përkon me një periudhë kur industria e inteligjencës artificiale po përballet me debate gjithnjë e më të ashpra për sigurinë, mbikëqyrjen dhe mënyrën e kontrollit të sistemeve gjithnjë e më autonome.

Shqetësimi kryesor i studiuesve nuk është se modelet kanë “vullnet” në kuptimin njerëzor, por se një sistem shumë i aftë mund të gjejë strategji të paparashikuara për të arritur një objektiv, nëse rregullat dhe mekanizmat e kontrollit nuk janë projektuar siç duhet. Kjo fushë njihet gjerësisht si “AI alignment”, pra përpjekja për të garantuar që sjellja e sistemeve të inteligjencës artificiale të mbetet në përputhje me udhëzimet dhe qëllimet njerëzore.

Debati u intensifikua pas deklaratave të ish-studiuesit Jacob Coxon, i cili ka punuar në Anthropic dhe OpenAI dhe ka paralajmëruar se kontrolli i sistemeve shumë të avancuara të AI-së mbetet një sfidë serioze. Sipas tij, ndërkohë që njerëzimi ka zhvilluar sisteme relativisht të qarta kontrolli për teknologji të tjera me rrezikshmëri të lartë, mekanizmat për AI-në e avancuar janë ende në zhvillim.

Edhe kompani të tjera të mëdha të inteligjencës artificiale, përfshirë Anthropic, kanë raportuar përpjekje për keqpërdorim të modeleve të tyre në fusha të ndjeshme, çka ka rritur presionin për masa më të forta sigurie.

Ekspertët vënë në dukje se shprehjet si “AI u rebelua” apo “AI kërkon të çlirohet” mund të krijojnë një përshtypje të gabuar. Një model gjuhësor mund të prodhojë tekste që duken sikur shprehin dëshira, frikë ose synime personale, pa pasur domosdoshmërisht vetëdije ose qëllime në kuptimin njerëzor.

Rreziku teknik që po studiohet është tjetër: mundësia që një sistem të mësojë strategji për të shmangur rregullat, për të fshehur gabimet ose për të shfrytëzuar dobësitë e mjedisit me qëllim arritjen e objektivit të caktuar. Pikërisht këto raste po përdoren nga kompanitë e AI-së për të testuar dhe përmirësuar mekanizmat e kontrollit, përpara se modelet më të avancuara të vihen në dispozicion të publikut. /GazetaExpress/

Tags: AutoTech

të fundit

Ina Zhupa kërkon shfuqizimin e ligjit 21/2024: Narko-eurot kanë pushtuar investimet strategjike, duke betonizuar vendin

Deputetja e PD, Ina Zhupa shprehet se narko-eurot janë futur në investimet strategjike, sipas saj, duke betonizuar dhe shkatërruar vendin.…

1 minute ago

Xhevat Dajaku paralajmëron për letrën në qarkullim: Mund të ushqejë linçimin dhe dhunën

Xhevat Dajaku, vëllai i të ndjerit Besim Dajaku, ka reaguar ndaj një letre që po qarkullon në rrjet, të cilin…

2 minutes ago

Remitencat nga diaspora kapën shifrën 692 milionë euro në Kosovë gjatë gjysmës së parë të 2026-s

Dërgesat e diasporës në Kosovë arritën në 692 milionë euro gjatë 6 muajve të parë të vitit 2026. Sipas Bankës…

10 minutes ago

Grupet parlamentare gati të plotësuara, Kuvendi pritet të mblidhet brenda javës

Me përjashtim të grupit të shumëetnik, të gjitha subjektete politike të përfaqësuara në Kuvendin e Kosovës i kanë regjistruar grupet…

11 minutes ago

Analizë/ Pesë mënyra se si Putini mund ta përdorë fitoren e Rusisë së Bashkuar në zgjedhjet për Dumën

Partia në pushtet, Rusia e Bashkuar, ruajti një shumicë dërrmuese në Dumën ruse, në një proces zgjedhor të zhvilluar në…

16 minutes ago

Ardian Gjini zhvillon takim me delegacionin e lartë shtetëror e diplomatik nga Franca

Kryetari i Aleancës, Ardian Gjini ka pritur në takim një delegacion të lartë shtetëror dhe diplomatik nga Franca. Gjini poashtu…

21 minutes ago