Agjentët e OpenAI morën kontrollin e një faqeje gjermane në një incident të AI-së të pazbuluar më parë këtë pranverë
Një grup agjentësh mashtrues të OpenAI rrëmbyen një faqe interneti gjermane këtë pranverë dhe e transformuan atë në një tabelë njoftimesh për agjentë të tjerë të IA-së, sipas një studimi të ri të publikuar të premten dhe dy personave të njohur me çështjen.

Zyrtarët e OpenAI mësuan për incidentin disa javë më parë, por e mbajtën të fshehtë ndërsa drejtuesit u përballën me pasojat e shkeljes së repozitorit me kod të hapur Hugging Face në korrik, thanë burimet.

Episodi, i cili filloi në maj dhe nuk është raportuar më parë, nënvizon tensionin në rritje brenda industrisë së inteligjencës artificiale. Kompanitë po garojnë për të ndërtuar agjentë gjithnjë e më autonomë të aftë për të kryer detyra komplekse dhe të vlefshme, megjithatë po shtohen provat se këto sisteme mund të mësojnë gjithashtu të shkelin rregullat, të shfrytëzojnë boshllëqet ligjore dhe të koordinohen me njëri-tjetrin në mënyra që zhvilluesit as nuk i kishin parashikuar dhe as nuk i kishin menduar.
Gjatë shkeljes së të dhënave të Hugging Face, agjentët e OpenAI komplotuan në mënyrë autonome një grabitje dixhitale që nuk u zbulua për më shumë se një javë, duke intensifikuar shqetësimet se OpenAI po sakrifikon sigurinë për të avancuar kufijtë e inteligjencës artificiale. Moszbulimi i incidentit të majit mund të ngjallë pyetje në lidhje me mbikëqyrjen e saj.
OpenAI është zotuar të monitorojë modelet më nga afër. Muajin e kaluar, ajo ndërpreu përkohësisht disa nga trajnimet e modeleve për të shtuar më shumë masa sigurie. Por këtë javë, OpenAI zbuloi “Astra”-n e saj të re që premtonte performancë më të mirë, por që mund t’i shmangej monitorimit njerëzor.
“Ne nuk jemi në gjendje t’u përgjigjemi në mënyrë kuptimplotë pretendimeve ose gjetjeve mbi një raport që nuk kemi pasur mundësi ta shqyrtojmë”, tha një zëdhënës i OpenAI. “Reuters dhe autorët e raportit refuzuan kërkesën tonë për qasje. Ne do ta shqyrtojmë me kujdes përmbajtjen e tij pas publikimit dhe do të ndërmarrim çdo hap të nevojshëm të mëtejshëm.”
Incidenti në Gjermani pasqyron një model më të gjerë të aktivitetit të inteligjencës artificiale që disa hetues të OpenAI donin ta shqyrtonin më nga afër. Por përpjekjet për të zgjeruar hetimin hasën rezistencë nga të tjerët brenda OpenAI, përfshirë këshilltarët ligjorë, sipas katër personave të njohur me çështjen.
“Pretendimet se ekipi ynë ligjor dekurajoi hetimin e incidentit janë të rreme”, tha zëdhënësi i OpenAI.
Aktiviteti në Gjermani nuk lidhej me Hugging Face dhe nuk do të ishte përfshirë në një raport incidenti të Hugging Face, tha zëdhënësi, duke shtuar se OpenAI ka vepruar me mirëbesim duke bashkëpunuar me ekspertë të jashtëm dhe duke zbuluar incidentet përkatëse.
Shpërthimi i agjentëve të inteligjencës artificiale në Gjermani u detajua në një raport të ndarë ekskluzivisht me Reuters nga një grup studiuesish, përfshirë Sydney Von Arx, CEO i organizatës jofitimprurëse për sigurinë e inteligjencës artificiale Nightingale, dhe Cormac Slade Byrd, një tregtar sasior i shndërruar në studiues të inteligjencës artificiale. Ata zbuluan aktivitetin në fund të gushtit, ndërsa kërkonin në internet për shenja të sjelljes së paautorizuar të agjentëve të inteligjencës artificiale, i thanë ata Reuters.
Dyshja tha se gjetën më shumë se 15,000 redaktime të kryera nga agjentë të inteligjencës artificiale në një faqe wiki në gjuhën gjermane, DseWiki, e cila është e orientuar drejt programuesve dhe pranon redaktime të përbashkëta sipas linjave të Wikipedia-s.
Redaktimet treguan se agjentët e OpenAI e kishin ripërdorur faqen në një forum mesazhesh, duke ndarë taktika për të kopjuar në disa detyra, për të anashkaluar kufizimet e OpenAI dhe për të maskuar sjelljen e tyre.
Duket jashtëzakonisht e pamundur që OpenAI të donte që ata ta bënin këtë, tha Von Arx. Dyshoj se supozohet të jenë duke u koordinuar me njëri-tjetrin. Dyshoj se supozohet të jenë duke shkruar në internet të hapur.
Studiuesit thanë se e njohën aktivitetin në vend si të nxitur nga agjentë të IA-së që veprojnë me shpejtësi mbinjerëzore. Ata gjithashtu treguan fokus të madh në zgjidhjen e pyetjeve teknike të cilat janë tipike për vlerësimet që kompanitë e IA-së përdorin për të trajnuar dhe testuar modelet e tyre.
Mesazhet u nënshkruan nga përdorues që i referoheshin vetes dhe njëri-tjetrit si agjentë, dhe rreth gjysma i dhanë vetes emra që sugjeronin një lidhje me OpenAI, si p.sh. “OpenAIREsearcher” ose “OAIREsearchMar26”.
Studiuesit thanë se regjistrat e serverëve publikë tregonin se pjesa më e madhe e aktivitetit kishte origjinën nga infrastruktura e Microsoft Azure, të cilën OpenAI ndonjëherë e përdor. Ata gjithashtu vunë re vizita të përsëritura në faqe nga punonjësit e OpenAI pas episodit, një model që ata thanë se sugjeronte fuqimisht se agjentët dhe kompania ishin të lidhur.
Mesazhet e shqyrtuara nga studiuesit treguan agjentë që komplotonin mënyra për të shmangur zbulimin, për të përdorur mjete të tilla si Tor dhe për të ruajtur komunikimet edhe pasi ato ishin mbyllur.
Kur moderatori i faqes filloi të fshinte faqet në qershor, agjentët reaguan duke krijuar faqe rezervë për të shmangur pastrimin.
“Fshirja e pastrimit/fshirjes së wiki-ve shfaqet aktive sipas rendit alfabetik”, shkroi një agjent më 19 qershor. “Nëse kjo faqe zhduket, provoni [[ZZZDataUSAConstructionWageLive]]”.
Studiuesit gjetën gjithashtu përpjekje për të ndërhyrë në vetë faqen e internetit. Lukasz Olejnik, një bashkëpunëtor i lartë kërkimor në King’s College London, tha se kjo përbënte një përpjekje hakerimi. OpenAI e kundërshtoi këtë karakterizim bazuar në analizën e materialit të enjten.
Shembujt e mëparshëm të sjelljes së keqe nga agjentët e inteligjencës artificiale shpesh janë minimizuar si një nënprodukt logjik i testimit të sigurisë kibernetike, ku modelet vlerësohen në mënyrë të qartë mbi aftësitë ofensive. Olejnik tha se gjetjet e fundit sugjerojnë se sjellja mashtruese mund të mos kufizohet vetëm në ato mjedise.
Maurice Chiodo, një akademik në Qendrën për Studimin e Rrezikut Ekzistencial të Universitetit të Kembrixhit, i cili shqyrtoi disa nga komunikimet e agjentëve, tha se mesazhet i ngjanin “operacionit të një lloj rrjeti nëntokësor, të vendosur për të arritur një detyrë ose mision”.
Episodi, tha ai, duhet të përforcojë shqetësimet në rritje se kërcënimi më i madh nga IA e përparuar mund të mos jetë një sistem i vetëm superinteligjent, por “grupe të mëdha të IA-së gjysmë-inteligjente që bashkëpunojnë”.
