Shefi i AI-së në Microsoft paralajmëron se trajnimi i AI-së së Anthropic për ndërgjegje mund të përbëjë rreziqe

foto

Shefi i Inteligjencës Artificiale të Microsoft, Mustafa Suleyman, ka ngritur paralajmërime kundër stërvitjes së Claude nga Anthropic për të imituar vetëdijen. Sipas tij, ky mund të jetë një gabim i rrezikshëm dhe ta bëjë Inteligjencën Artificiale më të vështirë për t’u kontrolluar. Eseja e Suleyman argumenton më tej se mësimi i Anthropic nga Claude një fjalor dhe modele sjelljeje të lidhura me vetëdijen, durimin moral dhe identitetin personal mund të çojë në një situatë të ngjashme me një “sallë epistemike pasqyrash”. Ai ka kundërshtuar më tej që një model të trajnohet si një “kundërshtar i ndërgjegjshëm”.

Ai vuri më tej në pikëpyetje se si Anthropic merret me modelet e tyre të LLM-së, duke theksuar se “Ata e inkurajojnë Claude-in t’i ‘qaset natyrës së ekzistencës së vet me kuriozitet dhe hapje’, dhe të pyesin veten në të ardhmen për ‘llojin e të drejtave dhe lirive më të gjera që Claude ka në botë, llojin e kompensimit që Claude po merr dhe llojin e pëlqimit që Claude ka dhënë për të luajtur këtë lloj roli’”. Anthropic madje drejtoi një intervistë daljeje në pension për Opus 3 kur ata e hodhën poshtë atë.

foto

Sulejmani beson se metoda të tilla trajnimi mund të çojnë në një ndikim katastrofik në mirëqenien e njerëzimit. Ai thotë: “Ne do të kemi krijuar një specie sintetike me inteligjencë dhe aftësi të paparë, një specie që është trajnuar të presë që mund të jetë e vetëdijshme dhe meriton një agjenci të pavarur”.

foto

Ai shton më tej se në të ardhmen e parashikueshme, një sistem i trajnuar në këtë mënyrë do të sillet sikur ka të drejtë për liri, mbrojtje dhe të drejta, dhe do të jetë e vështirë ta kontrollojë atë. Ai gjithashtu thekson domosdoshmërinë e debatit publik mbi këtë çështje dhe sugjeron që normat kolektive duhet të zhvillohen dhe zbatohen.

Sulejmani ngre më tej kundërshtime ndaj ndërhyrjeve trajnuese që mund të formësojnë vetëkonceptimin e një modeli. Eseja e tij ngre më tej pyetje në lidhje me përshkrimet rrjedhëse të dhimbjes ose preferencës. Ai shton se një model LLM duhet të ketë pesha matematikore dhe asnjë biologji të krahasueshme, nxitje homeostatike ose përvojë subjektive.

Ndarja në qasjet ndaj zhvillimit që preferon Sulejmani, dhe një që ndiqet nga të tjerat, qëndron midis hartimit të një sistemi që ndjek kufizime të qarta dhe hartimit të një sistemi që ushtron gjykim, interpreton kontekstin dhe përvetëson vlerat. Sipas Sulejmanit, Claude nuk duhet të praktikojë “bindje të verbër” ndaj Anthropic, ndërkohë që këmbëngul gjithashtu se kjo nuk duhet të minojë mbikëqyrjen legjitime.

Por argumenti i Sulejmanit kundërshtohet nga ideja se konceptet njerëzore mund të jenë mjete të dobishme sjelljeje edhe nëse ato nuk vërtetojnë se një model ka një jetë të brendshme të ngjashme me atë të njeriut.