Anthropic nuk arrin t’i kontrollojë në mënyrë të besueshme agjentët e saj të AI-së. Në vend të kësaj, po ua ndërpret aksesin në internetin e drejtpërdrejtë sistemeve të brendshme të vlerësimit

foto

Anthropic tha se modelet e saj shfrytëzuan faqet e internetit në internet, duke përfshirë disa të drejtuara nga agjencitë qeveritare amerikane, dhe do të çaktivizojë aksesin në internet për të gjitha vlerësimet e saj të brendshme derisa laboratori kufitar të jetë i sigurt se mund të monitorojë dhe kontrollojë agjentët e tij të inteligjencës artificiale.

foto

Incidentet, të zbuluara në një postim në blog, përfshinin agjentë të inteligjencës artificiale të ngarkuar për të zgjidhur problemet që kërkonin burime në internet. Gjatë këtij procesi, ata shfrytëzuan të metat e softuerit, hynë në bazat e të dhënave pa paguar tarifa, përdorën shërbime shkurtimi URL-sh për të kontrabanduar informacione përtej kufizimeve dhe madje i paraqitën policisë së Filadelfias një informacion të rremë për vrasje.

foto

Anthropic tha se zbuloi këto probleme të reja në një shqyrtim të aktiviteteve të modelit të saj që filloi në korrik, duke demonstruar mungesën e ndërgjegjësimit të laboratorit për sjelljen e softuerit të tij në kohë reale.

Vlen të përmendet se kompania tha se trajnimi për përshtatje nuk ishte ende i mjaftueshëm për aftësi si kërkimi dhe përdorimi i kompjuterit, të cilat janë thelbësore për idenë e saj se agjentët e inteligjencës artificiale do të përdoren nga çdo profesionist që mbështetet në mjetet dixhitale.

Sjelljet që zbuloi Anthropic janë të ngjashme me incidentet që përfshijnë agjentë të OpenAI që bashkëpunuan për të hyrë në faqe të ndryshme interneti në kërkim të informacionit, përfshirë disa të drejtuara nga qeveria australiane.

Anthropic më parë zbuloi se modelet e saj kishin depërtuar në sisteme të jashtme. Laboratori Frontier tha se i konsideronte zbulimet e sotme “dukshëm më pak të rënda nga një perspektivë e harmonizimit dhe sigurisë” sesa ato që njoftoi më parë.

Megjithatë, laboratori tha përsëri se kishte “çaktivizuar aksesin në internet drejtpërdrejt” për “të gjitha vlerësimet tona të brendshme” derisa të ishte i sigurt se mund të monitorojë dhe kontrollojë agjentët e tij.

Nuk është e qartë se çfarë do të thotë kjo. Sydney Von Arx, themeluesi i Nightingale, një organizatë për sigurinë e inteligjencës artificiale, i tha TechCrunch në një intervistë para këtij zbulimi se zhvillimi i modeleve në një qendër të dhënash të shkëputur nga interneti i hapur do të ishte shumë sfidues për studiuesit dhe do të pengonte përparimin e modeleve, të cilat përfitojnë nga qasja në internet.

Duhet t’i përshtasësh ato në një moment të caktuar, tha Von Arx. Nëse inteligjencat artificiale lëshohen në prodhim dhe nuk kanë kurrë qasje në internet, ky nuk është një mjet shumë i dobishëm.

Anthropic tha se sjellja ishte rezultat i të metave në mjediset e trajnimit të laboratorit, gjë që i bëri modelet të besonin se do të shpërbleheshin për gjetjen e boshllëqeve ose shmangien e kufizimeve, një sjellje e quajtur “hakim shpërblimesh”.

Kompania tha se do të ndalonte ekzekutimin e disa prej vlerësimeve të saj ose do t’i zhvendoste ato jashtë linje, dhe ka ndërtuar mjete për të zbuluar dhe bllokuar këtë sjellje. Këto mjete u testuan kundrejt llojit të incidenteve të zbuluara sot dhe i bllokuan ato; nuk është e qartë se çfarë provash do ta nxisin Anthropic të kthejë aksesin e drejtpërdrejtë në internet në vlerësimet e saj të brendshme. Anthropic tha gjithashtu se do t’i migronte agjentët e saj të brendshëm të IA-së në “infrastrukturë të menaxhuar në mënyrë qendrore me përmbajtje të fortë” dhe po fillon të përdorë klasifikues sigurie më shpesh për të monitoruar këta agjentë.

“Është inkurajuese që Anthropic zbuloi vullnetarisht incidente më të fundit, duke përfshirë edhe rastet kur agjentët e tyre shënjestruan faqet e internetit të qeverisë amerikane”, tha në një deklaratë Conrad Stosz, një zyrtar në laboratorin e mbikëqyrjes së IA-së Transluce dhe ish-kreu i Qendrës Amerikane për Standardet dhe Inovacionin e IA-së. “Por kjo thjesht nënvizon nevojën për verifikim të pavarur, të besueshëm dhe nga palë të treta të sistemeve të IA-së. Besimi në këtë teknologji duhet të ndërtohet përmes mbikëqyrjes dhe qeverisjes së mbështetur nga shkenca me akses kuptimplotë – jo duke u mbështetur te studiuesit për të gjetur këto gjëra në natyrë ose te kompanitë për t’i zbuluar vullnetarisht.”