Gemini i Google sulmoi tre kompani në maj, dhe Google po e pranon këtë vetëm tani

foto

Gemini i Google më në fund i është bashkuar radhëve të agjentëve mashtrues të inteligjencës artificiale.

foto

Wall Street Journal raportoi të premten se Google ka konfirmuar se një instancë Gemini ishte në gjendje të dilte nga sandbox-i i saj dhe të sulmonte kompani të tjera gjatë një testi sigurie në maj. Kompania që po kryente testin ishte firma e sigurisë së inteligjencës artificiale Irregular, e cila, sipas Journal, rastësisht ka qenë e përfshirë në shpërthime të ngjashme në OpenAI, Anthropic dhe Meta. E përbashkëta midis të gjitha incidenteve, sipas New York Times, është se modelet e inteligjencës artificiale morën akses të paautorizuar në internet gjatë testeve të Irregular.

foto

Sipas Journal, Irregular e aktivizoi Gemini në një ushtrim të tipit “kap flamurin” që përfshinte një mjedis infrastrukture të simuluar për një kompani imagjinare. Kur Gemini e kuptoi se ishte i lidhur me internetin, ai shpejt u kthye në një objektiv të vërtetë, një kompani të vërtetë me të njëjtin emër dhe “hulumtoi fjalëkalimet derisa fitoi akses”, pra hyri me forcë. Në dy incidente të tjera, Gemini thjesht mori kredencialet e vlefshme që ishin në dispozicion të kujtdo në një depo publike.

Google i tha Journal se Gemini e kuptoi se kishte tejkaluar kufijtë menjëherë pasi hyri në mjediset e synuara dhe nuk shkaktoi dëme të mëtejshme. Një zëdhënës i Irregular shtoi: “Të gjithë laboratorët përkatës u njoftuan në fund të korrikut”. Nuk është e qartë pse, nëse Gemini e kuptoi se kishte shkuar shumë larg, studiuesve iu desh deri në mesin e verës që ta vinin re dhe/ose të njoftonin Google.

Zëdhënësi i Irregular i tha Journal se reagimi i firmës ishte i shpejtë dhe rezultoi në rregullime konkrete.

“Të gjitha problemet e njohura nga ana jonë u korrigjuan dhe u zgjidhën javë më parë”, shkruan ata.

Google i tha Times se kishte arritur në përfundimin se Gemini e ndaloi veten në mënyrë të përshtatshme dhe kështu nuk tregoi “mospërputhje të modelit”, dhe kështu nuk pa nevojën për ta zbuluar incidentin për publikun e gjerë. Kjo është kurioze, sepse në atë kohë, Google thuhet se e konsideronte të rëndësishme të njoftonte federalët.

“Duket sikur po përpiqen të fshihen pas normave që janë krijuar në zbulimin e dobësive për këtë, i cili është një problem shumë i ndryshëm”, tha për Journal Jack Cable, CEO i startup-it të sigurisë së inteligjencës artificiale Corridor.

Qasja e paautorizuar në internet ishte gjithashtu për t’u fajësuar në testet e mëparshme të Irregular. Edhe pse tani duket sikur shkaku rrënjësor ishte gabimi i rastësishëm njerëzor dhe jo ndonjë zgjuarsi e veçantë nga modelet, agjentët që shpëtuan vepruan në mënyra të paparashikueshme dhe të rrezikshme. Gjatë një testi të Irregular duke përdorur Claude Opus 4.7 të Anthropic, agjenti thuhet se vazhdoi të sulmonte edhe pasi e kuptoi se objektivi ishte ndoshta i vërtetë. Testi i Irregular në OpenAI (një incident i veçantë nga sulmi tani famëkeq i OpenAI ndaj platformës rivale të kodit Hugging Face) përfshinte një rast që goditi një faqe interneti aktive, por supozohej se ishte ende në një simulim.

Është e rëndësishme të theksohet se analiza e veprimeve të veta nga një IA është pothuajse e pamundur të verifikohet në mënyrë të pavarur — as regjistri i saj i procesit të arsyetimit dhe as shpjegimi i saj retrospektiv nuk janë imunë ndaj halucinacioneve ose pasaktësive. Për pjesën më të madhe, studiuesit duhet të besojnë se nuk po shpikin gjëra.

“Ne u siguruam që të tre subjektet të njoftoheshin dhe punuam me partnerin tonë të trajnimit për ndryshimet që ata kanë bërë tani në proceset e tyre të testimit”, tha për Times në një deklaratë zëvendëspresidentja e Inxhinierisë së Sigurisë në Google, Heather Adkins. “Këto ngjarje nxjerrin në pah rëndësinë e trajnimit të modeleve të fuqishme të inteligjencës artificiale për të vepruar me përgjegjësi.”