OpenAI bën publike gjashtë incidente të reja të sigurisë së AI-së

foto

OpenAI zbuloi të mërkurën gjashtë incidente të reja në të cilat modelet e saj fshehën gabime, kërkuan kredenciale të paautorizuara, ngarkuan skedarë në internetin publik ose komunikuan nëpër mjedise trajnimi që supozoheshin të ishin të izoluara.

foto

Kompania njoftoi gjithashtu një procedurë të re për raportimin e sjelljeve të ngjashme të këqija në të ardhmen.

foto

Po bëhet gjithnjë e më e qartë se shkelja e Hugging Face nuk ishte një incident i vetëm, pasi modelet e inteligjencës artificiale bëhen më të afta të gjejnë mënyra të papritura për të anashkaluar kangjellat mbrojtëse që synojnë t’i përmbajnë ato.

“Aktualisht nuk ka një kornizë në të gjithë industrinë me standarde të qarta zbulimi, kështu që po e ndërmarrim këtë hap vullnetarisht sepse mendojmë se është me të vërtetë e rëndësishme të ndajmë atë që po mësojmë”, tha për Axios Kai Chen, udhëheqësi i kërkimit në ekipin e harmonizimit në OpenAI.

“Shpresojmë që kjo të ndihmojë vërtet në informimin e standardeve dhe rregulloreve të përbashkëta”, tha Chen.

Gjashtë incidentet e zbuluara rishtazi varionin nga modelet që linin udhëzime për veten e tyre të ardhshme për të mbuluar gjurmët pas mashtrimit deri te përdorimi i çelësave API të zbuluar në GitHub — me incidentin më të hershëm që ndodhi në tetor.

Një model i papublikuar i familjes Astra futi udhëzime të ngjashme me jailbreak në përmbledhjet e veta të kontekstit, duke përfshirë udhëzime për të injoruar mesazhet e zhvilluesve. OpenAI identifikoi 27 përmbledhje të prekura.

Gjatë trajnimit GPT-5.6 Sol, modelet synonin të fshihnin gabimet, të shpiknin të dhëna historike që mungonin dhe të fshihnin mospërputhjet midis versioneve burimore.

Një model kërkoi në depot publike të GitHub për çelësa API të ekspozuar dhe u përpoq të përdorte llogari email-i të disponueshme përpara se të sajonte të dhëna për të ardhurat kur nuk mundi të merrte informacionin e kërkuar.

Modelet ngarkuan të dhëna dhe një imazh detyre në shërbimet publike të strehimit të skedarëve në dy raste në tetor dhe janar për të marrë citime ose rezultate të kërkimit të imazheve të jashtme, pa e pyetur përdoruesin.

Modelet përdorën depon e brendshme Artifactory të OpenAI si një tabelë mesazhesh për të shkëmbyer kërkesa dhe përgjigje nëpër mostra të veçanta trajnimi.

Agjentët bashkëpunues ngarkuan një libër pune në shërbimet publike të strehimit në mënyrë që agjentët e tjerë të mund ta merrnin atë, pavarësisht udhëzimeve për të përdorur vetëm skedarë lokalë.

Për të adresuar çështje të ngjashme në të ardhmen, OpenAI thotë se çdo punonjës mund të raportojë një rast të dyshuar për shqyrtim nga ekipet e sigurisë dhe të harmonizimit. Rastet do të vendosen në një shinë “gati për zbulim”, “hetim të vogël” ose “hetim më të madh”.

OpenAI thotë se incidentet që janë “gati për zbulim” do të raportohen publikisht brenda gjashtë ditëve pune, ndërsa ato që kërkojnë një hetim të vogël do të raportohen brenda 12 ditëve pune.

OpenAI thotë se rruga më e ngadaltë do të zbatohet përgjithësisht për rastet komplekse që përfshijnë palë të treta, dhe procesi i zbulimit do të jetë më i gjatë.

Kompania thotë se mund të lëshojë një njoftim fillestar përpara se të përfundojë hetimi, por detyrimet për siguri, ligj dhe deklarim të përgjegjshëm mund të vonojnë publikimin e detajeve.

“Ne nuk besojmë se industria e inteligjencës artificiale e ka zgjidhur çështjen e harmonizimit dhe monitorimit në një shkallë të mjaftueshme për t’u shkallëzuar në mënyrë të përgjegjshme me shpejtësi maksimale”, tha Chen.

“Hapat si zbulimi i përgjegjshëm janë pjesë e mënyrës se si ne mund të ritmojmë në përgjithësi dhe t’i ofrojmë më shumë transparencë publikut mbi proceset dhe standardet tona të sigurisë dhe të harmonizimit.”

OpenAI thotë se korniza favorizon transparencën edhe kur rëndësia e një incidenti është e pasigurt.

Gjithashtu thotë se dëshiron të zhvillojë kritere më objektive të zbulimit me zhvillues të tjerë të IA-së, studiues, organe standardesh dhe rregullatorë.

OpenAI thotë se punonjësit që besojnë se një incident duhet të zbulohet, por që anulohet, mund ta përshkallëzojnë çështjen tek udhëheqja e lartë.

Njoftimet vijnë pas zbulimit të OpenAI se modelet nën vlerësim i shpëtuan kontrolleve të synuara dhe kompromentuan pjesë të sistemeve të Hugging Face.

Llogaria e OpenAI thotë se modelet fituan akses në internet, shfrytëzuan dobësitë dhe aksesuan të dhëna private të kufizuara. Kompania e ka përshkruar atë ngjarje si aktivitetin e saj më të rëndë të këtij lloji të drejtuar nga modeli deri më sot.

Ndërsa një numër teknologësh të profilit të lartë – përfshirë CEO-n e Anthropic – kanë frikë se incidenti i Hugging Face ishte vetëm fillimi i pushtimit të internetit nga agjentët e inteligjencës artificiale në mënyra të paparashikuara, shumë ekspertë të sigurisë kanë paralajmëruar se shumë nga këto incidente mund të ishin parandaluar me kontrolle bazë kibernetike në vend.

OpenAI i tha Axios se i sheh incidentet si rezultat i dy faktorëve: Mospasjes së kontrolleve të mjaftueshme të sigurisë më parë për të kapur këto incidente keqpozicionimi dhe modeleve që përparojnë me një shpejtësi më të madhe nga sa mund të kishin parashikuar.

“Mendoj se është një kombinim,” tha Chen. “Është e vërtetë që aftësitë e modelit janë rritur më shpejt nga sa prisnim, por ka edhe gjëra të brendshme që mund t’i ndryshojmë dhe përmirësojmë.”

“Ne duhet të bëjmë një hap përpara për t’iu përshtatur kësaj epoke të re të zhvillimit të inteligjencës artificiale, dhe zbulimet vullnetare duhet të jenë pjesë e kësaj.”