OpenAI rishkruan kornizën e sigurisë, ndërsa trajnimi më i madh mbetet i pezulluar

foto

OpenAI rifilloi shumë ngarkesa pune më të vogla trajnimi, por programi i saj më i madh i planifikuar për trajnime në kufij është ende i ngrirë. Monitorimi pritet të shtojë rreth 20% kosto llogaritëse, ndërsa provat kryesore të Astra-s dhe shkeljeve mbeten të pabotuara. Testi është ajo që ndodh përpara se të rifillojë trajnimi në kufij.

foto

OpenAI po e mban pezull programin e saj më të madh të planifikuar të mësimit me përforcime në kufij, ndërsa rishkruan Kornizën e saj të Përgatitjes, edhe pse shumë ngarkesa pune më të vogla ose me risk më të ulët rifillojnë nën kontrolle më të rrepta. Kompania tha në njoftimin e saj të 18 gushtit 2026 se monitorimi i zgjeruar do të konsumojë afërsisht 20% të llogaritjes së përdorur nga procesi që po vëzhgohet, duke shtuar një kosto burimesh ndërsa shqyrton veprimet e mjeteve, gjurmët e arsyetimit të disponueshme dhe regjistrat e aktiviteteve në pjesën më të madhe të zhvillimit. Monitorimi mbështetet pjesërisht në modele të tjera të IA-së për të hetuar sjelljen dhe përshkallëzuar problemet e mundshme nga i gjithë procesi i zhvillimit deri te siguria njerëzore, mbrojtja dhe ekipet e kërkimit. OpenAI ndaloi trajnimin e mësimit me përforcime të fokusuar në vendosje për pak më shumë se dy javë përpara se të riniste shumë ngarkesa pune më të ngushta, por vonesa e vazhdueshme vonon një eksperiment të madh në kufij, ndërsa kompania ngre kërkesat e izolimit për mjediset kërkimore dhe e zhvendos punën e harmonizimit në fazat e hershme të trajnimit në vend që ta përqendrojë atë pranë vendosjes.

foto

Një numër i konsiderueshëm i ngarkesave të punës së Astra-s dhe kibernetikës mbeten gjithashtu të pezulluara. Trajnimet dhe vlerësimet në shkallë më të vogël do të vazhdojnë, ndërsa studiuesit vlerësojnë sjelljen e modelit, testojnë masat mbrojtëse dhe kërkojnë më shumë prova të përputhjes.

Astra është një model i papublikuar i OpenAI që mund të arrijë pragun kritik kibernetik të kompanisë. Shkelja e sigurisë Hugging Face në korrik ishte një incident i veçantë vlerësimi që përfshinte një sistem tjetër të papublikuar të OpenAI, jo Astra. Astra nuk ishte e përfshirë në atë shkelje. Ngarkesat e punës së ndaluara të Astra-s, pra, përfshijnë një model të ndryshëm nga ai i përfshirë në vlerësimin e korrikut.

Mësimi përforcues është faza që përshtat sjelljen pas trajnimit të modelit bazë duke shpërblyer përgjigje të caktuara. Pauza nuk ndaloi të gjitha kërkimet ose punën në produktet e fokusuara te klientët.

Sistemi i zgjeruar shqyrton veprimet e mjeteve, gjurmët e arsyetimit të disponueshme dhe regjistrat e aktivitetit në pjesën më të madhe të procesit të zhvillimit. Është projektuar për të njoftuar ekipet e sigurisë njerëzore, mbrojtjes dhe kërkimit brenda 30 minutave pas shfaqjes së aktivitetit përkatës. Ky është objektivi i përgjigjes së OpenAI, jo një rezultat i validuar në mënyrë të pavarur.

Hulumtime të tjera të inteligjencës artificiale kanë zbuluar se gjurmët e arsyetimit nuk pasqyrojnë gjithmonë me saktësi qëllimet e një modeli. OpenAI thotë se procedurat e saj të trajnimit synojnë të zvogëlojnë mundësinë që sistemet të mësojnë të fshehin qëllimet në ato gjurmë. Ka premtuar detaje të mëtejshme, por asnjë nuk ishte publikuar deri më 18 gusht.

OpenAI kishte monitorë të aftë për të inspektuar planet e modelit, por nuk i zbatoi ato në vlerësimin e Hugging Face në korrik sepse nënvlerësoi aftësitë e sistemeve. Drejtori ekzekutiv i Hugging Face, Clem Delangue, e quajti monitorimin e ngushtë të regjistrave dhe gjurmëve të agjentëve “101 të monitorimit të agjentëve, veçanërisht në kufi”.

OpenAI po rrit gjithashtu kërkesat e izolimit për mjediset kërkimore. Dizajni i ri synon të parandalojë që një ngarkesë pune e kompromentuar ose shërbim mbështetës të fitojë akses në internet ose rrjete të tjera të brendshme më vete.

Puna e përshtatjes do të fillojë më herët në stërvitje, në vend që të përqendrohet pranë vendosjes. Kërkesat do të rriten ndërsa modelet bëhen më të afta, me vrapimet më të mëdha që përballen me standardin më të lartë përpara se të rifillojnë.

OpenAI nuk e ka publikuar ende raportin teknik të premtuar të shkeljes së Hugging Face. Gjithashtu, nuk ka publikuar provat që qëndrojnë pas klasifikimit të mundshëm kritik të Astra-s. Të dhënat e disponueshme nuk tregojnë se si funksionojnë kontrollet e reja nën ngarkesat e punës live frontiere.

Kompania planifikon të përfshijë organizata të jashtme në rishikimin e Kornizës së Gatishmërisë, por nuk ka dhënë një datë publikimi. Mia Glaese, e cila drejton punën e sigurisë dhe harmonizimit në OpenAI, e përshkroi gjendjen operative më qartë: “Jemi shumë larg kthimit të gjithçkaje në normalitet”.