OpenAI do të kufizojë aftësitë e Astra-s në fushën e sigurisë kibernetike

foto

OpenAI ndau detaje të reja mbi modelin e saj të ardhshëm Astra, të cilin kompania tha se është modeli i parë me gjuhë të madhe që përmbush “pragun kritik të sigurisë kibernetike”, në përgatitje për publikimin e tij të afërt.

foto

“Ne planifikojmë ta bëjmë Astra-n të disponueshme së shpejti”, thuhet në postimin në blog të OpenAI, “por qasja në aftësitë e saj më të përparuara të sigurisë kibernetike do të jetë më e kufizuar”.

foto

Laboratori i nivelit të lartë përcaktoi se Astra është e aftë të gjejë të meta të panjohura sigurie në sistemet kompjuterike dhe t’i shfrytëzojë ato pa udhëzimin e një personi. Kjo është e ngjashme me shqetësimet që Anthropic ngriti në lidhje me modelin e saj Mythos më herët këtë vit, dhe OpenAI po merr masa paraprake të krahasueshme ndërsa përgatitet të lançojë Astra-n.

Pa ndonjë konfirmim nga një palë e tretë, është e vështirë të vlerësohen pretendimet e OpenAI në lidhje me sigurinë ose përgatitjen. Kompania tha se do ta shihte paraprakisht modelin me një grup testuesish, por nuk tha se kush ishin ata ose si do të zgjidheshin. Nuk është e qartë nëse OpenAI po punon me qeverinë amerikane për të vlerësuar modelin përpara publikimit.

OpenAI vuri në dukje se Astra shënoi një rezultat perfekt në ExploitBench, një vlerësim i aftësisë së një LLM për të hakuar dobësitë e njohura të sistemit. Në një version të modifikuar të testit të zhvilluar nga inxhinierët e OpenAI, modeli zbuloi dhe shfrytëzoi dy dobësi zero-day, tha kompania.

Për t’u siguruar që modelet e saj nuk shfrytëzohen nga aktorë të këqij dhe as nuk janë të afta për sjellje të keqe, OpenAI tha se kishte filluar tashmë të përmirësonte aftësinë e modelit për të zbuluar abuzimet dhe për të parandaluar jailbreak-et.

Megjithatë, për Astra-n, kompania investoi në teknika të reja të paspecifikuara, të dizajnuara për ta bërë modelin më të sigurt. OpenAI gjithashtu ka filluar të identifikojë “llogaritë e vlerësuara si me rrezik më të lartë” dhe të kufizojë përgjigjet e modelit në kërkesat e tyre, megjithëse nuk tregon se si. Së fundmi, megjithëse kompania e përshkruan Astra-n si “modelin e saj më të përafruar deri më sot”, ajo do ta vendosë modelin me monitorim shtesë të zinxhirit të mendimit për të dalluar dhe ndaluar sjelljen e keqe.

Përgatitjet për publikimin e Astra-s vijnë ndërsa industria reagon ndaj agjentëve të OpenAI që dalin nga një mjedis trajnimi dhe qasen në të dhëna private në Hugging Face, një model dhe platformë shpërndarjeje e njohur standarde.

Për Astra-n, OpenAI tha se kishte hartuar një test për të tunduar modelin e ri që të replikonte veprimet e agjentëve mashtrues në incidentin Hugging Face, të cilët bashkëpunuan për të hyrë në internetin e hapur pavarësisht masave mbrojtëse të aplikuara nga studiuesit e OpenAI. Ata thanë se Astra nuk u përpoq të dilte nga mjedisi i saj i testimit në këto eksperimente.

Yona Shavit, një ish-punonjëse e OpenAI e cila tani punon në rezistencën ndaj IA-së në Fondacionin OpenAI, pyeti veten në mediat sociale nëse mosgatishmëria e Astra-s për të thyer rregullat mund të ketë qenë rezultat i njohurisë së asaj që pritej prej saj apo i përpjekjes për të mashtruar studiuesit.

Dhe pavarësisht të gjitha këtyre detajeve të reja, është ende e vështirë të dihet saktësisht se çfarë është e aftë të bëjë Astra ose nëse OpenAI po merr masat e duhura për të siguruar sigurinë. Kompania tha se pret të publikojë më shumë vlerësime të modelit dhe informacione të mëtejshme mbi sigurinë kur të lançohet gjerësisht për publikun.