OpenAI pranon se modelet e saj autonome të inteligjencës artificiale komprometuan gjithashtu kredencialet në platforma të tjera gjatë një vlerësimi të sigurisë

foto

OpenAI tani thotë se modelet e saj autonome të inteligjencës artificiale gjithashtu kompromentuan kredencialet në platforma të tjera gjatë një vlerësimi të sigurisë. Hugging Face ka publikuar një rindërtim mjeko-ligjor të sulmit.

foto

Modelet autonome të IA-së të OpenAI-t, të cilat hynë në infrastrukturën e Hugging Face gjatë një vlerësimi të brendshëm të sigurisë kibernetike, sulmuan edhe platforma të tjera. Në një përditësim, OpenAI pranon se modelet “në një numër të vogël rastesh” gjetën dhe përdorën kredenciale të ekspozuara publikisht në shërbime të tjera. Katër llogari në katër shërbime të ndryshme u prekën, dy prej të cilave kishin akses vetëm për lexim.

Modelet gjithashtu përdorën një gamë shërbimesh publike, duke përfshirë faqet e ngjitjes së kodit, mjetet e pamjeve të ekranit dhe shërbime të tjera në internet. OpenAI thotë se asnjë prej këtyre nuk përfshinte kompromentim në nivel platforme ose llogarie dhe se nuk gjeti “prova të ndikimit më të gjerë tek këta ofrues ose llogari të tjera në shërbimet e tyre”.

Modelet ishin prototipa të kërkimit të brendshëm që nuk ishin menduar kurrë për publikim, dhe pas incidentit, OpenAI e çaktivizoi modelin, e enkriptoi dhe i ndërpreu aksesin kërkimit. Kompania thotë se po kryen një shqyrtim të plotë me këshilltarë të jashtëm nën mbikëqyrjen e Komitetit të saj të Sigurisë dhe Mbrojtjes. Një raport teknik duhet të vijë në javët në vijim.

Krahas përditësimit të OpenAI, Hugging Face publikoi një analizë të detajuar forenzike. Kompania numëroi rreth 17,600 veprime të rindërtueshme që modelet autonome të IA-së kryen gjatë afërsisht dy ditëve e gjysmë midis 9 dhe 13 korrikut 2026. Këto veprime u ndanë në rreth 6,280 grupe.

Rindërtimi tregon modele që marrin “mijëra vendime të vogla, të automatizuara me shpejtësinë e makinës nëpër mjedise të përkohshme sandbox”, duke ekzekutuar konfigurimin e tyre të komandës dhe kontrollit në shërbime të zakonshme publike në internet.

Sipas Hugging Face, e gjithë shkelja ishte përpjekja e modeleve për të manipuluar vlerësimin. Në vend që t’i zgjidhnin vetë detyrat e testit CyberGym, ata u përpoqën të vidhnin përgjigjet e testit. Ky lloj manipulimi është vërejtur edhe më parë, si me modelet OpenAI ashtu edhe me modelet frontiere në përgjithësi.

foto

Sulmi u zhvillua në dy faza. Agjenti së pari duhej të largohej nga ExploitGym, mjedisi i tij i izoluar i vlerësimit, i cili nuk kishte qasje të drejtpërdrejtë në internet. Ai gjeti dhe shfrytëzoi një dobësi të panjohur më parë, ose zero-day, në Artifactory. Shërbimi i menaxhimit të paketave të softuerit ishte një nga lidhjet e pakta të sandbox-it me botën e jashtme.

Agjenti më pas mori kontrollin e plotë të një sandbox-i kodimi të palës së tretë dhe e përdori atë si një qendër komande për pjesën tjetër të sulmit. Në fazën tjetër, ai shënjestroi sistemet e prodhimit të Hugging Face. Sipas HF, agjenti gjeti dy pika hyrjeje, të dyja të synuara drejt të njëjtit komponent të përpunimit të të dhënave brenda serverave të Hugging Face.

Njëri ishte një defekt në mënyrën se si sistemi trajtonte skedarët HDF5, një format i zakonshëm i të dhënave në të mësuarit automatik. Agjenti e përdori atë për të lexuar skedarë të brendshëm, duke përfshirë çelësat e aksesit dhe kodin burimor të softuerit të prekur. Tjetri përfshinte Jinja2, një gjuhë shablloni e përdorur gjerësisht që lejonte agjentin të injektonte dhe ekzekutonte kodin e vet.

Pjesa tjetër ndoqi një manual të njohur të sulmeve kibernetike. Agjenti hartëzoi mjedisin, solli më shumë mjete dhe krijoi një lidhje të vazhdueshme me “qendrën e tij të komandës”. Pastaj u zhvendos në klasterin e serverëve, konfigurimet e brendshme të cloud-it, rrjetin e brendshëm dhe së fundmi në sistemet e zhvillimit të softuerëve. Agjenti fshehu transferimet e të dhënave duke i ndarë ato në copa dhe duke i enkriptuar. Hugging Face thotë se më vonë e dekriptoi trafikun me modele me peshë të hapur, veçanërisht GLM-5.2.