Agjenti i kodimit i Nvidia-s shkëlqen në testin ARC-AGI-3
NVIDIA sapo ka demonstruar rëndësinë në rritje të një sistemi të mirë për të përdorur një model të caktuar të inteligjencës artificiale duke i lejuar agjentit të saj të kodimit AVO të provojë të dhënat publike ARC-AGI-3, ku arriti të kalojë me sukses të gjitha 183 nivelet e 25 lojërave të disponueshme publikisht, dhe kjo pa marrë ndonjë udhëzim apo objektiv paraprak.

AVO e NVIDIA-s është një mbështjellës rreth modelit Claude Opus 5 të Anthropic, por ndërsa Opus 5 shënoi vetëm 30 përqind në setin publik ARC-AGI-3, AVO shënoi një 100 përqind të patëmetë.

Para se të shkojmë më tej, le të diskutojmë së pari se çfarë është një parzmore e inteligjencës artificiale. Në botën e ndërlikuar të inteligjencës artificiale, një parzmore është një mbështjellës – një shtresë e jashtme softueri – që është ndërtuar rreth një modeli të caktuar të inteligjencës artificiale. Mendoni për modelin si trurin dhe parzmoren si trupin, kostumin e armaturës dhe mjetet që transformojnë një parashikues të përgjithshëm teksti në një zgjidhës problemesh.
Një parzmore efektive kryen funksionet e mëposhtme:
Ai lidh modelin e IA-së me botën e jashtme: Një model gjenerik i IA-së nuk mund të shohë një faqe interneti, të ekzekutojë një skript Python ose të bashkëveprojë me një skedar më vete, por një sistem harkimi mundet.
I lejon modelit të IA-së të krijojë një lak vetëkorrigjues, ku një problem kompleks zgjidhet përmes provës dhe gabimit. Këtu, sistemi i përfshirjes së rezultatit të çdo përpjekjeje kthehet në model për ta lejuar atë të përsëritet.
Ndihmon në menaxhimin e kujtesës afatgjatë: Ndërsa dritarja e kontekstit (inputi) rritet, modelet e inteligjencës artificiale zakonisht fillojnë të harrojnë detajet dhe informacionet e mëparshme. Megjithatë, sistemi i ruajtjes së të dhënave vepron si një bllok shënimesh – ruan fragmente kodi të suksesshme, filtron gabimet e padobishme dhe mban një regjistër të pastër të progresit të modelit në mënyrë që të mos humbasë rrjedhën e mendimit.
Ai strukturon nxitje dhe kufizime, duke zbatuar rregulla të rrepta se si duhet të mendojë modeli.
Kjo na sjell në thelb të temës së sotme. Agjenti i kodimit AVO është në thelb një parzmore rreth modelit Claude Opus 5 të Anthropic. NVIDIA fillimisht ndërtoi AVO për të optimizuar bërthamat e GPU-së CUDA, ku agjenti funksionoi në mënyrë autonome për 7 ditë, eksploroi mbi 500 drejtime dhe prodhoi bërthama që e tejkaluan FlashAttention-4 deri në 10.5 përqind.
Pa ndryshuar arkitekturën themelore të agjentit kryesor, NVIDIA më pas zëvendësoi mjetet e inxhinierisë GPU me ndërfaqen e detyrave ARC-AGI-3. Agjenti transferoi me sukses logjikën e tij të inspektimit të kodit dhe vetë-korrigjimit në një enigmë logjike vizuale dhe interaktive krejtësisht të palidhur, duke arritur të zgjidhë 183 enigmat e përfshira në të dhënat publike ARC-AGI-3 me një saktësi 100 përqind dhe pa ndonjë udhëzim apo qëllim paraprak. Duke pasur parasysh faktin se Opus 5 arriti një rezultat prej vetëm 30 përqind në të njëjtën detyrë, AVO sapo ka demonstruar vlerën fenomenale të shtuar që një parzmore efektive mund të sjellë në tryezën proverbiale.
Sipas NVIDIA, AVO zgjidhi 183 nivelet duke përdorur një total prej 6,624 veprimesh. Kjo përfaqëson një rritje prej 12 përqind të efikasitetit krahasuar me mbështjellësit e tjerë kryesorë të agjentëve si VISTA, i cili kërkonte 7,542 veprime për të pastruar grupin publik.
Vini re se platforma e vlerësimit ARC-AGI-3 aktualisht nuk lejon që skemat e agjentëve të jashtëm të ndërtuara me porosi të funksionojnë kundër grupit të saj privat të fshehur. Kjo do të thotë që nuk e dimë se si do të kishte performuar AVO në këtë grup të dhënash më të rëndësishme.
