Claude Opus 5 i Anthropic kushton shumë më pak se Fable 5, ndërsa e barazon ose e tejkalon atë në shumicën e testeve matëse
Claude Opus 5 i Anthropic është modeli më i aftë i inteligjencës artificiale që është në dispozicion sot, sipas disa testeve referuese, duke tejkaluar performancën e Fable 5 ndërsa kushton më pak.
Opus 5 mori 61 pikë në Indeksin e Inteligjencës së Analizës Artificiale, i cili kombinon nëntë teste që mbulojnë punën me njohuritë, kodimin, arsyetimin shkencor dhe saktësinë faktike. Kjo e vendos atë pak përpara Claude Fable 5 (60), GPT-5.6 Sol (59), Kimi K3 (57) dhe Claude Opus 4.8 (56). Artificial Analysis punoi me Anthropic për të testuar modelin para publikimit të tij.
Në kodim, Claude Opus 5 në “xhigh” i çiftëzuar me Claude Code ndan vendin e parë në Indeksin e Kodimit të Analizës Artificiale, i cili mat se sa mirë modelet e IA-së i trajtojnë detyrat e programimit më vete, duke përfshirë gjetjen dhe rregullimin e gabimeve. Në Terminal-Bench v2.1, i cili teston agjentët si inxhinierë autonomë në mjedise terminale reale, Opus 5 shënoi 89 përqind në “max”, duke u barazuar me liderin e mëparshëm GPT-5.6 Sol.

Për arsyetim shkencor, Opus 5 shënoi 53 përqind në Humanity’s Last Exam, një test shumë i vështirë njohurish që mbulon shumë fusha akademike. Kjo e lidh atë me Fable 5. Në CritPt, një test krahasues fizik nga studiuesit në Laboratorin Kombëtar Argonne dhe UIUC, ai përsëri përputhet me Fable 5, por është pas GPT-5.6 Sol, GPT-5.5 Pro dhe GPT-5.6 Terra.
Saktësia faktike mbetet një pikë e dobët: Në AA-Omniscience, e cila teston saktësinë e pretendimeve të njohurive të një modeli, Opus 5 u përmirësua me 7 pikë krahasuar me Opus 4.8, por prapëseprapë është më poshtë se Fable 5. Opus 5 gjithashtu përgjigjet më shpesh kur është i pasigurt, duke e çuar shkallën e halucinacioneve me 14 pikë në 50 përqind.
Epoch AI ka testuar gjithashtu Claude Opus 5. Instituti i kërkimit i dha atij një rezultat të përgjithshëm prej 159 në Indeksin e Aftësive Epoch, pak më poshtë se Fable 5 në 161. Megjithatë, kur shikohen vetëm standardet e inxhinierisë së softuerëve (SWE-ECI), Opus 5 barazohet me Fable 5 në 161, duke tejkaluar GPT-5.6 Terra dhe Claude Opus 4.8. GPT-5.6 Sol kryeson në të dyja kategoritë.

Në përgjithësi, kjo konfirmon se gara midis modeleve të përparuara është e ngushtë. Asnjë model i vetëm nuk mund të shkëputet ose të pretendojë një avantazh të qartë. Kjo i jep peshë argumentit se modelet e inteligjencës artificiale përfundimisht do të bëhen të komercializuara.
Detyra mesatare e Indeksit të Inteligjencës kushton 2.03 dollarë me Opus 5, më pak se Claude Fable 5 me rezervë prej 2.75 dollarësh. Kushton më shumë se Opus 4.8 me 1.80 dollarë dhe Sonnet 5 me 1.53 dollarë. Megjithatë, në nivelet “të larta” dhe “xhigh”, Opus 5 i tejkalon si Opus 4.8 ashtu edhe Sonnet 5, por kushton më pak.
Vals.ai testoi Claude Opus 5 në të pesë nivelet e arsyetimit duke përdorur Vibe Code Bench, një pikë referimi për detyrat e programimit. Rezultatet rriten nga 76.7 përqind në nivelin “të ulët” në 82 përqind në nivelin “mesatar” dhe 89.8 përqind në nivelin “të lartë”. Performanca bie në dy nivelet më të larta, me “xhigh” që shënon 88.3 përqind dhe “max” që shënon 88.4 përqind pavarësisht kostove shumë më të larta.
Vals.ai zbuloi se nivelet më të larta kanë tendencë të prodhojnë zgjidhje më komplekse që përmbajnë gabime më shpesh. Niveli “i lartë” prodhon zgjidhje më të thjeshta që i plotësojnë kërkesat në mënyrë më të besueshme.

Terminal-Bench 2.1 tregon një model të ngjashëm. Niveli “i lartë” e tejkalon nivelin “max” sepse modeli shpenzon më shumë kohë në secilën përpjekje në nivelin më të lartë, duke lënë më pak përpjekje brenda afatit kohor. Kjo përputhet me udhëzimet e Anthropic, me nivelin “i lartë” të vendosur si niveli parazgjedhur si në API ashtu edhe në Claude Code.
Çmimi i tokenëve mbetet 5 dollarë për milion token hyrës dhe 25 dollarë për milion token dalës. Shkrimet në memorje të përkohshme kushtojnë 6.25 dollarë për milion token me një jetëgjatësi prej pesë minutash, ndërsa goditjet në memorje të përkohshme kushtojnë vetëm 0.50 dollarë për milion token.
Opus 5 performon veçanërisht mirë në testin AA-Briefcase, i cili mat se sa mirë modelet e IA-së i trajtojnë detyrat tipike të zyrës, si shkrimi i raporteve kërkimore, ndërtimi i prezantimeve dhe analizimi i spreadsheet-eve bazuar në mijëra skedarë hyrës. Performanca vlerësohet në saktësi, cilësi analitike dhe cilësi prezantimi, dhe më pas përfshihet në një vlerësim Elo të ngjashëm me renditjet e shahut.
Në arsyetimin maksimal, Opus 5 arrin një Elo prej 1720, plot 146 pikë përpara Claude Fable 5 (1574). Tre nivelet e tij më të larta (max, xigh, high) zënë tre vendet e para. I kombinuar me Fable 5, Sonnet 5 dhe Opus 4.8, Anthropic tani mban shumicën dërrmuese të pozicioneve në 10 vendet e para.

Kostoja për detyrë ra me 20 përqind në 17.79 dollarë, nga 22.30 dollarë për Fable 5. Varianti “xhigh” kushton 14.26 dollarë, dhe “high” kushton vetëm 10.41 dollarë, më pak se gjysma e Fable 5. Të dy ende e kalojnë Fable 5 në renditjen Elo. Me performancë mesatare, Opus 5 arrin një Elo prej 1470, menjëherë pas GPT-5.6 Sol (maksimumi, 1505). Me performancë të ulët, ai arrin 1223 Elo, pak më poshtë GLM-5.2 (maksimumi, 1254).


Përparimet më të mëdha të Opus 5 shfaqen në cilësinë analitike. Në “maksimum”, ai arrin një Elo të Cilësisë Analitike të vitit 2016, pothuajse 300 pikë përpara Fable 5. Shkalla e Kalueshmërisë së Rubrikës, e cila gjurmon se sa shpesh modeli përmbush standardet e paracaktuara të cilësisë, është 58 përqind (“maksimum”), 57.2 përqind (“xhigh”) dhe 56 përqind (“i lartë”). Cilësia e prezantimit është një histori tjetër. Opus 5 shënon një Elo Prezantimi prej 1628, rreth 40 pikë pas GPT-5.6 Sol në “maksimum” (1666).
Më shumë performancë kërkon më shumë kohë: Në “maksimum”, Opus 5 ka nevojë për mbi 36 minuta për detyrë dhe mesatarisht bën 103 pasime, rreth 50 përqind më shumë se Opus 4.8 me 24 minuta dhe 55 pasime.
