Çipi i OpenAI-së mposht Blackwell të Nvidia-s

foto

OpenAI ka kaluar dy vitet e fundit duke ndërtuar në heshtje “Jalapeño”, një çip inference i njoftuar së fundmi në Hot Chips. Thashethemet për një kapeting të suksesshëm kishin qarkulluar për një kohë. Por tani kemi detaje. OpenAI na ftoi të shikonim çipin e tyre, të shkonim në laboratorët e tyre për të parë se sa i vërtetë është dhe ta krahasonim atë me paketën tonë InferenceX.

Në qershor, OpenAI zbuloi programin e çipave në partneritet me Broadcom, të ndërtuar nga një fletë e zbrazët ekskluzivisht për LLM inference. Puna e projektimit filloi në mesin e vitit 2024, duke kaluar nga punësimi fillestar i ekipit deri te prodhimi me anë të shiritit të të dhënave në ~16 muaj, një cikël jashtëzakonisht i shpejtë zhvillimi i ASIC.

Në përgjithësi, çipat e gjeneratës së parë nuk janë konkurrues, por OpenAI kundërshton trendin duke qenë lider në industri dhe duke tejkaluar çdo çip Nvidia, AMD dhe Google që kemi qenë në gjendje të testojmë në shumë modele kryesore me burim të hapur. OpenAI e bën këtë me një dizajn ekstrem të kodit të harduerit dhe softuerit. Çuditërisht, OpenAI nuk është tepër i specializuar në ndonjë pjesë specifike të nxjerrjes së modelit, por përkundrazi duke u përqendruar në të qenit një çip i përgjithshëm që ofron performancë të lartë në të gjitha skenarët.

Në këtë artikull, do të shqyrtojmë detajet arkitekturore, detajet e softuerit dhe rezultatet e performancës për Jalapeño në InferenceX.

foto

Të gjithë thonë se çipi i OpenAI është i specializuar për modelet OpenAI, por kjo është e gabuar, OpenAI krijoi një çip të përgjithësuar për përfundime të inteligjencës artificiale.

Afatet kohore janë të çmendura. Kjo tregon se pretendimet se përdorimi i inteligjencës artificiale po përdoret për të përshpejtuar dizajnin e çipave janë të vërteta. Pavarësisht afateve të shpejta kohore, Open AI shpenzoi një sasi të madhe parash, mori vendime pragmatike për dizajnin dhe ekipi i tyre është i paaftë, kështu që kjo nuk është surprizë.

Vetëm duke parë specifikimet, është një konkurrent i menjëhershëm:

foto

Dhe përdorimi i HBM4 e bën atë të dallohet si i krahasueshëm me GPU-të kryesore nga NVIDIA dhe AMD:

foto

Një pjesë e madhe e mbulimit mediatik të këtij çipi ka ardhur pas disa komenteve të pavëmendshme nga OpenAI që pretendojnë se çipi do të optimizohet për modelet e tyre në një mënyrë që çipat e tjerë nuk janë. Kjo është e gabuar. Jalapeño është një çip i përgjithësuar i inferencës i aftë të ekzekutojë të gjitha llojet e modeleve dhe të gjitha llojet e ngarkesave të punës, duke përfshirë edhe testin tonë të referencës InferenceX, ku ne e ekzekutuam testin e referencës me inxhinierët e OpenAI në laborator. Si shaka, OpenAI madje na e tregoi atë duke ekzekutuar Doom, i cili u portua në çipin e tyre vetëm me udhëzimet e Codex.

Më poshtë është rezultati ynë kryesor i performancës/përfitimit, duke parë xhiron e tokenëve për MW të shërbimit All-in. Jalapeño ia kalon çdo çipi tjetër . E gjithë kjo bëhet pa Parashikimin e Shumë Tokenëve (MTP), ndërsa çipat e tjerë në tabelë janë konfigurimet me performancën më të mirë të secilës SKU përkatëse, të gjitha me MTP.

foto

Jalapeño e tejkalon Blackwell në perf/W në pothuajse të gjitha skenarët pa u akorduar për ndonjë pikë specifike në kurbë. Ai shkëlqen jo vetëm në skenarët me latencë të ulët, por edhe në skenarët me rendiment të lartë. Një krahasim më i përafërt është kundër rezultateve të Parashikimit të Single Token, ai i rrëzon të gjithë konkurrentët. Në skenarë të njëkohshëm të ulët, Jalapeño demonstron ndërveprim të jashtëzakonshëm, duke arritur mbi 700 tokena për sekondë për përdorues në njëkohshmëri 1 në modelin DeepSeek R1.

Çuditërisht, e gjithë kjo arrihet me parashikim të vetëm me shenjë (STP), pa dekodim spekulativ dhe pa disagregim paraprak të dekodimit. Përveç DeepSeek R1, pamë edhe disa modele të tjera, duke përfshirë Kimi-K2.5 dhe GPT-OSS të cilat funksionuan me afërsisht 1,400 tok/sek/përdorues. Për të gjitha modelet, konfirmuam se vlerësimet GSM8k të Jalapeño arritën rezultate të barabarta me çipat Nvidia.

Disa paralajmërime për këtë. Së pari, të gjitha numrat na janë dhënë nga OpenAI. Ne verifikuam ekzekutimet e InferenceX personalisht në laborator, por nuk ekzekutuam të gjithë grupin e testeve të InferenceX dhe as nuk kemi parë rezultate të AgentX . AgentX është grupi ynë i preferuar për krahasimin e performancës së çipave për shkak të kontekstit të gjatë të të dhënave dhe karakteristikave shumë-kthyese që pasqyrojnë sjelljen e memorjes cache të rrjedhave të punës realiste të prodhimit. Kornizat që performojnë mirë në 8k1k mund të performojnë më keq në AgentX pasi ngarkesat reale të prodhimit i stresojnë komponentët si routerët, mekanizmat e memorjes cache të prefiksit, menaxhimin e memorjes cache, infrastrukturën e shkarkimit, etj. Këto nuk testohen nga 8k1k me një kthesë të vetme. Lexoni më shumë rreth kësaj në artikullin tonë të AgentX.

Së dyti, ne besojmë se krahasimi me Blackwell është disi i paplotë dhe i padrejtë. Jalapeño po konkurron me çipa si Rubin që përdorin gjithashtu HBM4. Sistemet Vera Rubin po fillojnë t’u dërgohen klientëve tani, ndërkohë që do të duhet ende pak kohë para se OpenAI të ketë diçka përtej mostrave inxhinierike të Jalapeño.

Kështu, performanca duhet të krahasohet me Rubin, jo me Blackwell, dhe në një farë mënyre presim që një çip i personalizuar si Jalapeño të performojë më mirë se Blackwell. Vera Rubin NVL72 ofron 5.4 herë më shumë performancë/MW se GB200 NVL72, siç e përshkruam në artikullin tonë që analizon pretendimet e performancës së NVIDIA në lançimin e tyre me CoreWeave muajin e kaluar. Do ta krahasojmë shifrat e performancës së Jalapeño me ato të Vera Rubin për korrik më poshtë.

Së treti, modelet që po testohen nuk janë në kufirin e hapur. NVIDIA dhe AMD kanë publikuar rezultate në modele më të mëdha si DeepSeek V4 Pro dhe Kimi K3, duke përdorur AgentX. Sa më i madh modeli dhe sa më i fundit të jetë lëshimi, aq më e komplikuar është të nxjerrësh në pah një çip të ri. Duke thënë këtë, modelet që OpenAI ka duke punuar në Jalapeno nuk janë edhe aq të vogla.

Dizajnet OpenAI për perf/W. Arsyeja është e thjeshtë: OpenAI aktualisht është i kufizuar nga fuqia e qendrës së të dhënave, jo nga buxheti apo hapësira e dyshemesë, dhe për këtë arsye tokenët për MW janë parësore. Në Computex 2026, Jensen tha se perf/W, besueshmëria dhe jetëgjatësia e gjatë janë karakteristikat kryesore të GPU-ve të ardhshme. Për të cituar: “Nëse keni 1 gigavat energji, atëherë rendimenti për vat është të ardhura”. Ai përmendi gjithashtu se zgjedhja e arkitekturës së gabuar vetëm sepse çipat janë më të lirë nuk ka kuptim.

foto

Kjo u theksua nga Nvidia gjatë fjalimit të Vera në Hot Chips 2026, ndërsa tregoi të njëjtin grafik të të ardhurave: “Qendra e të dhënave është e kufizuar në energji sot.” Energjia ka rëndësi dhe nxit të ardhurat.

Operatorët nuk mund të marrin thjesht më shumë MW sepse shtimi i GPU-ve dhe shtimi i kapacitetit të rrjetit ndodh në afate kohore shumë të ndryshme. Zarfat e energjisë së qendrave të të dhënave kanë kufizime të tilla si ndërlidhja e tyre e shërbimeve, infrastruktura, kapaciteti i ftohjes dhe dizajni i gjenerimit të UPS/rezervës. Vonesat në rrjet tejkalojnë në mënyrë të përsëritur afatet kohore të pajisjeve dhe ndërtimit, duke nxitur nevojën për kapacitet energjie BtM (pas matësit): turbina me gaz dhe gjeneratorë në vend të ndërtuar dhe të vendosur në vetë qendrën e të dhënave. Ky kapacitet ndodhet pas matësit të shërbimeve në vend që të tërhiqet nga rrjeti publik. Ai i lejon një operatori të furnizojë me energji një strukturë pa pritur për ndërlidhjen e rrjetit dhe përmirësimet e shërbimeve, kjo është pikërisht arsyeja pse Colossus 2 i xAI mbështetet kaq shumë në BtM ndërsa lidhja e tij aktuale me rrjetin mbetet shumë prapa. Mësoni më shumë në modelin tonë të Energjisë .

Siç shkruam në një postim të X-it, tok/s/MW reduktohet në tokena për xhaul, meqenëse një vat është një xhaul për sekondë. Kjo e bën tok/s/MW përfaqësues të efikasitetit dhe aftësisë së një sistemi për të shndërruar energjinë në tokena.

foto

Në këtë aspekt, edhe kur krahasohet me Rubin, Jalapeño fiton. Jalapeño i OpenAI ka një xhiro të tokenave të prodhimit STP për MW, duke tejkaluar rezultatet MTP të Vera Rubin që NVIDIA dhe CoreWeave publikuan në korrik. Gjithashtu, ai i tejkalon shumë rezultatet MTP të GB200 për vitin 2025. Siç u përmend në artikullin tonë për Vera Rubin, VR u krahasua me rezultatet e GB200 për vitin 2025 sepse ajo ishte një fazë e ngjashme e nxjerrjes në pah të hershme, dhe krahasimi me GB200 në vitin 2025 e mban konstante pjekurinë e softuerit. Duke ndjekur këtë logjikë, ne krahasojmë rezultatet e fundit të Vera Rubin për korrikun 2026, rezultatet e GB200 për vitin 2025 dhe rezultatet e sotme të Jalapeño. Ky është një krahasim shumë i vlefshëm pasi këto janë numrat më të mirë publikë të Rubin, dhe OpenAI e përpunoi çipin e tyre pas Rubin. Si OpenAI ashtu edhe Rubin janë ende të papjekur, kështu që performanca do të vazhdojë të rritet.

foto

Në perf/TCO, Vera Rubin dhe Jalapeño janë kokë më kokë, duke prodhuar pothuajse të njëjtin numër tokenësh dalës për $. Megjithatë, siç u përmend më parë, rezultatet e Jalapeño-s merren pa dekodim spekulativ dhe rezultatet e Vera Rubin përdorin dekodim spekulativ. Dekodimi spekulativ çon në një ulje prej ~3-5 herë të kostos për token. Kur dekodimi spekulativ zbatohet në Jalapeño, kjo do t’i mundësojë Jalapeño-s t’u shërbejë tokenëve edhe më me kosto efektive. Sigurisht, një pjesë e këtij avantazhi TCO vjen nga shkëmbimi i marzheve të larta të Nvidia-s për marzhet më të ulëta (megjithëse ende të larta) të Broadcom. Por kjo nuk është e gjitha. Për shembull, programet AI ASIC të Meta dhe Microsoft që nuk po fillojnë pavarësisht se kanë qenë në këtë drejtim për shumë më gjatë tregon se kostoja është vetëm një pjesë e ekuacionit. Për ndarjen e plotë të TCO-së së Jalapeño-s, shihni modelin TCO të SemiAnalysis AI Cloud.

foto

Nga ana arkitekturore, OpenAI zgjodhi të mos e ndante para-mbushjen dhe dekodimin (PD) nëpër grupe të veçanta çipash. Modeli draft dhe modeli kryesor ndajnë të njëjtat çipa dhe strukturë, një filozofi dizajni që shkëmben njëfarë efikasiteti teorik për operacione praktike. Motivimi është se përzierja e ngarkesës së punës ndryshon me kalimin e kohës, për shembull, raporti i hyrjes ndaj shkrimit në memorje cache ndaj leximit në memorje cache ndaj tokenëve të daljes ka ndryshuar ndjeshëm ndërsa kemi kaluar nëpër tre epokat e modeleve ( njohuri, arsyetim dhe agjent, siç u diskutua në artikullin tonë të fundit ). Prandaj, zgjedhja e një sasie fikse të silikonit heterogjen të para-mbushjes dhe dekodimit të silikonit paraprak mund të çojë në joefikasitete me kalimin e kohës. OpenAI zgjedh një grup homogjen në këtë arkitekturë dhe përpiqet ta bëjë çipin të funksionojë mirë në gjithçka.

Dhe ia del. Në Kimi K2.5 (mbi të cilin bazohet Cursor Composer 2.5), Jalapeño arrin gati 700tok/s/përdorues dhe më shumë se 9 herë më shumë se çipi tjetër me performancën më të mirë prej 100tok/s/përdorues.