Microsoft lançon modele të reja të inteligjencës artificiale të zhvilluara brenda kompanisë, të cilat sipas saj ulin kostot deri në 89% krahasuar me OpenAI

foto

Microsoft AI publikoi të mërkurën dy modele të reja të brendshme në parapamje publike MAI-Image-2.5-Pro, gjeneratori i saj i imazheve me besueshmërinë më të lartë deri më sot, dhe MAI-Voice-2-Flash, një model të foluri i ndërtuar për ngarkesa pune të ndërmarrjeve me volum të lartë ndërsa publikoi të dhëna prodhimi që përbëjnë argumentin më agresiv të kompanisë deri më tani se ajo mund të fuqizojë produktet e veta pa u mbështetur në modelet e përparuara të OpenAI.

foto

Njoftimi, i bërë nga ekipi i Superinteligjencës së Microsoft AI, vjen afërsisht një vit pasi kompania u zotua të ndërtonte modele të ndërtuara posaçërisht brenda kompanisë, dhe vjen me një nivel të pazakontë specifikimi rreth vendit ku funksionojnë këto modele tani: Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot dhe Azure. Mesazhi për blerësit e ndërmarrjeve – dhe, në mënyrë implicite, për OpenAI – është se modelet e prodhuara në vend të Microsoft nuk janë më projekte kërkimore. Ato janë infrastrukturë prodhimi që u shërben miliona përdoruesve.

foto

“Secili prej këtyre përmirësimeve është një hap drejt të njëjtit qëllim: Produktet e Microsoft-it, të mundësuara nga modelet e Microsoft-it”, shkroi kompania në blogun e saj të njoftimeve.

Dy versionet e reja zënë skajet e kundërta të asaj që Microsoft e quan kurba cilësi-shpejtësi-kosto, dhe pozicionimi është i qëllimshëm. MAI-Image-2.5-Pro ​​synon nivelin premium: imazhe heroike, redaktim të detajuar dhe renderim të saktë të tekstit në imazh – e fundit prej të cilave ka qenë prej kohësh një pikë e dobët famëkeqe për modelet e gjenerimit të imazheve. Microsoft e çmoi modelin me 5 dollarë për milion tokenë për futjen e tekstit, 8 dollarë për milion tokenë për futjen e imazhit dhe 106 dollarë për milion tokenë për daljen e imazhit. Modeli bazë MAI-Image-2.5 u lançua së fundmi në vendin e dytë për redaktimin e imazheve në Arena, tabela e renditjes së komunitetit që është bërë një tabelë rezultatesh de facto për median gjeneruese.

Industria krijuese duket se po e vëren këtë. Rob Reilly, drejtor global krijues në gjigantin e reklamave WPP, e quajti modelin Pro “një hap të fortë përpara për mjetet GenMedia” në një deklaratë të përfshirë në njoftimin e Microsoft, duke shtuar se “Microsoft e ka vendosur veten fort midis liderëve në IA gjeneruese”.

MAI-Voice-2-Flash shkon në drejtimin tjetër. I prezantuar për herë të parë në konferencën Build të Microsoft, Flash funksionon dy herë më shpejt se MAI-Voice-2 dhe kushton 32% më pak, me një çmim prej 15 dollarësh për milion karaktere. Është projektuar për tregun jo tërheqës, por gjigant të zërit me volum të lartë – qendrat e thirrjeve, agjentët e zërit dhe aplikacionet e të folurit në kohë reale, ku vonesa dhe kostoja për thirrje kanë më shumë rëndësi sesa fitimet margjinale në shprehje. Së bashku, të dy modelet pasqyrojnë një strategji të ndërtimit të familjeve të modeleve në vend të një modeli të vetëm kryesor, sepse, siç e tha kompania, një studio krijuese që ndjek besnikërinë maksimale ka nevoja shumë të ndryshme nga një operacion shërbimi ndaj klientit që trajton miliona thirrje në ditë.

Lansimet e modeleve janë padyshim më pak të rëndësishme për t’u lajmëruar sesa metrikat e vendosjes që Microsoft i ka bashkangjitur atyre — numra që duken si një rast sistematik për ndërrimin e modeleve të palëve të treta në të gjithë portofolin e produkteve të saj.

Bing Image Creator tani funksionon tërësisht në MAI-Image-2.5 , nga fillimi në fund, duke shënuar herën e parë që mjeti i imazhit për konsumatorët është plotësisht i integruar brenda kompanisë. Në PowerPoint, Microsoft thotë se MAI-Image-2.5 ul kostot e GPU-së deri në 84% krahasuar me GPT-Image-2, modelin e imazhit të OpenAI. Në OneDrive, ku MAI-Image-2.5 tani është parazgjedhja për skenarët kryesorë të redaktimit të imazheve, kompania raporton një rritje prej 26% në normat e ruajtjes, afërsisht 25% më të ulët të latencës P95 dhe 2.5 herë më shumë efikasitet nën ngarkesat e prodhimit me shfrytëzim të mesëm.

Nga ana e zërit, MAI-Voice-2-Flash tani fuqizon Dynamics 365 Contact Center — platformën e përdorur nga klientë, përfshirë T-Mobile dhe EasyJet — ku Microsoft pretendon ulje të kostos së GPU-së deri në 89%. Modeli është gjithashtu i integruar në Azure Voice Live për zhvilluesit që ndërtojnë agjentë të konvertimit të zërit në zë.

Ndoshta implementimi më i rëndësishëm është në kujdesin shëndetësor. Dragon Copilot i Microsoft-it, i përdorur nga 170,000 ofrues mjekësorë dhe përgjegjës për përpunimin e 28 milionë takimeve me pacientët tremujorin e fundit, tani funksionon në MAI-Transcribe-1.5 për rrjedhën e tij shumëgjuhëshe të punës në 58 gjuhë. Microsoft thotë se vlerësimet e brendshme tregojnë një ulje relative prej 50% si në shkallën e gabimeve të transkriptimit ashtu edhe në identifikimin e gjuhës në shumicën e gjuhëve – një pretendim kuptimplotë në një fushë ku gabimet e transkriptimit mund të përhapen direkt në shënimet klinike.

Në një postim shoqërues të publikuar po atë ditë, Microsoft detajoi metodologjinë që qëndron pas këtyre rezultateve – atë që e quan ” makina e saj e ngjitjes në kodra “, një volant i integruar i të dhënave, modeleve dhe “shfrytëzimi” i produktit që i rrethon ato.

Shembulli më i qartë është MAI-Code-1-Flash , modeli i kodimit të lehtë i lançuar në GitHub Copilot në qershor. Microsoft thotë se modeli arrin një shkallë pranimi kodi afërsisht 10% më të lartë se GPT-5.4 Mini dhe Claude Haiku 4.5 në VS Code, ndërsa përdor 10% më pak tokena mesatarë. Mbajtja e zhvilluesve tregon një histori të ngjashme: përdoruesit kishin 6% më shumë gjasa të ktheheshin gjatë disa ditëve sesa me GPT-5.4 Mini, dhe 11% më shumë gjasa sesa me Claude Haiku 4.5.

Pastaj Microsoft bëri diçka më interesante. Mori pikën e kontrollit MAI-Code-1-Flash dhe e trajnoi më tej atë brenda një mjedisi mësimor përforcues në Excel, duke i mësuar një modeli kodimi mjetet dhe rrjedhat e punës së punës me njohuritë e spreadsheet-eve. Rezultati, sipas reagimeve të përdoruesve të prodhimit, është një model në të njëjtin nivel me GPT-5.6 për detyrat më të zakonshme të Excel – ndërkohë që është mjaft i vogël për t’u ekzekutuar në GPU-të më të vjetra H100 dhe madje A100 të Nvidia-s, në vend që të kërkonte përshpejtuesit e gjeneratës së fundit.

Ky detaj i harduerit meriton theks. Çdo kompani e madhe e inteligjencës artificiale po lufton për ndarjen e çipave të teknologjisë së fundit, dhe një model që ofron cilësi të nivelit të lartë në silikonin e dy brezave të vjetër ndryshon rrënjësisht ekonominë e vendosjes. Ai gjithashtu liron harduerin më të ri – duke përfshirë klasterin GB200 të Microsoft-it, i cili tani është në funksion – për trajnim në vend që të shërbejë.

Drejtori ekzekutiv i Microsoft, Satya Nadella, i paraqiti njoftimet në një postim të gjatë në X të titulluar ” Përhapja dhe Kontrolli i Kufirit “, i cili funksionon si diçka e ngjashme me një manifest strategjik. “Tani mund të marrim kapacitete të ngopura kufitare dhe t’i ofrojmë ato në shkallë të gjerë dhe me kosto më të ulët përmes modeleve të optimizuara për produkte me përdorim të lartë, ndërsa vazhdojmë të përdorim modele kufitare për nevojat kufitare”, shkroi Nadella, duke shtuar se Microsoft po “fillon të drejtojë trafikun nëpër sipërfaqet tona të palës së parë drejt MAI sa herë që modelet tona përputhen ose i tejkalojnë alternativat kufitare”.

Përkthyer nga proza ​​ekzekutive: aftësitë që ishin të nivelit të lartë një vit më parë tani janë të domosdoshme, dhe Microsoft beson se mund t’i replikojë ato me çmim të ulët për detyrat specifike dhe të përsëritura që dominojnë përdorimin real të produktit. Pse të paguash çmime kufitare për një model kufitar kur një përdorues dëshiron vetëm të riformatojë një kolonë të spreadsheet-it?

Nadella u kujdes të theksonte se “modelet kufitare nga OpenAI dhe Anthropic janë pjesë e sistemit të orkestrimit së bashku me MAI” – por ai gjithashtu artikuloi një parim të theksuar të pavarësisë së modelit, duke argumentuar se vlerësimet e një kompanie “duhet të vazhdojnë të rriten edhe kur ndonjë model i caktuar është hequr”.

“Mbajtja e pajisjeve, kujtesës, kontekstit dhe aftësive jashtë modelit, argumentoi ai, është ajo që i jep Microsoft-it kontroll. Nënteksti është i vështirë të mos vihet re. Reuters raportoi në prill se licenca ekskluzive e Microsoft-it për teknologjinë e OpenAI ishte rishikuar në një marrëveshje jo-ekskluzive, dhe The Information raportoi shtatorin e kaluar se Microsoft kishte filluar të përfshinte modelet Anthropic në disa produkte. Njoftimi i së mërkurës plotëson trekëndëshin: Microsoft si orkestrues, me modelet kufitare të partnerëve të saj si komponentë të këmbyeshëm dhe modelet e veta që thithin një pjesë gjithnjë e më të madhe të trafikut rutinë.”

Përgjigja online përcolli si apelin ashtu edhe skepticizmin që e rrethonte strategjinë. “Më pëlqen kur njerëzit përdorin modele të vogla për detyra specifike”, shkroi një përdorues i X, @mavihsk, duke iu përgjigjur postimit të Nadellës. “Pse duhet të përdor modelin e gjithëdijshëm vetëm për të ndryshuar fushën time në Excel?” Një përdorues tjetër, @nabu_lines, e përmblodhi me kujdes idenë: “kostoja dhe performanca përmirësohen kur ndalon së tepërmi përdorimin e modelit më të madh”.

Të tjerë ishin më pak bamirës në lidhje me rezultatet e performancës së Microsoft. “Microsoft është më i keqi kur bëhet fjalë për të dëgjuar reagimet e përdoruesve”, shkroi dizajneri @designedbyabin , duke argumentuar se kompania “do ta humbasë garën e inteligjencës artificiale sepse ata dështuan vazhdimisht të kuptonin nevojat e përdoruesve”. Dhe një përdorues, @tokenoverflow , ofroi një kritikë më të thatë të idesë së pavarësisë së modelit: “dua që të vazhdojë të ngjitet në kodër pasi të heqë Microsoft-in”.

Skeptikët ngrenë një pikë të drejtë. Metrikat e vetë-raportuara të Microsoft-it – normat e pranimit, normat e kursimit, kursimet e GPU-së – vijnë nga vlerësimet e veta të brendshme, jo nga standardet e pavarura, dhe kompania zgjedh se cilat krahasime të publikojë.

Por logjika e strategjisë nuk varet nga asnjë numër i vetëm. Formulimi i Nadellës se softueri tani ka ” kosto marxhinale reale për herë të parë ” shpjegon pse Microsoft është i fiksuar pas tokenave, GPU-ve dhe kostove të shërbimit: kur veçoritë e inteligjencës artificiale funksionojnë me çdo shtypje tastiere në një portofol produktesh me miliarda përdorues, një ulje prej 84% e kostos së GPU-së nuk është një optimizim. Është ndryshimi midis një biznesi të qëndrueshëm dhe një grope parash.

Pjesa e fundit e strategjisë është se Microsoft po shet manualin, jo vetëm modelet. Nadella e pozicionoi në mënyrë të qartë qasjen e ngjitjes së kodrave si “një shabllon për çdo kompani tjetër të IA-së vendase, SaaS ose Ndërmarrje”, dhe Microsoft po e paketon zinxhirin e mjeteve përmes Foundry dhe asaj që e quan Frontier Tuning – duke i lejuar ndërmarrjet të trajnojnë modele të specializuara sipas vlerësimeve të tyre pronësore dhe mjediseve të të mësuarit përforcues. Kjo e kthen ushtrimin e brendshëm të uljes së kostove të Microsoft në një produkt Azure dhe u jep klientëve të ndërmarrjeve një arsye për të ekzekutuar ngarkesat e tyre të punës së IA-së në cloud-in e Microsoft-it edhe nëse vetë modelet vijnë nga diku tjetër.

Theksi i kompanisë në modelet e trajnuara “mbi të dhëna të pastra, të gjurmueshme, të nivelit të ndërmarrjes, pa distilim nga modele të palëve të treta” shërben për të njëjtin qëllim komercial. Në një industri që përballet me shqyrtim në rritje mbi origjinën e të dhënave të trajnimit, Microsoft po vë bast se blerësit e ndërmarrjeve – dhe gjykatat – do të interesohen se nga vijnë aftësitë e modelit. Microsoft thotë se tani po e zgjeron qasjen e ngjitjes së kodrave në Copilot Chat , Outlook dhe PowerPoint , dhe të dy modelet e reja janë të disponueshme në parapamje publike përmes Microsoft Foundry dhe MAI Playground . “Asnjë nga këto nuk është një pikë fundore,” shkroi kompania. “Ne sapo kemi filluar.”

Shtatë vjet më parë, Microsoft vuri bast mbi 13 miliardë dollarë se OpenAI do të ndërtonte të ardhmen e IA-së. Njoftimi i së mërkurës sugjeron se kompania që atëherë ka nxjerrë një mësim më të lirë: e ardhmja e IA-së mund t’i përkasë kujtdo që ndërton kufirin, por fitimet i përkasin kujtdo që e bën atë të zakonshëm.