ByteDance trajnon një model masiv të AI-së në përpjekje për të rivalizuar Anthropic

foto

ByteDance po trajnon një model të inteligjencës artificiale që mund të afrohet me madhësinë e sistemit më të përparuar Mythos të Anthropic, ndërsa kompanitë kineze vazhdojnë të ngushtojnë hendekun me laboratorët më të mirë amerikanë.

foto

Gjigandi kinez i teknologjisë është në një fazë të hershme të trajnimit të një modeli me deri në 10 trilion parametra – tre herë më i madh se Kimi K3 i Moonshot, modeli më i madh kinez i lëshuar deri më sot, sipas tre personave me njohuri për çështjen.

foto

Modeli ByteDance po trajnohet paraprakisht—një fazë që zakonisht zgjat tre deri në gjashtë muaj—para se të përpunohet dhe të publikohet nëse gjithçka shkon mirë, tha njëri prej personave. Madhësia e saktë e modelit do të përcaktohet vetëm në një fazë të mëvonshme.

Anthropic nuk e zbulon madhësinë e modeleve të saj, por vlerësimet e industrisë thonë se Mythos 5 më i përparuar i saj ka rreth 8 trilion parametra dhe Fable 5 rreth 5 trilionë. Ndërsa numërimi i parametrave përcakton kapacitetin themelor ose kufijtë e memories për modelet për të ruajtur informacionin, aftësia aktuale varet edhe nga faktorë të tjerë, siç janë cilësia e të dhënave dhe metodat e trajnimit.

Përpjekjet e ByteDance për të trajnuar një nga modelet më të mëdha të IA-së në botë tregojnë ambicien e laboratorëve kinezë jo vetëm për të kapur ritmin, por edhe për të tejkaluar kolegët e tyre amerikanë në nivelin më të përparuar të IA-së.

Vetëm në javët e fundit, modelet kineze nga Moonshot dhe Alibaba treguan performancë të fortë në testet e nivelit të lartë, duke mbetur pas vetëm Fable 5 të Anthropic në disa fusha. Mythos 5, modeli më i përparuar i Anthropic, është i disponueshëm vetëm për organizatat e miratuara pas një ndalimi të përkohshëm në qershor për shkak të shqetësimeve për sigurinë.

Njerëzit brenda industrisë thonë se shumë laboratorë kinezë janë në procesin e trajnimit të modeleve të madhësisë së Fable 5, ndërsa ByteDance është aktualisht më ambiciozja në përpjekjen për të arritur më të madhin.

ByteDance, kompania mëmë e platformës virale të videove TikTok, ka mbajtur një profil të ulët në zhvillimin e inteligjencës artificiale, pasi modelet e saj janë kryesisht të mbyllura, ndryshe nga shumë nga konkurrentët e saj kinezë. Modeli i saj më i fundit SeeDance renditet ndër më të përparuarit globalisht në gjenerimin e videove, ndërsa modeli i saj kryesor, Doubao, i drejtuar nga konsumatori, është më i popullarizuari në Kinë me 324 milionë përdorues aktivë mujorë.

Gjatë tre viteve të fundit, ByteDance ka investuar në inteligjencën artificiale më agresivisht se çdo gjigant tjetër kinez i teknologjisë, duke ndërtuar rrjetin e saj të qendrave të të dhënave dhe duke punësuar studiues. Ajo ka dyfishuar njësinë e saj të reve, Volcano Engine, e cila u shet zgjidhje të inteligjencës artificiale ndërmarrjeve. ByteDance gjithashtu ka ambicie për të zhvilluar çipa të personalizuar të inteligjencës artificiale.

Seed, ekipi i saj i zhvillimit të modeleve i udhëhequr nga ish-shkencëtari i Google DeepMind, Wu Yonghui, ka rreth 2,000 anëtarë në Kinë dhe jashtë saj. Ekipi përfshin studiues kryesorë, inxhinierë të infrastrukturës, një ekip etiketimi të të dhënave dhe përkthyes.

Zhvillimi i modelit të saj ka zbatuar gjithashtu një qasje më të pavarur që nuk përfshin “distilimin” e modeleve ekzistuese nga laboratorë të tjerë, sipas njërit prej personave. Kjo qasje ka qenë në fuqi për më shumë se një vit, gjë që disa besojnë se ka çuar në zhvillimin e saj më të ngadaltë krahasuar me rivalët.

Distilimi i modelit është procesi i kompresimit të një modeli të madh dhe kompleks të IA-së në një model më të vogël dhe më të shpejtë duke e trajnuar modelin më të vogël për të kopjuar njohuritë dhe rezultatet e mësuesit më të madh.

Menaxhmenti i ByteDance, i udhëhequr nga themeluesi Zhang Yiming, beson se vetëm zhvillimi i pavarur mund të rezultojë në një model që i tejkalon rivalët.

Zhang përsëriti qëndrimin e tij në një takim të brendshëm dy javë më parë, ku i tha ekipit Seed të synonin “aftësitë e modeleve kryesore në botë” në planin afatgjatë pa u shqetësuar shumë për mbetjen prapa në planin afatshkurtër, sipas personit.

Mediat kineze Latepost dhe The Information raportuan të parat komentet e Zhang nga takimi i fundit i brendshëm.