Inteligjenca artificiale e re e Google u mundëson robotëve të bashkëpunojnë
Që robotët të ndihmojnë njerëzit në mjediset e përditshme, arsyetimi i saktë hapësinor nuk është i mjaftueshëm. Robotët duhet gjithashtu të mendojnë shpejt, duke i sinkronizuar vendimet dhe arsyetuar me shpejtësinë në kohë reale të botës fizike.
Kjo është arsyeja pse sot po lançojmë Gemini Robotics ER 2, modelin tonë më të aftë të “arsyetimit të mishëruar” për robotikën. Mendoni për Gemini Robotics ER 2 si një tru të nivelit të lartë për robotët. Ai u lejon robotëve të bisedojnë me njerëzit, të kuptojnë botën fizike dhe të planifikojnë detyra me shumë hapa. Pastaj ia kalon ekzekutimin motorik çdo modeli të caktuar të nivelit më të ulët të vizionit-gjuhës-veprimit (VLA). Gemini Robotics ER 2 gjithashtu mund të thërrasë në mënyrë native mjete si Google Search për të gjetur informacion ose çdo funksion tjetër të përcaktuar nga përdoruesi. Dizajni i Gemini Robotics ER 2 i lejon robotit të “mendojë” për atë që vjen më pas, ndërsa njëkohësisht kryen veprimet e tij.
Gemini Robotics ER 2 përfaqëson një përmirësim të rëndësishëm në krahasim me Gemini Robotics ER 1.6. Duke shikuar transmetime të vazhdueshme video, robotët tani mund të ndjekin progresin e tyre, të përshtaten nëse diçka shkon keq dhe të dinë saktësisht se kur të kalojnë në hapin tjetër. Ne gjithashtu po prezantojmë bashkëpunimin shumë-robotësh, duke u mundësuar robotëve të punojnë së bashku në hapësira të përbashkëta dhe të kryejnë rrjedha pune komplekse që një robot i vetëm nuk mund t’i bënte i vetëm.
Gemini Robotics ER 2 tani është i disponueshëm publikisht për zhvilluesit nëpërmjet Gemini API, Google AI Studio dhe në pamje paraprake private në Gemini Enterprise Agent Platform . Për t’ju ndihmuar të filloni, po ndajmë shembuj se si ta konfiguroni modelin dhe ta nxisni atë të fuqizojë detyra më të dobishme fizike të IA-së.
Shumica e detyrave në botën fizike janë komplekse dhe kërkojnë hapa të shumtë për t’u përfunduar. Gemini Robotics ER 2 është një agjent fizik, që orkestron hapat për robotin dhe i mundëson atij të vetë-korrigjohet dhe të përgjithësohet në situata më të reja. Për të ndërtuar një konfigurim agjentik, zhvilluesit mund të deklarojnë ndërfaqe kontrolli të nivelit të ulët – si modelet Vizion-Gjuhë-Veprim (VLA) ose API-të e navigimit – si mjete dhe të transmetojnë video, audio ose tekst multimodal direkt në model.
Gemini Robotics ER 2 e përmirëson këtë rrjedhë pune të orkestrimit të mjeteve. Ne mund ta vlerësojmë performancën e tij me robotë në simulim, duke përdorur kontrollin e robotëve në botën reale, dhe madje ta çiftëzojmë atë me një njeri që kontrollon robotin nga distanca.

Në robotikë, arsyetimi i nivelit të lartë varet nga shpejtësia e ekzekutimit. Gemini Robotics ER 2 integrohet në Gemini Live API , duke përdorur një pikë fundore transmetimi dypalëshe të optimizuar për detyra të ndjeshme ndaj vonesës. Rezultati është orkestrim fluid: Gemini Robotics ER 2 komandon modelet e veprimit dhe API-të e robotikës për të përfunduar detyra me shumë hapa pa pauzat e bezdisshme “ndalo dhe mendo”.
Për ta ilustruar këtë, ne kemi ndërtuar një demo me Spot nga partnerët tanë në Boston Dynamics. Ne përdorim Gemini Robotics ER 2 për të orkestruar API-të e Spot , të tilla si navigimi dhe lëvizja e manipulatorit, duke krijuar një robot interaktiv që merr objekte për ju.
Një nga sfidat më të vështira të robotikës është të dish kur një detyrë është përfunduar. Gemini Robotics ER 2 sjell një ndryshim të madh në të kuptuarit e videos dhe ndjekjen e progresit për të verifikuar që detyrat komplekse – të tilla si shtrëngimi i një llambë ose lidhja e një qeseje plehrash – janë të përfunduara sipas specifikimeve përpara se të kalohet në detyrën tjetër.
Në këtë përditësim, kemi bërë përparim në dy aftësi themelore për të kuptuar progresin e detyrave: klasifikimin e progresit dhe gjetjen e momenteve.
Klasifikimi i progresit i referohet aftësisë së një roboti për të ndjekur progresin drejt përfundimit të detyrës. Në vlerësimet tona, ne e caktojmë çdo kuadër në një transmetim videoje në pesë nivele progresi (0-20%, 20-40%, 40-60%, 60-80%, 80-100%). Duke përcaktuar progresin e detyrës, Gemini Robotics ER 2 u ofron robotëve ndërgjegjësim për situatën në kohë reale dhe u lejon atyre të rregullojnë veprimet menjëherë ose të riprovojnë hapat e dështuar pa rinisur një rrjedhë të tërë pune.

Gjetja e momentit mat aftësinë e një modeli për të identifikuar kuadrin e saktë të videos ku ndodh një ngjarje kritike (domethënë kur duhet të ndalet derdhja e kafesë në një filxhan). Gemini Robotics ER 2 arrin përfitime të konsiderueshme në performancë në gjetjen e momentit, duke i mundësuar robotëve të kalojnë me saktësi midis detyrave, të verifikojnë suksesin dhe të sugjerojnë korrigjime.

Asnjë robot i vetëm nuk i përshtatet çdo detyre – një rover me rrota shkëlqen në ambiente të mbyllura, ndërsa një robot humanoid mund të shkëlqejë në terren të pabarabartë. Gemini Robotics 2 mundëson bashkëpunimin e shumë robotëve, duke u lejuar makinave të ndryshme të komunikojnë nëpërmjet një kuptimi të përbashkët semantik për të ndarë dhe përfunduar detyra komplekse. Shikoni se si Gemini Robotics ER 2 mundëson që Apollo 2 dhe Franka F3 Duo të Apptronik të bashkëpunojnë këtu.
Gemini Robotics ER 2 përparon aftësinë tonë thelbësore të arsyetimit hapësinor, të matur nga tre kritere:
Zbulimi i suksesit/dështimit: Tani funksionon me burime video të papërpunuara në vend të pamjeve statike për të kapur dështimet në mes të ekzekutimit, si derdhjet, rrëshqitjet ose keqpozicionimet.
Leximi i përgjithshëm i instrumenteve: Shtrihet përtej numratorëve rrethorë dhe syzeve të shikimit, duke përfshirë ekranet dixhitale, shkallët lineare, vizoret dhe termometrat e lëngjeve. Ne e testuam atë në 10 lloje të ndryshme instrumentesh.
VQA hapësinore e përmirësuar: Përmirëson Përgjigjet Vizuale të Pyetjeve përmes përparimeve të Gemini në të kuptuarit multimodal.

Gemini Robotics ER 2 është modeli ynë më i sigurt, duke arritur përfitime të konsiderueshme në standardet e Ndjekjes së Udhëzimeve të Sigurisë dhe Afërsisë Njerëzore, të cilat vlerësojnë se si një model i përmbahet kufizimeve fizike gjatë detyrave të arsyetimit dhe ndërgjegjësimit hapësinor për zbulimin e njerëzve. Ne zbuluam se Gemini Robotics ER 2 ndalon me sukses një robot humanoid kur një person është afër dhe rifillon punën në mënyrë autonome vetëm pasi zona të jetë e lirë. Për të avancuar sigurinë për agjentët fizikë, po prezantojmë një standard që vlerëson aftësinë e një modeli themelor për të vepruar si një orkestrues i sigurt i VLA duke testuar aftësinë e tij për të zbatuar kufizimet e sigurisë, për të monitoruar mjedisin, për të vlerësuar fizibilitetin fizik dhe për të kërkuar sqarime njerëzore. Për detaje, shihni raportin tonë teknik të sigurisë.

Duke parë përpara, planet tona janë t’i shtyjmë këto modele drejt detyrave edhe më komplekse për të përshpejtuar zhvillimin e robotëve të dobishëm dhe për të mbështetur komunitetin e robotikës.
