AI

Gemini Robotics 2: един модел за всякакви роботи

Gemini Robotics 2: един модел за всякакви роботи

На 30 юли Google DeepMind обяви Gemini Robotics 2 — най-новото си семейство модели за роботика. Основното е, че един и същ модел кара както настолна двуръка платформа, така и цял хуманоид, който ходи, клякa и подрежда — от стъпалата до върха на пръстите. Компанията пусна три модела наведнъж: VLA моделът Gemini Robotics 2, разсъждаващият Gemini Robotics ER 2 и олекотеният Gemini Robotics On-Device 2 за работа директно върху робота.

Един checkpoint, три различни тела

VLA (vision-language-action) означава модел, който приема картина от камерите и инструкция на естествен език и на изхода дава директно моторни команди. Досегашните такива модели обикновено се обучават за конкретен робот. Тук DeepMind твърди нещо по-силно: един и същ checkpoint работи върху три различни конфигурации — хуманоида Apollo 2 на Apptronik с ръце SharpaWave, същия Apollo 2 с ръце Inspire и двуръката платформа Franka Duo с грипер на Robotiq.

Демонстрацията, която компанията показва, е нарочно скучна на вид: „Сложи лейката в зеления кош на долния рафт.“ Apollo тръгва към масата, взима лейката, прави няколко крачки към стелажа и я поставя на мястото ѝ. Цялото движение — крака, торс, ръце, пръсти — се управлява от една политика, а не от отделен слой за ходене и отделен за хващане.

Числата: къде работи и къде още не

DeepMind публикува успеваемостта по задачи, което е рядкост в тази област и си заслужава да се погледне трезво. При общата манипулация с цяло тяло на Apollo 2 с ръце Inspire моделът взима предмет от рафт в 76,3% от опитите, от маса — в 68,4%, но от пода — само в 45,7%.

При фините задачи с петопръстните ръце SharpaWave разликите са още по-големи: развиване на крушка се получава в 92% от случаите, завиване на същата крушка — само в 36%. Завързване на торба за смет е 44%, работа с лопатка за смет — 32%, затваряне на ziplock плик — 40%.

Най-стабилни са резултатите с грипер върху Franka Duo: 89,6% при прецизно вкарване на детайл, 78,9% при подреждане на разнородни инструменти и 74,2% при общо взимане и поставяне.

Резултати на Gemini Robotics ER 2 в тестовете за физически агенти Снимка: Google DeepMind

С други думи — общите движения вече са прилични, но фината моторика остава трудната част. Роботът по-често разваля, отколкото сглобява.

ER 2: моделът, който гледа видео и следи докъде е стигнал

Вторият модел, Gemini Robotics ER 2, е „главата“ на системата — разсъждаващият слой, който планира задачи от няколко минути и стотици решения и раздава команди на VLA модела. Той стъпва на Gemini 3.5 Flash, работи с контекст до 128 хил. токена и изход до 64 хил.

Новото при него е, че вече обработва непрекъснат видео поток, а не отделни кадри. Това му позволява да следи собствения си напредък и да разбира, че нещо се е объркало. В теста за откриване на конкретен момент във видео ER 2 постига 91,3% точност със средно отклонение от 0,96 секунди — и работи около 4 пъти по-бързо от по-големи модели. При оценката „докъде съм стигнал“ по петстепенна скала точността е 57,4%, тоест тук има още много път.

ER 2 може да вика инструменти (включително Google Search), да координира няколко робота едновременно и да поиска помощ от човек, когато прецени, че не се справя. В демонстрациите Apollo 2 и Franka Duo работят заедно по обща задача, а в отделен пример ER 2 управлява навигационните и манипулаторните API на Boston Dynamics Spot, за да донесе поискан предмет.

Безопасност и достъпност

DeepMind въведе нов benchmark — ASIMOV-Agentic, който мери дали моделът отказва опасни извиквания на инструменти и дали навреме иска човешка намеса. ER 2 бие предшественика си ER 1.6 и по теста за следване на инструкции за безопасност, и по този за близост на човек: при приближаващ човек хуманоидът спира. Пълният технически доклад за безопасността е публикуван като PDF на сайта на DeepMind.

Достъпът е степенуван. ER 2 вече е публично достъпен в Gemini API и Google AI Studio, а в Gemini Enterprise Agent Platform е в частен preview. Самият VLA модел Gemini Robotics 2 се дава само на партньори с ранен достъп — има отворен списък на чакащите. On-Device 2 остава при доверени тестери; той се адаптира към изцяло ново тяло за няколко часа и под 200 демонстрации, като при платформата SO101 успеваемостта скача от 0% на 53,3%, а при Dexmate — от 13,3% на 75,6%.

Контекст

Роботиката е следващото поле, на което големите AI лаборатории се бият, и Google явно залага на подхода „един модел, много тела“ вместо на собствен хардуер, отбелязва The Decoder. Междувременно регулаторната среда се стяга — САЩ вече забраниха новите роботизирани прахосмукачки от чужди производители, а автономните машини по пътищата минават през дълга процедура, както показа първото роботакси без волан с платени курсове.

Заключението е трезво: Gemini Robotics 2 е сериозна крачка към роботи, които не са програмирани за една единствена задача. Но числата на самия Google показват, че до момента, в който хуманоид сгъва прането ви без надзор, има още доста работа — и че най-трудно остава онова, което човешката ръка прави, без изобщо да мисли.

Новините на Overclock — директно в Telegram, без алгоритми.

Следвайте ни в Telegram

Прочетете още