
На 30 юли Google DeepMind обяви Gemini Robotics 2 — най-новото си семейство модели за роботика. Основното е, че един и същ модел кара както настолна двуръка платформа, така и цял хуманоид, който ходи, клякa и подрежда — от стъпалата до върха на пръстите. Компанията пусна три модела наведнъж: VLA моделът Gemini Robotics 2, разсъждаващият Gemini Robotics ER 2 и олекотеният Gemini Robotics On-Device 2 за работа директно върху робота.
Един checkpoint, три различни тела
VLA (vision-language-action) означава модел, който приема картина от камерите и инструкция на естествен език и на изхода дава директно моторни команди. Досегашните такива модели обикновено се обучават за конкретен робот. Тук DeepMind твърди нещо по-силно: един и същ checkpoint работи върху три различни конфигурации — хуманоида Apollo 2 на Apptronik с ръце SharpaWave, същия Apollo 2 с ръце Inspire и двуръката платформа Franka Duo с грипер на Robotiq.
Демонстрацията, която компанията показва, е нарочно скучна на вид: „Сложи лейката в зеления кош на долния рафт.“ Apollo тръгва към масата, взима лейката, прави няколко крачки към стелажа и я поставя на мястото ѝ. Цялото движение — крака, торс, ръце, пръсти — се управлява от една политика, а не от отделен слой за ходене и отделен за хващане.
Числата: къде работи и къде още не
DeepMind публикува успеваемостта по задачи, което е рядкост в тази област и си заслужава да се погледне трезво. При общата манипулация с цяло тяло на Apollo 2 с ръце Inspire моделът взима предмет от рафт в 76,3% от опитите, от маса — в 68,4%, но от пода — само в 45,7%.
При фините задачи с петопръстните ръце SharpaWave разликите са още по-големи: развиване на крушка се получава в 92% от случаите, завиване на същата крушка — само в 36%. Завързване на торба за смет е 44%, работа с лопатка за смет — 32%, затваряне на ziplock плик — 40%.
Най-стабилни са резултатите с грипер върху Franka Duo: 89,6% при прецизно вкарване на детайл, 78,9% при подреждане на разнородни инструменти и 74,2% при общо взимане и поставяне.
Снимка: Google DeepMind
С други думи — общите движения вече са прилични, но фината моторика остава трудната част. Роботът по-често разваля, отколкото сглобява.
ER 2: моделът, който гледа видео и следи докъде е стигнал
Вторият модел, Gemini Robotics ER 2, е „главата“ на системата — разсъждаващият слой, който планира задачи от няколко минути и стотици решения и раздава команди на VLA модела. Той стъпва на Gemini 3.5 Flash, работи с контекст до 128 хил. токена и изход до 64 хил.
Новото при него е, че вече обработва непрекъснат видео поток, а не отделни кадри. Това му позволява да следи собствения си напредък и да разбира, че нещо се е объркало. В теста за откриване на конкретен момент във видео ER 2 постига 91,3% точност със средно отклонение от 0,96 секунди — и работи около 4 пъти по-бързо от по-големи модели. При оценката „докъде съм стигнал“ по петстепенна скала точността е 57,4%, тоест тук има още много път.
ER 2 може да вика инструменти (включително Google Search), да координира няколко робота едновременно и да поиска помощ от човек, когато прецени, че не се справя. В демонстрациите Apollo 2 и Franka Duo работят заедно по обща задача, а в отделен пример ER 2 управлява навигационните и манипулаторните API на Boston Dynamics Spot, за да донесе поискан предмет.
Безопасност и достъпност
DeepMind въведе нов benchmark — ASIMOV-Agentic, който мери дали моделът отказва опасни извиквания на инструменти и дали навреме иска човешка намеса. ER 2 бие предшественика си ER 1.6 и по теста за следване на инструкции за безопасност, и по този за близост на човек: при приближаващ човек хуманоидът спира. Пълният технически доклад за безопасността е публикуван като PDF на сайта на DeepMind.
Достъпът е степенуван. ER 2 вече е публично достъпен в Gemini API и Google AI Studio, а в Gemini Enterprise Agent Platform е в частен preview. Самият VLA модел Gemini Robotics 2 се дава само на партньори с ранен достъп — има отворен списък на чакащите. On-Device 2 остава при доверени тестери; той се адаптира към изцяло ново тяло за няколко часа и под 200 демонстрации, като при платформата SO101 успеваемостта скача от 0% на 53,3%, а при Dexmate — от 13,3% на 75,6%.
Контекст
Роботиката е следващото поле, на което големите AI лаборатории се бият, и Google явно залага на подхода „един модел, много тела“ вместо на собствен хардуер, отбелязва The Decoder. Междувременно регулаторната среда се стяга — САЩ вече забраниха новите роботизирани прахосмукачки от чужди производители, а автономните машини по пътищата минават през дълга процедура, както показа първото роботакси без волан с платени курсове.
Заключението е трезво: Gemini Robotics 2 е сериозна крачка към роботи, които не са програмирани за една единствена задача. Но числата на самия Google показват, че до момента, в който хуманоид сгъва прането ви без надзор, има още доста работа — и че най-трудно остава онова, което човешката ръка прави, без изобщо да мисли.
Новините на Overclock — директно в Telegram, без алгоритми.
Следвайте ни в Telegram