
На 30 юли Google DeepMind пусна Gemini Robotics ER 2 — новия си модел за „въплътено разсъждение“ (embodied reasoning), който вече е публично достъпен през Gemini API и Google AI Studio. Двете големи новости спрямо ER 1.6 от април са разбирането на непрекъснат видеопоток и координацията между няколко различни робота, които си подават задачата един на друг.
Мозък, а не мускули
ER 2 не движи стави. Той е горният слой — този, който планира. „Мислете за Gemini Robotics ER 2 като за високо ниво мозък за роботите“, пишат авторите на съобщението Стивън Хансен и Пенг Сю. Моделът разговаря с човека, разбира физическото пространство, разбива задачата на стъпки и след това вика долните нива като инструменти: VLA модели, навигационни API-та или собствени функции на разработчика.
Това е другата половина от обявеното наскоро семейство Gemini Robotics 2, където VLA моделът се грижи за самото движение. Според карта на модела ER 2 стъпва върху Gemini 3.5 Flash, приема текст, изображения, видео и аудио и има контекст от 128 хил. токена при изход до 64 хил.
Видеото е новото сетиво
Досега подобни модели гледаха отделни кадри. ER 2 приема поток и отговаря на два въпроса, които на робот му трябват постоянно.
Първият е progress classification: докъде съм стигнал. Моделът класифицира текущия момент в пет нива на завършеност (0–20%, 20–40% и така нататък) и постига 57,4% точност. Числото звучи скромно, но задачата е груба оценка в реално време, а не финална присъда — стойността ѝ е, че роботът забелязва кога нещо се е объркало, вместо да довърши сляпо погрешна последователност.
Вторият е moment finding: кой точно кадър е критичният — например моментът, в който трябва да спрете да наливате кафе в чашата. Тук резултатът е 91,3% точност при средно отклонение 0,96 секунди. DeepMind твърди, че ER 2 върши това с 4 пъти по-висока скорост на изпълнение от съпоставими по-големи модели и при част от изчислителната цена, което е важно — под секунда латентност е разликата между спиране навреме и разлято кафе.
Снимка: Google DeepMind
Разширено е и четенето на уреди. ER 1.6 разчиташе кръгли скали и нивопоказатели; ER 2 е тестван върху 10 типа инструменти, включително цифрови дисплеи, линейни скали, линийки и течни термометри. За индустриална поддръжка това е по-полезно, отколкото звучи.
Два робота, една обща представа за задачата
Най-показателната демонстрация събира хуманоида Apollo 2 на Apptronik и мобилния манипулатор F3 Duo на Franka. Двете машини нямат нищо общо като конструкция, но комуникират през „споделено семантично разбиране“ и си подават работата, за да завършат задача, която нито една от тях не може сама.
Логиката е проста и практична: колесна платформа се движи по-добре по гладък под, хуманоид се справя по-добре с неравен терен и стълби. Вместо да търсите един робот, който може всичко, оставяте ER 2 да прехвърля стъпките към този, който е подходящ в момента.
Отделно Google показа ER 2 в ролята на диспечер за Spot на Boston Dynamics — роботът донася предмети по команда на естествен език, а примерен код за интеграцията е публикуван в GitHub.
Безопасност и ограничения
DeepMind нарича ER 2 най-безопасния си модел в тази серия с осезаем напредък по показателите Safety Instruction Following и Human Proximity. В тестовете моделът спира хуманоида, когато човек е наблизо, и продължава сам едва след като зоната е чиста.
Картата на модела обаче поставя ясна граница: ER 2 не е предназначен за критични за безопасността приложения — здравеопазване, транспорт и подобни области, където повреда може да доведе до нараняване или щети. Това е ограничение, което си заслужава да се прочете преди първия прототип.
Цени и достъп
ER 2 е достъпен в две разновидности: gemini-robotics-er-2-preview и gemini-robotics-er-2-streaming-preview, като втората работи през Live API с двупосочен стрийминг и е насочена към задачи, чувствителни към латентност. По официалния ценоразпис и двете струват $2,00 за милион входни токена (текст, изображение, видео или аудио) и $10,00 за милион изходни — приблизително €1,74 и €8,70. Има и безплатно ниво за пробване. Достъпът през Gemini Enterprise Agent Platform засега е в частен preview.
Заключение
ER 2 запълва дупка, която в роботиката се усеща отдавна: моделите се научиха да хващат предмети, но нямаха надежден начин да следят собствения си напредък. Видео разбирането в реално време и подаването на задачи между различни машини звучат по-скучно от хуманоид, който подрежда съдове, но именно те правят разликата между демонстрация и работещ процес. Числата все още не са особено високи — 57,4% при оценката на напредъка е точно толкова, колкото изглежда. Следващите месеци с реални интеграции ще покажат дали са достатъчни.
Новините на Overclock — директно в Telegram, без алгоритми.
Следвайте ни в Telegram