Google DeepMind представила семейство Gemini Robotics 2 для управления роботами. Новые модели помогают гуманоидам ходить, наклоняться, удерживать равновесие и работать с предметами, а нескольким роботам — распределять действия в рамках одной задачи.
Gemini Robotics ER 2 уже доступна разработчикам в режиме тестирования через Google AI Studio и Gemini API. В Gemini Enterprise Agent Platform модель открыли в закрытом тесте. Детали в материале Postium.
Читайте также: Как пользоваться Gemini 3.6 Flash бесплатно
Три ИИ-модели Gemini Robotics 2: что умеет каждая
Gemini Robotics 2 относится к классу vision-language-action (VLA). Она получает изображения и текстовые команды, а затем преобразует их в движения робота. Модель управляет всем телом гуманоида — от ног до пальцев. Она поддерживает роботов с двумя манипуляторами, многопалыми кистями и стандартными двухпальцевыми захватами.
В демонстрации гуманоид Apptronik Apollo 2 по команде подходил к столу, брал лейку, переносил её к стеллажу и ставил в нижнюю секцию. Предыдущие версии системы в основном управляли верхней частью тела и выполняли задачи за столом. Новая версия объединяет ходьбу, наклоны, перенос предметов и работу руками в одну последовательность. Google отмечает, что скорость движений пока требует доработки.

Модель также управляет кистью SharpaWave с пятью пальцами и 22 степенями свободы. Во время тестов робот завязывал мусорный пакет, закручивал лампочку и закрывал пакет с застёжкой. Результаты зависят от типа действия: робот успешно откручивал лампочку в 92% попыток, но завязывал пакет лишь в 44%, а закрывал застёжку — в 40%. С обычными захватами показатели оказались выше. Например, точные вставки на платформе Franka Duo завершались успешно в 89,6% случаев.
Gemini Robotics ER 2 отвечает за планирование. Модель анализирует помещение, разбивает команду на этапы, вызывает функции управления роботом и следит за их выполнением. Она может обрабатывать последовательности продолжительностью несколько минут, находить нужные моменты в видеопотоке и определять, завершил ли робот отдельный этап.
В ER 2 также появилась координация нескольких роботов. Система распределяет части одного процесса между разными машинами и отслеживает общий результат. Для разработчиков Google выпустила обычную версию gemini-robotics-er-2-preview и потоковую gemini-robotics-er-2-streaming-preview, которая принимает непрерывные аудио- и видеоданные через Live API.
Gemini Robotics On-Device 2 выполняет действия локально, поэтому роботу не требуется постоянное подключение к облаку. Google утверждает, что модель можно адаптировать к новой платформе с двумя манипуляторами за несколько часов, используя менее 200 примеров. Она рассчитана на устройства с другой формой корпуса, набором датчиков и количеством степеней свободы.
Как получить доступ
Gemini Robotics ER 2 можно протестировать в Google AI Studio или подключить через Gemini API. Модель принимает текст, изображения, видео и аудио, поддерживает выполнение кода и вызов пользовательских функций для управления роботами. Входной контекст составляет до 131 072 токенов.
Чтобы подключить основную VLA-модель или On-Device 2, разработчику нужно подать заявку в программу раннего доступа. Google не сообщила, когда откроет эти модели для всех желающих и на каких коммерческих условиях они будут распространяться.
При этом тесты Google показывают, что модель уже справляется с переносом предметов и работой с обычными захватами, но сложные движения отдельных пальцев остаются нестабильными. Результаты лабораторных демонстраций также не показывают, как система поведёт себя при длительной работе в незнакомом помещении.
Google предупреждает, что разработчики должны самостоятельно обеспечивать безопасность физического оборудования. Компания не рекомендует применять ER 2 в критически важных системах, где ошибка может привести к травмам или повреждению имущества, включая транспорт и медицинское оборудование.
Почему это важно? Раньше разработчикам часто требовались отдельные системы для ходьбы, управления манипуляторами и планирования последовательности действий. Gemini Robotics 2 связывает эти уровни: одна модель преобразует команду в движения, другая планирует этапы и координирует работу роботов.
Итог: Gemini Robotics 2 объединяет управление всем телом, работу с предметами и координацию нескольких роботов, но основные модели пока доступны только в рамках программы раннего доступа.