Google анонсировала выпуск Gemini Robotics ER 2 — новой модели «воплощенного рассуждения» (embodied reasoning), разработанной специально для управления робототехникой. Эта система берет на себя роль высокоуровневого мозга, который позволяет роботам понимать физический мир, планировать многоэтапные задачи и взаимодействовать с людьми.
Долгое время главной проблемой робототехники оставался разрыв между восприятием и действием. Роботам не хватало скорости мышления, чтобы синхронизировать свои решения с динамикой реального мира. Предыдущие системы часто требовали остановок для анализа ситуации, что делало их движения неестественными и медленными.
Chart comparing physical agent performance of Gemini Robotics ER 1.6 and Gemini Robotics ER 2
Gemini Robotics ER 2 решает эту проблему за счет непрерывного анализа видеопотока. Модель позволяет роботу «думать» о следующем шаге одновременно с выполнением текущего действия. Высокоуровневые команды передаются на исполнение базовым моделям «зрение-язык-действие» (vision-language-action, VLA), при этом система может обращаться к внешним инструментам, таким как Google Search или пользовательские функции.
Ключевым нововведением стало понимание времени и стадий выполнения задачи. Разработчики выделили две базовые функции. Первая — классификация прогресса. Модель анализирует видео и оценивает стадию выполнения задачи (от 0 до 100%), достигая точности 57.4%. Это дает роботу ситуационную осведомленность, позволяя исправлять ошибки на лету, не начиная весь процесс заново.
Вторая функция — точное определение момента (moment-finding). Это способность модели понять, в каком именно кадре произошло критическое событие (например, когда нужно перестать наливать кофе). Здесь Gemini Robotics ER 2 показывает точность 91.3% со средним отклонением менее секунды. Такая скорость критически важна для безопасной работы физических агентов.
Chart comparing progress classification of different robots
Кроме того, система впервые предлагает встроенную поддержку совместной работы нескольких роботов. Теперь устройства с разными характеристиками — например, колесный вездеход и гуманоидный робот — могут общаться через общее семантическое пространство, передавая друг другу этапы сложной задачи.
Значительный шаг сделан и в области безопасности. Gemini Robotics ER 2 успешно проходит тесты на соблюдение физических ограничений и осведомленность о присутствии людей. На практике это означает, что робот автоматически останавливает работу, если рядом появляется человек, и возобновляет ее только тогда, когда зона становится безопасной.
Для индустрии это означает переход к более автономным и гибким физическим агентам. Модель уже доступна разработчикам через Gemini API и Google AI Studio. Внедрение подобных систем открывает путь к созданию роботов, которые способны не просто выполнять жестко заданные программы, но и адаптироваться к непредсказуемым условиям реального мира.