Gemini Robotics 2: как Google DeepMind учит роботов ходить, вкручивать лампочки и завязывать пакеты
Google DeepMind анонсировала Gemini Robotics 2 — семейство моделей, которое учит человекоподобных роботов ходить, приседать, завязывать пакеты и вкручивать лампочки. Пока точность мелкой моторики — 36%, но целостное управление телом от стоп до пальцев уже работает. Разбираем три версии моделей, практические демонстрации и сроки внедрения.
Google DeepMind анонсировала семейство моделей Gemini Robotics 2 - новое поколение искусственного интеллекта для управления человекоподобными роботами. В отличие от предыдущих версий, которые фокусировались на движениях верхней части тела, новая система координирует робота целиком: от стоп до кончиков пальцев, включая баланс, шаги, наклоны и мелкую моторику. Это переход от «руки на неподвижной платформе» к полноценному телу, которое может ходить, приседать и манипулировать предметами одновременно.
Семейство включает три специализированные модели: Gemini Robotics 2 отвечает за движения, Gemini Robotics ER 2 - за восприятие и планирование, Gemini Robotics On-Device 2 - за локальную работу на устройстве без подключения к облаку. Такой подход разделяет физический контроль, визуальный анализ и автономность, позволяя каждой части системы решать свою задачу с максимальной эффективностью.
Что такое Gemini Robotics 2 и почему это важно
Представьте, что вы учитесь жонглировать тремя мячами, одновременно балансируя на одной ноге. Для человека это сложно, но выполнимо. Для робота - задача на порядок сложнее, потому что каждое движение требует точного расчёта десятков суставов, центра тяжести и обратной связи от сенсоров. Gemini Robotics 2 - это «мозг», который решает эту задачу в реальном времени.
Раньше системы управления роботами строились по модульному принципу: одна программа контролировала руки, другая - захваты, третья - простые перемещения. Координация между ними была ограниченной. Gemini Robotics 2 объединяет управление всем телом в единую модель. Робот может переносить предмет, одновременно переступая через препятствие и удерживая равновесие - и всё это без рывков и падений.
Почему это важно именно сейчас? Компании вроде Agility Robotics уже разворачивают парки роботов на складах Amazon и GXO - мы рассказывали об этом в разборе битвы за человекоподобных роботов. Но массовому внедрению мешает ограниченная подвижность машин. Gemini Robotics 2 - шаг к тому, чтобы роботы работали в среде, спроектированной для людей: с лестницами, узкими проходами, неровными поверхностями и хрупкими предметами.
Три модели для разных задач: движение, зрение и автономность
Разделение на три модели - архитектурное решение, которое позволяет оптимизировать каждую часть системы под её задачу. Вместо одного универсального алгоритма, который должен уметь всё сразу, Google DeepMind создала три специализированных компонента, работающих в связке.
Gemini Robotics 2: управление всем телом от стоп до пальцев
Эта модель - «мышцы и координация» робота. Она получает команду высокого уровня - например, «возьми пакет и завяжи его» - и переводит её в последовательность движений всех суставов. Главное улучшение по сравнению с предшественниками - учёт нижней части тела.
Предыдущие системы фокусировались на торсе и руках, оставляя ноги либо неподвижными, либо управляемыми отдельным контроллером с ограниченной синхронизацией. Gemini Robotics 2 учитывает стопы, колени, бёдра, центр тяжести и их взаимодействие с руками и корпусом. Когда робот приседает, чтобы поднять предмет с пола, модель одновременно рассчитывает сгибание коленей, наклон корпуса, вытягивание руки и захват пальцами - как единое скоординированное действие.
Это особенно важно для работы в человеческой среде. Дверные ручки, выключатели, кухонные поверхности - всё спроектировано под рост и биомеханику человека. Робот, который может наклоняться, приседать и тянуться, получает доступ к этим объектам без перестройки пространства.
Gemini Robotics ER 2: как робот видит и планирует действия
Если Robotics 2 - это мышцы, то ER 2 - «глаза и мозг». Модель восприятия анализирует непрерывный видеопоток с камер робота, отслеживает объекты в пространстве и планирует последовательность действий для выполнения задачи.
Ключевая способность ER 2 - работа с несколькими роботами разной конструкции одновременно. Модель может координировать команду машин: один робот-манипулятор подаёт деталь, второй - человекоподобный - переносит её через препятствия, третий - колёсный - доставляет к конвейеру. ER 2 отслеживает положение каждого робота, состояние задачи и перераспределяет действия при изменении обстановки.
На практике это выглядит так: ER 2 видит лампочку на столе, определяет её положение и ориентацию, рассчитывает траекторию захвата и передаёт команду модели Robotics 2 для вкручивания. Если лампочка выскальзывает из захвата, ER 2 фиксирует ошибку и запускает корректирующее движение. Пока что, правда, успешность такого манёвра невысока - но об этом ниже.
Gemini Robotics On-Device 2: работа без интернета
Третья модель решает проблему автономности. Gemini Robotics On-Device 2 работает прямо на процессоре робота, без отправки данных в облако. Это снижает задержки - критичный фактор для движений в реальном времени - и повышает надёжность в условиях нестабильной связи.
Локальная работа также решает вопросы безопасности и конфиденциальности. Видеопоток с камер робота не покидает устройство, что важно для применения на закрытых производствах, в медицинских учреждениях или военных объектах. Модель оптимизирована под ограниченные вычислительные ресурсы, сохраняя базовую функциональность управления движениями и навигации.
Что роботы умеют уже сейчас: от завязывания пакетов до вкручивания лампочек
Перейдём от архитектуры к конкретным действиям. В демонстрациях Google DeepMind роботы под управлением Gemini Robotics 2 выполняют четыре типа задач, каждая из которых раньше требовала либо отдельного программирования, либо была недоступна вовсе.
Перенос предметов при ходьбе. Робот берёт коробку со стола и переносит её в другой конец комнаты, переступая через разбросанные предметы. Раньше ходьба и манипуляция были разделены: робот либо шёл, либо стоял и двигал руками. Теперь эти действия синхронизированы.
Приседания. Робот опускается, чтобы поднять объект с пола, и встаёт обратно, сохраняя равновесие. Для двуногой машины это сложнее, чем кажется: нужно сместить центр тяжести, согнуть колени и бёдра под правильными углами, одновременно компенсируя инерцию корпуса. Неправильный расчёт - и робот падает.
Завязывание пакетов. Задача на мелкую моторику: робот берёт полиэтиленовый пакет, скручивает горловину и завязывает узел. Пакет - непредсказуемый объект: он мнётся, скользит и меняет форму при каждом касании. Модель должна адаптироваться к этим изменениям в реальном времени.
Вкручивание лампочек. Классическая шутка про «сколько нужно роботов, чтобы вкрутить лампочку» становится тестом на точность. Робот берёт лампочку, совмещает цоколь с патроном и вкручивает её вращательным движением кисти. Это требует субмиллиметровой точности совмещения и контроля усилия, чтобы не сорвать резьбу и не раздавить стекло.
Честно об ограничениях: точность 36% и непредсказуемая среда
Цифра, которая отрезвляет: вкручивание лампочки удаётся лишь в 36% попыток. В двух случаях из трёх робот либо не может правильно совместить цоколь с патроном, либо прикладывает неверное усилие, либо теряет лампочку из захвата. Это не провал, а индикатор честного уровня технологии на середину 2026 года.
Мелкая моторика остаётся главным вызовом для человекоподобных роботов. Человеческая кисть имеет 27 степеней свободы и тысячи сенсорных рецепторов, обеспечивающих обратную связь по давлению, температуре и текстуре. Роботизированные захваты пока не могут сравниться с этим ни по чувствительности, ни по ловкости. Завязывание пакета или вкручивание лампочки - это демонстрация потенциала, а не готового продукта.
Вторая проблема - неструктурированная среда. Лабораторный полигон можно контролировать: освещение стабильное, объекты на известных местах, покрытие пола однородное. Реальный мир - это блики на стекле, скользкий пол после уборки, предметы нестандартной формы и люди, которые ходят непредсказуемыми траекториями. Модель ER 2 анализирует видеопоток, но качество этого анализа падает при изменении условий, к которым система не была подготовлена.
Это нормальный этап развития. Похожую траекторию проходили языковые модели: GPT-2 в 2019 году генерировал бессвязный текст в половине случаев, а через три года GPT-4 сдавал экзамены на уровне студента. Робототехника идёт тем же путём - от лабораторных успехов к стабильной работе в реальных условиях.
Кому это важно уже сейчас: бизнес, разработчики и производство
Gemini Robotics 2 - исследовательский анонс, а не коммерческий продукт. Но направление движения указывает на конкретные сферы, которые изменятся в ближайшие годы.
Производственные и складские компании. Складские операции - сортировка, упаковка, перемещение товаров - уже частично роботизированы, но с ограничениями. Роботы-манипуляторы на фиксированных позициях выполняют повторяющиеся действия; мобильные платформы перевозят грузы по заданным маршрутам. Человекоподобный робот с целостным управлением телом может объединить эти функции: дойти до стеллажа, взять предмет с верхней полки, присесть за упавшим товаром, перенести хрупкий груз. Agility Robotics с роботом Digit уже работает в этом направлении на складах Amazon, а новый центр обучения во Фримонте - мы писали о нём в статье про гонку человекоподобных роботов - ускоряет подготовку машин к реальным задачам.
Разработчики робототехнических приложений. Появление специализированных моделей для движений, восприятия и локальной работы открывает возможность строить приложения поверх готового AI-фундамента. Вместо разработки системы управления с нуля команды могут сосредоточиться на конкретных сценариях: робот для уборки помещений, ассистент на кухне ресторана, помощник на строительной площадке. Google уже движется в этом направлении с платформой Gemini Enterprise, а стартапы вроде Enigma - мы разбирали их подход в материале про управление роботами без программирования - создают интерфейсы, где машине можно поставить задачу на обычном языке.
Бизнес-лидеры и руководители. Понимание сроков и ограничений технологии помогает принимать решения об инвестициях. Gemini Robotics 2 показывает, что целостное управление телом и координация нескольких роботов - решённые исследовательские задачи. Мелкая моторика и работа в неструктурированной среде - ещё нет. Практический вывод: в горизонте 2-3 лет можно начинать пилотные проекты на контролируемых территориях (склады, производственные линии), а массовое применение в открытой среде - перспектива 5-7 лет.
Что делать бизнесу прямо сейчас
Начать с аудита процессов, которые требуют одновременного перемещения и манипуляции предметами. Если в вашей цепочке есть операции вида «дойти, взять, перенести, положить» - это кандидаты на роботизацию в среднесрочной перспективе. Отслеживайте динамику точности выполнения задач: когда показатель успешности мелкой моторики поднимется с 36% до 80-90%, начнётся фаза активного внедрения. Пока же технология остаётся в исследовательской стадии, и форсировать её применение рискованно.
Что дальше: от лаборатории к реальному миру
Анонс Gemini Robotics 2 вписывается в более широкий тренд на воплощённый искусственный интеллект - embodied AI. Это направление исходит из идеи, что интеллект не может развиваться в отрыве от физического взаимодействия с миром. Текстовые и визуальные модели учатся на данных, созданных людьми; роботы учатся на прямом контакте с реальностью.
Google DeepMind продолжит улучшать точность мелкой моторики - это приоритет для следующих версий. Параллельно идут работы по стандартизации взаимодействия между разными типами роботов. Модель ER 2 уже координирует машины разной конструкции; следующий шаг - создание протоколов, по которым роботы разных производителей смогут работать в одной команде без центрального контроллера.
Конкуренция в этой области усиливается. Mistral недавно представила Robostral Navigate - модель навигации для роботов с одной камерой, которая обходит многокамерные аналоги по точности маршрутов - мы разбирали эту технологию в статье про навигацию без карт и лидаров. Разные подходы - целостное управление телом у Google против эффективной навигации у Mistral - вместе формируют фундамент для следующего поколения робототехники.
Для обычного человека главный сигнал такой: роботы, которые ходят, наклоняются и работают руками в нашей среде, перестают быть фантастикой. Они пока неловкие, часто ошибаются и требуют контролируемых условий. Но траектория движения - от 36% к стабильным 90% и выше - знакома по другим областям AI. Вопрос не в том, произойдёт ли это, а в том, кто успеет подготовиться к моменту, когда робот на складе или в цеху станет экономически оправданным решением.