Mistral выводит роботов в реальный мир: навигация без карт и лидаров с помощью одной камеры

Mistral выводит роботов в реальный мир: навигация без карт и лидаров с помощью одной камеры

Mistral представила Robostral Navigate — модель навигации для роботов с одной камерой и текстовыми командами. 77,4% успешных маршрутов в тестах, обходит многокамерные аналоги. Разбираем, как работает система без карт и лидаров.

Французская компания Mistral представила Robostral Navigate - систему, которая учит роботов ориентироваться в помещениях без предварительных карт и дорогих лидаров. Достаточно одной обычной RGB-камеры и текстовой инструкции на естественном языке: «пройди от холла до полки в кладовой». Робот понимает команду, видит пространство через камеру и дважды в секунду перестраивает маршрут, объезжая препятствия.

В тестах на бенчмарке R2R-CE модель выполнила 77,4% маршрутов успешно. Лучшие однокамерные аналоги показали 66,9%, многокамерные решения - 72,1%. Robostral Navigate с одной камерой обходит системы с несколькими сенсорами.

Что такое Robostral Navigate и почему это важно

Robostral Navigate - это модель автономной навигации, которая заменяет дорогой сенсорный стек одним недорогим устройством. Камера и текстовая команда - всё, что нужно роботу, чтобы добраться до цели. Никаких предварительно построенных карт, никаких лидаров, никакой сложной калибровки.

Практическая ценность - в снижении стоимости и упрощении внедрения. Роботы-курьеры в офисах, складские тележки, помощники в больницах - им больше не нужны дорогие сенсоры и долгая настройка под каждое помещение. Система работает «из коробки».

В основе Robostral Navigate - визуально-языковая модель на 8 миллиардов параметров. Она анализирует изображение с камеры и текстовую инструкцию, обновляя маршрут 2 раза в секунду. За точное планирование движений отвечает отдельная диффузионная модель - она генерирует траекторию шаг за шагом, чтобы робот аккуратно вписывался в повороты и объезжал препятствия.

Mistral протестировала систему на реальных роботах - Galaxea R1 и Hiwonder JetAuto. Результаты подтвердили: модель, обученная в симуляции, работает в физическом мире.

Как работает навигация без карт: визуально-языковая модель и планирование траектории

Robostral Navigate состоит из двух ключевых компонентов. Первый - «мозг»: визуально-языковая модель, которая понимает, куда идти. Второй - «мышцы»: диффузионная модель, которая решает, как именно двигаться. Вместе они превращают текстовую команду в последовательность точных действий.

Роль визуально-языковой модели: от команды к маршруту

Модель на 8 миллиардов параметров получает два потока данных: изображение с RGB-камеры и текстовую инструкцию. Она сопоставляет увиденное с командой и определяет направление движения. Частота обновления - 2 раза в секунду - позволяет реагировать на изменения в динамичной среде: прошёл человек, переставили стул, закрыли дверь.

Модель не запоминает карту помещения. Каждые полсекунды она заново оценивает ситуацию: «я вижу коридор, мне нужно в кладовую, ближайший поворот направо». Это напоминает навигацию человека в незнакомом здании - вы читаете указатели и корректируете путь на ходу.

Диффузионная модель: точные движения в пространстве

Диффузионные модели известны по генерации изображений - они создают картинку, постепенно убирая шум. В Robostral Navigate этот принцип применён к движению: модель генерирует траекторию, шаг за шагом уточняя её от случайного набора точек до плавного пути.

Результат - робот не просто знает, куда ехать, а делает это аккуратно. Он вписывается в дверные проёмы, не задевает углы и сохраняет плавность хода. Диффузионная модель работает как автопилот: высокоуровневая команда «поверни направо» превращается в последовательность точных движений колёс или шагов.

Такой подход к робототехнике - часть более широкого тренда Physical AI, где модели мира учатся прогнозировать последствия действий в реальном пространстве. NVIDIA Cosmos 3 Edge решает похожую задачу: объединяет зрение, язык и движения в одной модели, работающей прямо на борту робота без облака.

Обучение в симуляции: 2,4 миллиона траекторий и доработка на сложных сценариях

Robostral Navigate никогда не видела реального мира до финальных тестов. Всё обучение прошло в симуляции - на 2,4 миллионах виртуальных маршрутов. Робот учился ориентироваться в тысячах виртуальных помещений с разной планировкой, освещением и препятствиями.

После базового обучения применили обучение с подкреплением - метод, при котором модель получает «награду» за успешные действия и «штраф» за ошибки. Это позволило отработать сложные сценарии: узкие коридоры, внезапные препятствия, неоднозначные инструкции. Модель научилась справляться с ситуациями, которые не были явно прописаны в обучающих данных.

Обучение в симуляции решает три проблемы. Первая - безопасность: робот не разбивает себя и окружение во время проб и ошибок. Вторая - скорость: 2,4 миллиона траекторий можно пройти за дни, а не за годы реальных испытаний. Третья - разнообразие: симуляция генерирует бесконечные вариации помещений, мебели и освещения.

Этот подход - обучение AI в виртуальной среде перед переносом в реальность - становится стандартом в робототехнике. Симуляторы вроде MuJoCo и Isaac Sim позволяют роботам учиться без риска, хотя разрыв между симуляцией и реальным миром остаётся вызовом.

Результаты тестов: 77,4% успеха и сравнение с конкурентами

Бенчмарк R2R-CE оценивает способность робота выполнить навигационную задачу по текстовой инструкции. Robostral Navigate показала 77,4% успешных маршрутов - это значит, что почти в 8 случаях из 10 робот доезжает до цели без вмешательства человека.

Для сравнения: лучшие однокамерные решения достигли 66,9%, многокамерные - 72,1%. Разрыв в 5-10 процентных пунктов - существенный. Робот с одной камерой справляется лучше, чем системы с несколькими сенсорами или лидарами.

Практический смысл этих цифр: Robostral Navigate не просто дешевле из-за отсутствия лидаров, но и точнее. Меньше сенсоров - выше надёжность. Меньше данных для обработки - быстрее реакция.

Тесты на реальных роботах: Galaxea R1 и Hiwonder JetAuto

Mistral проверила модель на двух разных платформах. Galaxea R1 - это гуманоидный робот с руками и колёсной базой. Hiwonder JetAuto - компактный колёсный робот, популярный в образовании и исследованиях. Успешная работа на обеих платформах подтверждает универсальность подхода: модель не привязана к конкретному «телу» робота.

Сбор данных для обучения роботов - отдельная сложная задача. Проекты вроде Grabette от Pollen Robotics показывают, как недорогие устройства помогают записывать движения для обучения без использования самого робота. Mistral пошла другим путём - полностью синтетические данные, и это сработало.

Ограничения и следующие шаги

Модель обучалась только в симуляции. Реальный мир сложнее: непредсказуемое освещение, зеркала, прозрачные стены, движущиеся люди. В тестах на физических роботах эти факторы могли проявиться не в полной мере.

Нет данных об энергопотреблении и времени автономной работы. Для практического внедрения важно знать, сколько проработает робот на одном заряде и какую вычислительную нагрузку создаёт модель.

Не раскрыты ограничения по типам помещений. Модель тестировали в indoor-среде - офисы, коридоры, кладовые. Работа на улице, в производственных цехах или в полной темноте - открытый вопрос.

Mistral продолжит улучшать модель. Вероятные направления: дообучение на реальных данных, оптимизация под маломощные процессоры, расширение типов инструкций. Компания движется к тому, чтобы роботы понимали команды так же естественно, как люди. Стартап Enigma с $71 млн инвестиций решает смежную задачу - создаёт интуитивный интерфейс для управления роботами, где команда машине будет такой же простой, как поворот ручки громкости.

Есть вопрос или заметили неточность? Напишите нам - мы открыты к диалогу и исправлениям.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции