NVIDIA Cosmos 3 Edge: компактный ИИ для роботов, который работает без дата-центров
NVIDIA Cosmos 3 Edge — открытая модель ИИ с 4 млрд параметров для роботов и видеонаблюдения. Работает на Jetson и RTX PRO без облака, анализирует сцены на частоте до 15 Гц и заняла первое место в VANTAGE-Bench. Рассказываем, как устроена модель и как начать её использовать.
NVIDIA представила Cosmos 3 Edge - открытую модель мира с 4 миллиардами параметров, созданную для работы прямо на устройствах: роботах, камерах видеонаблюдения, промышленных контроллерах. Модель не требует постоянного подключения к облаку. Она анализирует происходящее, прогнозирует развитие событий и генерирует действия на месте, в реальном времени. Это шаг к по-настоящему автономным машинам, которые могут действовать без задержек и оглядки на интернет.
Главная особенность Cosmos 3 Edge - гибридная архитектура из двух трансформеров. Первый понимает сцену, второй планирует действие. Такой подход раньше встречался в крупных дата-центровых системах, а теперь стал доступен на периферийных устройствах вроде NVIDIA Jetson и RTX PRO. Разработчики получают открытые веса и скрипты для дообучения модели под свои задачи - от сортировки деталей на заводе до обнаружения аномалий в больничных коридорах.
Что такое Cosmos 3 Edge и зачем она нужна
Cosmos 3 Edge - это компактная версия моделей мира NVIDIA, адаптированная для периферийного искусственного интеллекта. Термин «модель мира» означает, что система строит внутреннее представление окружающей обстановки и может предсказывать, как эта обстановка изменится. В отличие от языковых моделей, которые работают с текстом, Cosmos 3 Edge взаимодействует с физическим миром через видеопотоки и данные сенсоров.
4 миллиарда параметров - относительно небольшой объём по меркам современных нейросетей. Для сравнения: флагманские текстовые модели часто оперируют сотнями миллиардов параметров и требуют серверных стоек с ускорителями. Cosmos 3 Edge сознательно сделана компактной. Её задача - работать там, где нет места мощным компьютерам и стабильному интернету: на погрузчике, который маневрирует между стеллажами, на дроне, осматривающем трубопровод, на камере, следящей за периметром склада.
Модель открыта: веса доступны для скачивания, а вместе с ними NVIDIA опубликовала скрипты для дообучения. Это означает, что инженер на заводе может взять готовую Cosmos 3 Edge, показать ей несколько часов видео с конкретного конвейера и получить систему, которая понимает именно этот цех, это освещение, эти движения персонала. Раньше подобная адаптация требовала месяцев работы команды специалистов по машинному обучению.
Как устроена модель: два трансформера вместо одного
Традиционные модели для робототехники часто используют один тип архитектуры: либо анализируют, либо генерируют. Cosmos 3 Edge объединяет два разных трансформера, каждый из которых отвечает за свою часть задачи. Это похоже на тандем опытного наблюдателя и быстрого планировщика, которые работают синхронно.
Авторегрессивный трансформер: понимание сцены
Первый компонент обрабатывает последовательность событий - кадры видео, показания датчиков расстояния, данные о положении суставов робота. Он работает по принципу, знакомому по языковым моделям: анализирует, что происходило до текущего момента, и формирует контекст. Если робот видит движущийся объект, авторегрессивный блок определяет, что это за объект, с какой скоростью он перемещается и как он взаимодействует с окружением.
Этот блок выявляет закономерности: «человек в жёлтой каске обычно идёт к выходу в конце смены», «коробка с красной маркировкой почти всегда оказывается на третьем стеллаже». Он не просто распознаёт предметы, а строит причинно-следственные связи между ними. Результат работы - структурированное описание сцены, которое передаётся второму компоненту.
Диффузионный трансформер: генерация действий
Второй компонент получает описание сцены и генерирует возможные варианты развития событий. Диффузионные модели знакомы широкой публике по генераторам изображений вроде FLUX - они создают картинку, постепенно убирая шум из случайного набора пикселей. Здесь тот же принцип применяется к действиям: модель «проявляет» оптимальную траекторию движения манипулятора или команду для контроллера двигателя.
Например, если робот должен захватить деталь, диффузионный трансформер просчитывает несколько возможных траекторий захвата, оценивает их по критериям надёжности и скорости, а затем выбирает лучшую. Весь процесс занимает доли секунды. Модель может одновременно планировать движение и предсказывать, как изменится сцена после выполнения действия. Это позволяет избежать ситуаций, когда робот успешно хватает предмет, но при этом задевает соседний.
Где работает Cosmos 3 Edge: от склада до больницы
Модель поддерживает работу на оборудовании NVIDIA Jetson (линейка компактных вычислителей для робототехники и IoT) и RTX PRO (профессиональные ускорители для рабочих станций). Это покрывает широкий спектр устройств - от встраиваемых модулей размером с ладонь до мощных компьютеров на посту охраны.
Промышленные роботы и манипуляторы
На заводах и складах Cosmos 3 Edge может управлять роботами-манипуляторами, которые сортируют детали, упаковывают товары или собирают компоненты. NVIDIA выпустила специальную версию модели, дообученную на датасете DROID - крупном наборе данных с записями реальных манипуляционных задач. Эта версия «из коробки» понимает, как захватывать предметы разной формы, перекладывать их и вставлять в пазы.
Локальное исполнение критически важно для производств, где задержка в 100-200 миллисекунд может привести к браку или аварии. Робот с Cosmos 3 Edge принимает решение на месте, не дожидаясь ответа от облачного сервера. Даже если интернет пропадёт, конвейер продолжит работу.
Видеонаблюдение и безопасность
Модель обрабатывает видеопоток с частотой до 15 кадров в секунду - достаточно для большинства задач безопасности. Она может обнаруживать аномалии: оставленный предмет в аэропорту, падение человека в больничном коридоре, появление транспорта в пешеходной зоне. Все вычисления происходят прямо на камере или ближайшем контроллере, без отправки видео в облако.
Это решает проблему конфиденциальности. Видеозаписи с заводских цехов, больничных палат или частной территории не покидают пределов локальной сети. Для организаций, которые обязаны соблюдать строгие правила обработки данных, такая архитектура становится единственно возможным вариантом внедрения ИИ-аналитики.
Почему локальный ИИ выгоднее облачного
Периферийное исполнение даёт три конкретных преимущества перед облачными решениями. Первое - скорость реакции. Cosmos 3 Edge выдаёт логические выводы с частотой до 15 Гц, то есть каждые 67 миллисекунд. Облачный сервис добавил бы минимум 100-200 миллисекунд на передачу данных туда и обратно. Для робота, который должен остановиться при появлении человека в опасной зоне, эта разница критична.
Второе - автономность. Склад, шахта или сельскохозяйственный дрон часто работают там, где связь нестабильна или отсутствует. Модель на борту продолжает функционировать независимо от внешних условий. Нет интернета - нет проблемы.
Третье - конфиденциальность. Данные с камер и датчиков остаются на устройстве. Для медицинских учреждений, оборонных предприятий и любых организаций с чувствительной информацией это обязательное требование, а не просто удобство. Локальный ИИ снимает юридические риски, связанные с передачей данных третьей стороне.
Экономика тоже на стороне периферии: разовое вложение в устройство с GPU заменяет ежемесячные платежи за облачные API и трафик. При масштабировании на десятки или сотни устройств разница становится значительной. Компактные модели для периферии - это тренд, который набирает обороты: IBM недавно выпустила Granite 4.0 Nano для смартфонов и IoT, и NVIDIA движется в том же направлении.
Как начать использовать Cosmos 3 Edge
Модель доступна на платформах NVIDIA. Веса открыты, лицензия разрешает коммерческое использование. Для старта нужен компьютер с совместимым ускорителем - Jetson или RTX PRO - и базовые навыки работы с Python. NVIDIA предоставляет документацию и примеры кода для быстрого развёртывания.
Дообучение на своих данных
Стандартная модель хорошо справляется с типовыми сценариями, но реальный мир разнообразен. Освещение в цехе отличается от лабораторного, коробки у одного заказчика синие, у другого - серые, а движения персонала имеют свою специфику. Чтобы модель работала точнее в конкретных условиях, NVIDIA опубликовала скрипты для дообучения.
Процесс выглядит так: разработчик записывает видео с камеры, установленной на рабочем месте, размечает ключевые события (например, «человек пересёк линию», «робот взял деталь», «погрузчик повернул») и запускает скрипт. Через несколько часов обучения на локальном GPU модель адаптируется к новым условиям. NVIDIA и Hugging Face уже упростили дообучение генеративных моделей через интеграцию с NeMo Automodel, и аналогичный подход применён здесь.
Версия для манипуляционных задач на датасете DROID - готовая отправная точка для проектов, связанных с захватом и перемещением объектов. Если робот должен перекладывать детали из контейнера на конвейер, эту версию можно брать за основу и дообучать на своих примерах, а не начинать с нуля.
Первое место в VANTAGE-Bench: что это значит
VANTAGE-Bench - бенчмарк для оценки моделей в задачах видеоаналитики. Он измеряет, насколько точно система распознаёт объекты, отслеживает их перемещение и предсказывает события. Cosmos 3 Edge заняла первое место, обойдя как специализированные модели для видео, так и более крупные архитектуры.
Это объективный показатель: модель с 4 миллиардами параметров оказалась эффективнее многих конкурентов с большим числом параметров. Секрет - в гибридной архитектуре. Разделение на понимание и генерацию позволяет каждому компоненту специализироваться на своей задаче, а не пытаться охватить всё одной монолитной сетью. Результат бенчмарка подтверждает, что компактность не означает компромисс по точности.
Для разработчиков и руководителей, которые оценивают технологии для внедрения, лидерство в независимом тесте - сигнал, что модель готова к реальной эксплуатации. NVIDIA последовательно выпускает модели, занимающие верхние строчки в отраслевых рейтингах, и Cosmos 3 Edge продолжает эту линию.
Физический ИИ становится доступнее. Модель, которая понимает окружающий мир и действует в нём, теперь помещается на устройство размером с книгу. Заводы, склады, больницы и охранные системы получают инструмент, который работает без интернета, без задержек и без передачи данных вовне. Cosmos 3 Edge - это не исследовательский прототип, а готовый продукт с открытыми весами, документацией и скриптами для адаптации. Порог входа снизился: нужен только совместимый ускоритель и желание научить машину понимать физический мир.