GPT-6 Astra и пространственное мышление: что показали первые тесты в робототехнике
GPT-6 Astra прошла робототехнический бенчмарк StationeryBench: 7 полностью выполненных задач из 100 против нуля у MolmoAct2 и медианный прогресс 46 против 12. Разбираем, что это говорит о пространственном мышлении ИИ и какие ограничения остаются.
Что случилось: коротко о главном
OpenAI протестировала GPT-6 Astra в робототехнике: модель управляла двухруким роботом и решала бытовые задачи с предметами на столе. На новом бенчмарке StationeryBench она полностью выполнила 7 задач из 100. Вторая модель в сравнении, MolmoAct2 от Ai2, не выполнила ни одной.
Бенчмарк - это набор стандартных тестов, по которым модели сравнивают в одинаковых условиях. Обе системы работали на одинаковых двухруких роботах YAM, поэтому разницу в результате нельзя списать на разное железо. Всего прошло 200 испытаний. Медианная оценка прогресса: 46 из 100 у Astra против 12 из 100 у MolmoAct2.
Исследователь Йоав Арци из Корнеллского университета и Google DeepMind называет результат «качественным скачком в пространственном мышлении». Он же проговаривает ограничение: даже Astra пока не достигает уровня человека в других сценариях. Семь полностью решённых задач из ста - это заметный прогресс, не победа.
Что такое StationeryBench и почему задачи с маркером и линейкой - это сложно
StationeryBench - новый робототехнический бенчмарк. Его пять задач построены вокруг предметов на столе, и почти каждая требует двух рук и согласованных движений. Речь не о вычислениях в виртуальной среде: робот физически берёт предмет, поворачивает его, переносит и передаёт из одной руки в другую.
Пространственное мышление у ИИ означает способность понимать, где находится объект, под каким углом его удобно взять, как повернуть и куда переместить, не задев соседние предметы. Для человека это фон: мы берём ручку и откручиваем колпачок, не задумываясь. Для робота здесь сходятся три задачи одновременно: распознать предмет по изображению с камер, спланировать движение и удержать захват, пока вторая рука делает своё дело.
Проверьте на себе. Попробуйте закрытыми глазами взять со стола ручку, нащупать колпачок и открутить его. Скорее всего, вы справитесь: память о положении вещей и мышечное чувство подсказывают мелкие поправки. У робота такой памяти по умолчанию нет, и каждое движение приходится выстраивать заново по кадрам с камер. Ошибка в пару сантиметров на старте приводит к промаху на финише.
Пять задач StationeryBench: что именно делали роботы
Задач всего пять, все с предметами на столе. Среди них откручивание колпачка маркера и передача линейки между двумя руками робота. Полный список из открытого описания не раскрывается целиком, но формат у всех попыток один: есть предмет, есть цель и есть ограниченное время на попытку.
Двухрукость здесь принципиальна. Одной рукой маркер не удержать и колпачок одновременно не открутить: нужна вторая рука, которая фиксирует корпус и снимает крышку. Передача линейки между руками добавляет ещё один слой сложности - робот должен рассчитать момент, когда одна рука отпускает предмет, а вторая его подхватывает. Если момент выбран неверно, линейка падает.
Все результаты, видео и код выложены на GitHub, поэтому ход испытаний можно посмотреть самостоятельно и оценить, как робот ведёт себя в неудачных попытках.
Почему это называют «качественным скачком»
Формулировка Арци про «качественный скачок в пространственном мышлении» звучит громко, и её стоит разложить. Скачок виден не в абсолютных числах, а в разрыве между двумя моделями. MolmoAct2 не довела до конца ни одной попытки из ста, Astra довела семь. Одна система регулярно заканчивает действие, вторая стабильно останавливается на полпути.
Разница в семь задач из ста может показаться мелочью, но для робототехники это разница между «иногда получается» и «не получается вообще». Полностью выполненная задача означает, что модель прошла всю цепочку: увидела предмет, спланировала захват, скоординировала две руки и довела действие до конца без помощи человека.
Арци предполагает, что OpenAI обучала Astra на больших объёмах 3D-данных, например на сценах, собранных в Blender. Это гипотеза, а не подтверждённый факт: официального описания обучающего набора OpenAI не публиковала. Логика предположения понятна. Если модель видела миллионы трёхмерных сцен с разным освещением и углами, она лучше представляет, как предмет выглядит в пространстве и с какой стороны к нему подойти.
GPT-6 Astra против MolmoAct2: что говорят цифры
Условия сравнения выровнены: 200 испытаний, одинаковые двухрукие роботы YAM, один и тот же набор задач. Это важно, потому что в робототехнике результат сильно зависит от железа, и сравнение моделей на разной технике почти ничего не значит.
| Показатель | GPT-6 Astra | MolmoAct2 |
|---|---|---|
| Полностью выполненные задачи | 7 из 100 | 0 из 100 |
| Медианная оценка прогресса | 46 из 100 | 12 из 100 |
| Робот | YAM, две руки | YAM, две руки |
Из таблицы видно главное: разрыв между моделями проявляется не только в редких полных успехах, но и в типичном поведении. Astra в среднем проходит почти половину пути к цели, MolmoAct2 останавливается в самом начале.
Что такое медианная оценка прогресса и почему 46 против 12 - это много
Медиана - это середина списка результатов: половина попыток оказалась лучше, половина хуже. Оценка прогресса показывает, насколько задача выполнена, по шкале от 0 до 100. Считать её удобнее, чем фиксировать только «сделано» или «не сделано», потому что она различает почти провал и почти успех.
Пример. Робот подъехал к столу, взял маркер, но не смог открутить колпачок - это частичный прогресс, условно 40-50 баллов. Робот даже не дотянулся до предмета - это 10-15 баллов. Медиана 46 у Astra означает, что в типичном испытании модель подходит к цели заметно ближе, чем MolmoAct2 со своими 12.
Держите в голове вторую цифру: 46 из 100 - это всё ещё меньше половины. Полностью задача закрыта только в 7 случаях из 100. То есть модель понимает, что делать, но доводит дело до конца редко.
Не стоит делать из этого вывод о превосходстве OpenAI над Ai2 в целом. Перед нами один бенчмарк с узким набором задач. Как условия запуска и формулировка тестов меняют итоговый результат, мы разбирали в материале про две настройки API, которые втрое улучшили результат GPT-5.6 на тесте ARC-AGI-3: иногда модель меняется не сама, а способ, которым её тестируют.
Насколько это серьёзно: что говорят ограничения
Ограничений у новости больше, чем заголовков, и их честно перечислить.
- Даже Astra не достигает уровня человека в других сценариях. Это слова самого Арци, а не трактовка со стороны.
- Семь полностью выполненных задач из ста - это 7%, а не 70%. До надёжного робота-помощника по дому дистанция огромная.
- Бенчмарк REMAP, где Astra показывает точность, близкую к человеческой, ещё не опубликован, а значит данные не прошли независимую проверку.
- Предположение об обучении на 3D-сценах вроде Blender остаётся гипотезой исследователя.
- Публичного описания обучающего набора Astra нет, поэтому непонятно, какие именно данные повлияли на результат.
Вывод из списка простой: новость значимая, но это шаг, а не финиш. Аккуратная формулировка выглядит так: модель стала заметно лучше в узком классе задач, и это подтверждено на открытом бенчмарке с одинаковым железом для обеих систем.
REMAP: почему результаты пока нельзя считать окончательными
REMAP - ещё не опубликованный бенчмарк. Данные по нему не выложены целиком, воспроизвести замеры сторонним командам пока нельзя. Astra действительно показывает на нём точность, близкую к человеческой, но без публикации это предварительная информация, на которую не стоит опираться в решениях.
Сравните два случая. StationeryBench уже доступен: есть код, видео и разбор попыток на GitHub. REMAP доступен только в пересказе. Когда тест закрыт, невозможно проверить, какие задачи в него вошли, как считались баллы и не подбирался ли набор заданий под сильные стороны модели.
Что это значит для OpenAI и будущего роботов
Тесты в робототехнике не выглядят разовым исследованием. У OpenAI есть долгосрочные планы по созданию собственных потребительских роботов, и способность модели действовать в физическом мире - обязательная часть этого плана. Пока модели умели только отвечать текстом, разговор о домашнем роботе оставался теоретическим. С появлением результатов вроде StationeryBench появляется измеримая база: сколько задач из ста модель закрывает сегодня.
Ai2, разработчик MolmoAct2, тоже игрок на этом поле. Сравнение двух моделей на одном бенчмарке показывает, что конкуренция идёт не только в текстовых задачах и не только в качестве ответов на вопросы. Способность взять предмет со стола становится таким же критерием, как умение написать код или пройти тест на знания.
Что уже известно про саму Astra, её контекст и работу с компьютером, мы собрали в разборе что умеет GPT-6 Astra и как она изменит работу. Там же видно, почему робототехника логично продолжает линию модели, которая уверенно действует в цифровой среде.
Планка ожиданий при этом остаётся высокой, и не только в робототехнике. Отдельный сюжет о том, где возможности моделей заканчиваются, разобран в статье про десять математических прорывов Astra, где успехи соседствуют с сугубо человеческими задачами, которые ИИ пока не тянет.
Что это значит лично для вас
Сегодня - напрямую ничего. Роботов с таким уровнем пространственного мышления в продаже нет, а 7 выполненных задач из 100 не тянут на готовый продукт. Покупать нечего, менять процессы рано.
Тренд при этом значимый. ИИ учится взаимодействовать с физическим миром, и именно эта способность открывает дорогу к автоматизации в логистике, на производстве, в складских операциях и постепенно в быту. Если вы руководитель или специалист, который следит за развитием технологий, держите в поле зрения простой сигнал: робототехника перестаёт быть отдельной отраслью и становится частью общей AI-повестки.
Полезно запомнить и границу, за которую модели пока не выходят. Насколько сложно агенту вести самостоятельную работу без присмотра, показывает история про эксперимент, где AI-агенты не смогли провести исследование самостоятельно. Тот же разрыв виден и в робототехнике: модель понимает задачу, но довести действие до конца получается не всегда.
Возражение «это только для технарей» здесь закрывается само. Вся новость укладывается в несколько цифр и одну идею: робот учится брать предметы со стола так же, как человек, только пока заметно хуже. Ни формул, ни кода для понимания не требуется.
Главное в одном абзаце
GPT-6 Astra от OpenAI показала заметный прогресс в пространственном мышлении на новом бенчмарке StationeryBench. В 200 испытаниях на одинаковых двухруких роботах YAM модель полностью выполнила 7 задач из 100, а MolmoAct2 от Ai2 - ни одной. Медианный прогресс составил 46 против 12 из 100. Исследователь Йоав Арци называет это «качественным скачком в пространственном мышлении», но напоминает, что до уровня человека ещё далеко, а бенчмарк REMAP, где точность близка к человеческой, пока не опубликован. Результаты, видео и код лежат на GitHub, а у OpenAI есть долгосрочные планы по потребительским роботам.
Есть вопрос или заметили неточность? Напишите нам - мы обновим материал.