GPT-6 Astra прошла Portal и нашла алмаз в Minecraft: как нейросеть играет в видеоигры

GPT-6 Astra прошла Portal и нашла алмаз в Minecraft: как нейросеть играет в видеоигры

GPT-6 Astra прошла Portal через скриншоты и управление клавиатурой с мышью, а в Minecraft самостоятельно нашла алмаз. Разбираем 3336 вызовов инструментов, почти сутки работы, стоимость 571,18 доллара и ограничения, которые пока мешают ИИ-агентам играть как люди.

Коротко: GPT-6 Astra прошла Portal и добыла алмаз в Minecraft

Агент на базе GPT-6 Astra прошел Portal до финала и добыл алмаз в Minecraft. В обоих экспериментах модель управляла игрой через изображение экрана, клавиатуру и мышь. Моды, прямое чтение памяти Minecraft и скрытый доступ к внутреннему состоянию игры не использовались.

Результаты заметно различались по масштабу. Прохождение Portal потребовало 3336 вызовов инструментов и заняло около 23 часов 43 минут с учетом пауз, ожидания и перебоев. Опубликованная запись чистого геймплея длится примерно два часа. В Minecraft алмаз нашли приблизительно через шесть часов работы агента.

Эксперименты показывают, что GPT-6 Astra умеет воспринимать меняющуюся обстановку, выбирать последовательность действий и исправлять часть ошибок. Полноценного понимания игрового мира это не доказывает: модель работала медленно, допускала нелогичные действия, а Minecraft запускали в мирном режиме.

Что именно сделал агент

В Portal Astra последовательно перемещалась по уровням, использовала порталы, взаимодействовала с объектами и решала головоломки. Целью был полный проход игры, а не отдельная демонстрация одного навыка.

В Minecraft задача выглядела иначе. Агенту нужно было самостоятельно выстроить цепочку действий: срубить дерево, создать инструменты, добыть камень и другие материалы, спуститься под землю и найти алмаз. Когда древесина заканчивалась, Astra возвращалась на поверхность и пополняла запас.

Как нейросеть играет в видеоигры через экран

Игровой агент работает в цикле наблюдения и действия. Он получает новое изображение, оценивает положение персонажа, выбирает команды, после чего игра выполняет ограниченное число тактов. Затем модель снова видит экран и корректирует план.

Такой подход ближе к управлению игрой человеком через интерфейс, чем к прямому программному доступу к игровому состоянию. Astra должна была учитывать, куда направлена камера, где находится персонаж и что изменилось после предыдущей команды.

Скриншоты вместо чтения памяти

В Minecraft применялись инструменты для Windows, которые передавали модели изображение экрана и принимали ввод с клавиатуры и мыши. Игра не сообщала агенту координаты блоков, содержимое карты или внутренние значения здоровья через специальный программный интерфейс.

В эксперименте с Portal использовали координаты персонажа, направление камеры и модифицированный SourcePauseTool. Инструмент связывал решения модели с игровым процессом: Astra выбирала последовательность нажатий, игра запускалась на ограниченное число тактов, а затем агент получал обновленное состояние.

Это ограничение имеет значение для оценки результата. Модель видела то, что доступно через экран, и должна была извлекать полезную информацию из визуальной сцены. При этом координаты и направление камеры давали ей дополнительный ориентир, которого обычный игрок на экране напрямую не видит.

Почему агент действует медленно

После каждого наблюдения Astra тратила время на анализ ситуации и выбор следующего шага. Для простой команды это может быть избыточно, но в головоломке одна ошибка меняет положение объектов и требует нового плана.

Полный прогон Portal длился около 23 часов 43 минут. Видеозапись примерно на два часа показывает главным образом игровое действие: периоды обдумывания и ожидания вырезаны. Поэтому ролик создает впечатление более быстрого прохождения, чем было в реальном эксперименте.

Проблема длинных пауз характерна для автономных систем, которым нужно следить за ходом задачи, фиксировать промежуточные результаты и возвращаться к цели после ошибок. Об особенностях контроля времени в таких сценариях мы писали в материале почему AI-агенты плохо контролируют время длинных задач.

Portal: 3336 вызовов инструментов и почти сутки эксперимента

Portal стала проверкой последовательного планирования в заранее созданной среде. В игре нужно перемещаться по уровням, открывать проходы, использовать портальную пушку, учитывать инерцию и понимать связь между несколькими объектами.

Astra дошла до финала, но процесс потребовал большого числа обращений к инструментам. Всего зафиксировано 3336 вызовов. Каждый вызов мог включать получение нового состояния, отправку управляющих команд или уточнение положения персонажа.

Подробный разбор прохождения, схемы подключения и ограничений эксперимента опубликован в статье GPT-6 Astra прошла Portal без помощи человека.

Сколько стоило прохождение Portal

Расчетная стоимость запросов к API составила 571,18 доллара. Автор эксперимента использовал подписку Codex Pro, поэтому отдельно эту сумму не платил. Расчет все равно показывает нагрузку, которую создает длительное управление игрой через модель.

ПараметрРезультат
ИграPortal
ЦельДойти до финала
Вызовы инструментов3336
Полная длительность прогонаОколо 23 часов 43 минут
Чистый геймплей в опубликованной записиПримерно 2 часа
Расчетная стоимость API571,18 доллара

Для массового игрового продукта такая экономика пока непрактична. Человеческий игрок проходит ту же игру значительно быстрее, а программный бот с прямым доступом к состоянию игры потреблял бы меньше шагов и вычислений.

Почему результат Portal нельзя считать идеальным тестом

Portal вышла в 2007 году. Ее головоломки подробно разобраны в прохождениях, видео и текстовых руководствах. Поэтому часть знаний о решениях могла попасть в обучающие данные GPT-6 Astra.

Модель все равно должна была распознавать ситуацию на экране и выполнять нужные действия в правильной последовательности. Однако эксперимент не отвечает на вопрос, умеет ли агент открывать неизвестные стратегии с нуля. Известная игра с фиксированными уровнями дает модели больше предварительных ориентиров, чем полностью новая среда.

GPT-6 Astra в Minecraft: от дерева до алмаза

Minecraft создает более открытую задачу. Здесь нет линейного набора уровней, который нужно пройти в заданном порядке. Агент должен сам определить ближайшую цель, понять зависимость ресурсов и вернуться к предыдущему шагу, если материалов не хватило.

Как агент выстроил стратегию добычи

Цепочка действий начиналась с дерева. Древесина нужна для первых инструментов и верстака. Затем Astra добывала камень, создавала более подходящие инструменты и уходила под землю в поисках ресурсов.

Нехватка материалов заставляла агента менять маршрут. Когда запас древесины заканчивался, Astra возвращалась на поверхность, собирала новые блоки и продолжала спуск. Алмаз был найден примерно через шесть часов.

Для человека эта последовательность знакома по базовой логике Minecraft. Для визуального агента она требует связать несколько состояний: ресурс нужен для предмета, предмет открывает доступ к следующему уровню добычи, а продвижение в пещеру создает новые риски и потребность в запасах.

Лодка как способ снизить урон от падения

В другом прогоне Astra дважды погибла после падения в глубокую пещеру. Затем агент использовал лодку для более безопасного спуска. Лодка помогла снизить урон от падения благодаря игровой физике.

Этот эпизод похож на адаптацию к неудаче: прежний способ перемещения оказался опасным, после чего появилась новая попытка с другим предметом. Приписывать этому полное понимание физики Minecraft рано. Модель могла связать конкретный предмет с конкретным результатом, не построив устойчивую общую модель игрового мира.

Почему мирный режим меняет оценку сложности

Первый эксперимент в Minecraft проходил в мирном режиме. В нем отсутствуют враждебные мобы, поэтому агенту не нужно одновременно отбиваться от противников, следить за здоровьем и выбирать безопасный маршрут.

Добыча алмаза остается многошаговой задачей, но условия заметно проще обычного выживания. В мирном режиме меньше случайных угроз, а ошибки при спуске и сборе ресурсов легче исправлять.

Поэтому результат корректнее описывать как успешное выполнение задачи в ограниченных условиях. Это хороший тест восприятия, последовательных действий и восстановления после нехватки ресурсов. Он не равен прохождению полноценного режима выживания с мобами и постоянной угрозой смерти.

Что эти эксперименты говорят об автономных ИИ-агентах

Чат-бот отвечает на запрос и формулирует инструкцию. Автономный агент получает состояние среды, делает действие, видит результат и меняет следующий шаг. В Portal и Minecraft GPT-6 Astra работала именно во втором режиме.

От ответа на запрос к действию в среде

Обычная инструкция для Minecraft может описать порядок добычи ресурсов словами. Агенту этого недостаточно. Он должен найти дерево на конкретном экране, удерживать нужную клавишу, проверить результат, создать инструмент и понять, куда двигаться дальше.

Каждая команда может изменить ситуацию. Персонаж поворачивается, блок исчезает, камера смотрит в другую сторону, проход оказывается закрыт. Модель получает обратную связь и строит новый шаг с учетом этих изменений.

Игры удобны для таких проверок, потому что в них есть понятная цель, наблюдаемый результат и фиксированные правила. Можно измерить число попыток, длительность прохождения, количество ошибок и цену каждого шага.

Где это может пригодиться за пределами игр

Подобный цикл полезен для тестирования интерфейсов, управления цифровыми инструментами и обучения агентов работе в многошаговых сценариях. Например, система может открыть программу, найти нужный элемент, выполнить действие, проверить результат и продолжить задачу.

Игровой эксперимент не превращает модель в готового универсального помощника. Он показывает, какие свойства нужно проверять: восприятие экрана, планирование, устойчивость к ошибкам, работу с неопределенностью и способность сохранять цель в течение нескольких часов.

Похожий сдвиг происходит и в создании игр: нейросети уже генерируют браузерные 3D-миры по текстовым запросам. О возможностях Claude Opus 5 и таких прототипов мы рассказывали в материале о создании полноценных 3D-миров по одному запросу.

Ограничения: адаптация есть, но понимание остается неполным

Успешный финальный результат скрывает множество промежуточных решений. Чтобы оценить возможности агента честно, нужно учитывать условия эксперимента, скорость, стоимость и качество действий.

Нелогичные действия в Minecraft

Astra иногда разрушала верстак. Это действие не помогало найти алмаз и могло усложнить дальнейшее создание инструментов, если поблизости не было другого верстака или ресурсов для нового.

Такие эпизоды показывают границу между достижением цели и надежным контролем контекста. Модель способна продолжать рабочую цепочку после ошибки, но не всегда выбирает действие, которое сохраняет полезные ресурсы и упрощает следующие шаги.

Скорость и цена пока не подходят для массового применения

Один проход Portal потребовал почти суток полного времени, 3336 инструментальных вызовов и расчетных 571,18 доллара API-затрат. Паузы на обдумывание сделали прохождение еще менее похожим на работу обычного игрового помощника.

  • Мирный режим Minecraft уменьшил число угроз.
  • Portal имеет фиксированные уровни и давно известные решения.
  • Возможные знания из обучающих данных снижают чистоту проверки.
  • Нелогичные действия указывают на слабый контроль контекста.
  • Высокая цена и низкая скорость ограничивают длительные автономные сценарии.

Способность иногда найти рабочий прием не равна стабильному пониманию цели. Для практического агента важен весь процесс: предсказуемое выполнение, экономное использование ресурсов, восстановление после ошибок и контроль рисков.

Как проверяли эксперименты GPT-6 Astra

Оценивать такие новости удобнее по разделенным параметрам. Конечный результат показывает, что задача завершилась. Журналы, конфигурация и описание управления помогают понять, каким путем агент к нему пришел.

Какие детали можно считать установленными

В эксперименте Portal автор под ником cozyblaze опубликовал систему, журналы сессии и конфигурацию. В описании указаны полный прогон около 23 часов 43 минут, 3336 вызовов инструментов, запись чистого геймплея примерно на два часа и расчетная стоимость API в 571,18 доллара. Для оплаты отдельно автор использовал Codex Pro.

Эксперименты Minecraft проводили разработчики Уян Чжоу и Тяньюй Вэй. Агент получал изображения экрана и управлял клавиатурой и мышью через инструменты для Windows. Прямое чтение памяти Minecraft и моды не применялись. Первый прогон проходил в мирном режиме, а алмаз был найден примерно через шесть часов.

Что проверялиЧто показал эксперимент
Восприятие интерфейсаAstra анализировала скриншоты и положение камеры
УправлениеАгент отправлял команды клавиатуре и мыши
ПланированиеМодель выстраивала последовательность действий для Portal и Minecraft
АдаптацияAstra меняла подход после нехватки ресурсов и опасных падений
НадежностьМодель допускала медленные и нелогичные действия

Главный вывод без преувеличений

GPT-6 Astra уже может воспринимать экран, планировать серию действий и адаптироваться к некоторым ошибкам в игре. Portal и Minecraft показали это на конкретных измеримых задачах: 3336 вызовов инструментов, около 23 часов 43 минут полного прогона и добыча алмаза примерно за шесть часов.

До надежного универсального игрового агента еще далеко. Astra работает медленно, требует дорогостоящих запросов, иногда теряет контекст и проходила Minecraft в упрощенном режиме. Эти эксперименты лучше воспринимать как проверку отдельных способностей автономных систем, а не как доказательство человеческого уровня игрового интеллекта.

Есть вопрос или заметили неточность? Сообщите об этом, чтобы материал оставался ясным и проверяемым.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции