GPT-6 Astra прошла Portal и нашла алмаз в Minecraft: как нейросеть играет в видеоигры
GPT-6 Astra прошла Portal через скриншоты и управление клавиатурой с мышью, а в Minecraft самостоятельно нашла алмаз. Разбираем 3336 вызовов инструментов, почти сутки работы, стоимость 571,18 доллара и ограничения, которые пока мешают ИИ-агентам играть как люди.
Коротко: GPT-6 Astra прошла Portal и добыла алмаз в Minecraft
Агент на базе GPT-6 Astra прошел Portal до финала и добыл алмаз в Minecraft. В обоих экспериментах модель управляла игрой через изображение экрана, клавиатуру и мышь. Моды, прямое чтение памяти Minecraft и скрытый доступ к внутреннему состоянию игры не использовались.
Результаты заметно различались по масштабу. Прохождение Portal потребовало 3336 вызовов инструментов и заняло около 23 часов 43 минут с учетом пауз, ожидания и перебоев. Опубликованная запись чистого геймплея длится примерно два часа. В Minecraft алмаз нашли приблизительно через шесть часов работы агента.
Эксперименты показывают, что GPT-6 Astra умеет воспринимать меняющуюся обстановку, выбирать последовательность действий и исправлять часть ошибок. Полноценного понимания игрового мира это не доказывает: модель работала медленно, допускала нелогичные действия, а Minecraft запускали в мирном режиме.
Что именно сделал агент
В Portal Astra последовательно перемещалась по уровням, использовала порталы, взаимодействовала с объектами и решала головоломки. Целью был полный проход игры, а не отдельная демонстрация одного навыка.
В Minecraft задача выглядела иначе. Агенту нужно было самостоятельно выстроить цепочку действий: срубить дерево, создать инструменты, добыть камень и другие материалы, спуститься под землю и найти алмаз. Когда древесина заканчивалась, Astra возвращалась на поверхность и пополняла запас.
Как нейросеть играет в видеоигры через экран
Игровой агент работает в цикле наблюдения и действия. Он получает новое изображение, оценивает положение персонажа, выбирает команды, после чего игра выполняет ограниченное число тактов. Затем модель снова видит экран и корректирует план.
Такой подход ближе к управлению игрой человеком через интерфейс, чем к прямому программному доступу к игровому состоянию. Astra должна была учитывать, куда направлена камера, где находится персонаж и что изменилось после предыдущей команды.
Скриншоты вместо чтения памяти
В Minecraft применялись инструменты для Windows, которые передавали модели изображение экрана и принимали ввод с клавиатуры и мыши. Игра не сообщала агенту координаты блоков, содержимое карты или внутренние значения здоровья через специальный программный интерфейс.
В эксперименте с Portal использовали координаты персонажа, направление камеры и модифицированный SourcePauseTool. Инструмент связывал решения модели с игровым процессом: Astra выбирала последовательность нажатий, игра запускалась на ограниченное число тактов, а затем агент получал обновленное состояние.
Это ограничение имеет значение для оценки результата. Модель видела то, что доступно через экран, и должна была извлекать полезную информацию из визуальной сцены. При этом координаты и направление камеры давали ей дополнительный ориентир, которого обычный игрок на экране напрямую не видит.
Почему агент действует медленно
После каждого наблюдения Astra тратила время на анализ ситуации и выбор следующего шага. Для простой команды это может быть избыточно, но в головоломке одна ошибка меняет положение объектов и требует нового плана.
Полный прогон Portal длился около 23 часов 43 минут. Видеозапись примерно на два часа показывает главным образом игровое действие: периоды обдумывания и ожидания вырезаны. Поэтому ролик создает впечатление более быстрого прохождения, чем было в реальном эксперименте.
Проблема длинных пауз характерна для автономных систем, которым нужно следить за ходом задачи, фиксировать промежуточные результаты и возвращаться к цели после ошибок. Об особенностях контроля времени в таких сценариях мы писали в материале почему AI-агенты плохо контролируют время длинных задач.
Portal: 3336 вызовов инструментов и почти сутки эксперимента
Portal стала проверкой последовательного планирования в заранее созданной среде. В игре нужно перемещаться по уровням, открывать проходы, использовать портальную пушку, учитывать инерцию и понимать связь между несколькими объектами.
Astra дошла до финала, но процесс потребовал большого числа обращений к инструментам. Всего зафиксировано 3336 вызовов. Каждый вызов мог включать получение нового состояния, отправку управляющих команд или уточнение положения персонажа.
Подробный разбор прохождения, схемы подключения и ограничений эксперимента опубликован в статье GPT-6 Astra прошла Portal без помощи человека.
Сколько стоило прохождение Portal
Расчетная стоимость запросов к API составила 571,18 доллара. Автор эксперимента использовал подписку Codex Pro, поэтому отдельно эту сумму не платил. Расчет все равно показывает нагрузку, которую создает длительное управление игрой через модель.
| Параметр | Результат |
|---|---|
| Игра | Portal |
| Цель | Дойти до финала |
| Вызовы инструментов | 3336 |
| Полная длительность прогона | Около 23 часов 43 минут |
| Чистый геймплей в опубликованной записи | Примерно 2 часа |
| Расчетная стоимость API | 571,18 доллара |
Для массового игрового продукта такая экономика пока непрактична. Человеческий игрок проходит ту же игру значительно быстрее, а программный бот с прямым доступом к состоянию игры потреблял бы меньше шагов и вычислений.
Почему результат Portal нельзя считать идеальным тестом
Portal вышла в 2007 году. Ее головоломки подробно разобраны в прохождениях, видео и текстовых руководствах. Поэтому часть знаний о решениях могла попасть в обучающие данные GPT-6 Astra.
Модель все равно должна была распознавать ситуацию на экране и выполнять нужные действия в правильной последовательности. Однако эксперимент не отвечает на вопрос, умеет ли агент открывать неизвестные стратегии с нуля. Известная игра с фиксированными уровнями дает модели больше предварительных ориентиров, чем полностью новая среда.
GPT-6 Astra в Minecraft: от дерева до алмаза
Minecraft создает более открытую задачу. Здесь нет линейного набора уровней, который нужно пройти в заданном порядке. Агент должен сам определить ближайшую цель, понять зависимость ресурсов и вернуться к предыдущему шагу, если материалов не хватило.
Как агент выстроил стратегию добычи
Цепочка действий начиналась с дерева. Древесина нужна для первых инструментов и верстака. Затем Astra добывала камень, создавала более подходящие инструменты и уходила под землю в поисках ресурсов.
Нехватка материалов заставляла агента менять маршрут. Когда запас древесины заканчивался, Astra возвращалась на поверхность, собирала новые блоки и продолжала спуск. Алмаз был найден примерно через шесть часов.
Для человека эта последовательность знакома по базовой логике Minecraft. Для визуального агента она требует связать несколько состояний: ресурс нужен для предмета, предмет открывает доступ к следующему уровню добычи, а продвижение в пещеру создает новые риски и потребность в запасах.
Лодка как способ снизить урон от падения
В другом прогоне Astra дважды погибла после падения в глубокую пещеру. Затем агент использовал лодку для более безопасного спуска. Лодка помогла снизить урон от падения благодаря игровой физике.
Этот эпизод похож на адаптацию к неудаче: прежний способ перемещения оказался опасным, после чего появилась новая попытка с другим предметом. Приписывать этому полное понимание физики Minecraft рано. Модель могла связать конкретный предмет с конкретным результатом, не построив устойчивую общую модель игрового мира.
Почему мирный режим меняет оценку сложности
Первый эксперимент в Minecraft проходил в мирном режиме. В нем отсутствуют враждебные мобы, поэтому агенту не нужно одновременно отбиваться от противников, следить за здоровьем и выбирать безопасный маршрут.
Добыча алмаза остается многошаговой задачей, но условия заметно проще обычного выживания. В мирном режиме меньше случайных угроз, а ошибки при спуске и сборе ресурсов легче исправлять.
Поэтому результат корректнее описывать как успешное выполнение задачи в ограниченных условиях. Это хороший тест восприятия, последовательных действий и восстановления после нехватки ресурсов. Он не равен прохождению полноценного режима выживания с мобами и постоянной угрозой смерти.
Что эти эксперименты говорят об автономных ИИ-агентах
Чат-бот отвечает на запрос и формулирует инструкцию. Автономный агент получает состояние среды, делает действие, видит результат и меняет следующий шаг. В Portal и Minecraft GPT-6 Astra работала именно во втором режиме.
От ответа на запрос к действию в среде
Обычная инструкция для Minecraft может описать порядок добычи ресурсов словами. Агенту этого недостаточно. Он должен найти дерево на конкретном экране, удерживать нужную клавишу, проверить результат, создать инструмент и понять, куда двигаться дальше.
Каждая команда может изменить ситуацию. Персонаж поворачивается, блок исчезает, камера смотрит в другую сторону, проход оказывается закрыт. Модель получает обратную связь и строит новый шаг с учетом этих изменений.
Игры удобны для таких проверок, потому что в них есть понятная цель, наблюдаемый результат и фиксированные правила. Можно измерить число попыток, длительность прохождения, количество ошибок и цену каждого шага.
Где это может пригодиться за пределами игр
Подобный цикл полезен для тестирования интерфейсов, управления цифровыми инструментами и обучения агентов работе в многошаговых сценариях. Например, система может открыть программу, найти нужный элемент, выполнить действие, проверить результат и продолжить задачу.
Игровой эксперимент не превращает модель в готового универсального помощника. Он показывает, какие свойства нужно проверять: восприятие экрана, планирование, устойчивость к ошибкам, работу с неопределенностью и способность сохранять цель в течение нескольких часов.
Похожий сдвиг происходит и в создании игр: нейросети уже генерируют браузерные 3D-миры по текстовым запросам. О возможностях Claude Opus 5 и таких прототипов мы рассказывали в материале о создании полноценных 3D-миров по одному запросу.
Ограничения: адаптация есть, но понимание остается неполным
Успешный финальный результат скрывает множество промежуточных решений. Чтобы оценить возможности агента честно, нужно учитывать условия эксперимента, скорость, стоимость и качество действий.
Нелогичные действия в Minecraft
Astra иногда разрушала верстак. Это действие не помогало найти алмаз и могло усложнить дальнейшее создание инструментов, если поблизости не было другого верстака или ресурсов для нового.
Такие эпизоды показывают границу между достижением цели и надежным контролем контекста. Модель способна продолжать рабочую цепочку после ошибки, но не всегда выбирает действие, которое сохраняет полезные ресурсы и упрощает следующие шаги.
Скорость и цена пока не подходят для массового применения
Один проход Portal потребовал почти суток полного времени, 3336 инструментальных вызовов и расчетных 571,18 доллара API-затрат. Паузы на обдумывание сделали прохождение еще менее похожим на работу обычного игрового помощника.
- Мирный режим Minecraft уменьшил число угроз.
- Portal имеет фиксированные уровни и давно известные решения.
- Возможные знания из обучающих данных снижают чистоту проверки.
- Нелогичные действия указывают на слабый контроль контекста.
- Высокая цена и низкая скорость ограничивают длительные автономные сценарии.
Способность иногда найти рабочий прием не равна стабильному пониманию цели. Для практического агента важен весь процесс: предсказуемое выполнение, экономное использование ресурсов, восстановление после ошибок и контроль рисков.
Как проверяли эксперименты GPT-6 Astra
Оценивать такие новости удобнее по разделенным параметрам. Конечный результат показывает, что задача завершилась. Журналы, конфигурация и описание управления помогают понять, каким путем агент к нему пришел.
Какие детали можно считать установленными
В эксперименте Portal автор под ником cozyblaze опубликовал систему, журналы сессии и конфигурацию. В описании указаны полный прогон около 23 часов 43 минут, 3336 вызовов инструментов, запись чистого геймплея примерно на два часа и расчетная стоимость API в 571,18 доллара. Для оплаты отдельно автор использовал Codex Pro.
Эксперименты Minecraft проводили разработчики Уян Чжоу и Тяньюй Вэй. Агент получал изображения экрана и управлял клавиатурой и мышью через инструменты для Windows. Прямое чтение памяти Minecraft и моды не применялись. Первый прогон проходил в мирном режиме, а алмаз был найден примерно через шесть часов.
| Что проверяли | Что показал эксперимент |
|---|---|
| Восприятие интерфейса | Astra анализировала скриншоты и положение камеры |
| Управление | Агент отправлял команды клавиатуре и мыши |
| Планирование | Модель выстраивала последовательность действий для Portal и Minecraft |
| Адаптация | Astra меняла подход после нехватки ресурсов и опасных падений |
| Надежность | Модель допускала медленные и нелогичные действия |
Главный вывод без преувеличений
GPT-6 Astra уже может воспринимать экран, планировать серию действий и адаптироваться к некоторым ошибкам в игре. Portal и Minecraft показали это на конкретных измеримых задачах: 3336 вызовов инструментов, около 23 часов 43 минут полного прогона и добыча алмаза примерно за шесть часов.
До надежного универсального игрового агента еще далеко. Astra работает медленно, требует дорогостоящих запросов, иногда теряет контекст и проходила Minecraft в упрощенном режиме. Эти эксперименты лучше воспринимать как проверку отдельных способностей автономных систем, а не как доказательство человеческого уровня игрового интеллекта.
Есть вопрос или заметили неточность? Сообщите об этом, чтобы материал оставался ясным и проверяемым.