Gaia2 и ARE: Обновлённый бенчмарк и среда для тестирования AI-агентов в реальных условиях

Gaia2 и ARE: Обновлённый бенчмарк и среда для тестирования AI-агентов в реальных условиях

Gaia2 — обновлённый бенчмарк для AI-агентов, а ARE — открытая среда для их запуска и отладки. Узнайте, чем Gaia2 отличается от GAIA, какие модели показали лучшие результаты и почему временное планирование остаётся главной проблемой.

Исследователи представили Gaia2 - преемника бенчмарка GAIA, который проверяет способность AI-агентов выполнять сложные задачи, приближенные к реальной жизни. В отличие от предшественника, новый тест включает работу с приложениями, обработку неоднозначных запросов, адаптацию к неожиданным сбоям и соблюдение временных ограничений. Вместе с бенчмарком вышла открытая среда Meta Agents Research Environments (ARE), которая позволяет запускать, отлаживать и оценивать агентов в симулированном окружении - например, на виртуальном смартфоне с рабочими приложениями. По результатам тестирования ведущих моделей (GPT-5, Claude 4 Sonnet и Gemini 2.5 Pro) лучшие показатели у GPT-5. Все модели пока слабо справляются с задачами, требующими временного планирования и адаптации к изменениям. Проект доступен под открытыми лицензиями и призван упростить разработку и сравнение надёжных AI-помощников.

Что такое Gaia2 и ARE: прямой ответ

Gaia2 - это обновлённый бенчмарк для тестирования AI-агентов. Он пришёл на смену GAIA и проверяет, насколько хорошо агенты справляются с задачами, которые обычный человек решает в течение дня. ARE (Meta Agents Research Environments) - открытая среда, где этих агентов можно запускать, отлаживать и оценивать в симулированном окружении. Например, на виртуальном смартфоне с установленными приложениями.

Оба инструмента созданы с одной целью: сделать разработку AI-помощников проще и прозрачнее. Разработчики получают полигон для экспериментов, бизнес - объективный способ сравнить агентов перед внедрением. Это ответ на растущий запрос рынка к надёжности AI-систем. 57% компаний уже сталкивались с ошибками AI-агентов из-за неполных данных, и качественное тестирование становится критически важным.

Зачем нужен новый бенчмарк: эволюция от GAIA к Gaia2

Первый бенчмарк GAIA фокусировался на чтении и поиске информации. Агент получал вопрос, искал ответ в интернете и формулировал его. Это полезный навык, но реальная работа с цифровыми сервисами требует большего. Человек не просто ищет информацию - он бронирует билеты, заказывает доставку, переносит встречи при накладках. Gaia2 моделирует эти сценарии.

Новый бенчмарк расширяет тестирование в четырёх направлениях. Агент должен работать с приложениями, а не только с текстом. Он должен понимать неоднозначные запросы - такие, где цель не сформулирована жёстко. Он должен адаптироваться к неожиданным сбоям: приложение зависло, платёж не прошёл, время изменилось. И он должен соблюдать временные ограничения - успеть к дедлайну, учесть часовые пояса, не опоздать. Это шаг к оценке агентов в условиях, максимально похожих на реальную работу человека.

Ключевые отличия Gaia2 от GAIA

ХарактеристикаGAIAGaia2
Тип задачЧтение, поиск информацииРабота с приложениями, выполнение действий
ФормулировкиЧёткие запросыНеоднозначные, требующие уточнения
СбоиНе моделируютсяВстроены в сценарий
ВремяНе учитываетсяЖёсткие ограничения и дедлайны
Среда выполненияТекстовый интерфейсВиртуальный смартфон с приложениями (ARE)

Пример из Gaia2: агенту поручают заказать доставку продуктов через приложение. В процессе приложение выдаёт ошибку оплаты. Агент должен распознать сбой, повторить попытку или выбрать другой способ оплаты - и уложиться в отведённое время. В GAIA такой задачи не существовало.

Как работает среда ARE: виртуальный полигон для AI-агентов

ARE - это симулированное окружение, которое выглядит как обычный смартфон с установленными приложениями. Агент «видит» экран, нажимает кнопки, вводит текст, переключается между приложениями. Среда записывает каждый шаг: что агент сделал, сколько времени потратил, где ошибся.

Для разработчика это означает полную картину поведения агента. Можно запустить один сценарий десятки раз, меняя условия, и отследить, в какой момент агент принимает неверное решение. Такой подход напоминает отладку обычного программного обеспечения, только объект тестирования - AI-модель, которая действует в непредсказуемой среде. Google Cloud уже предлагает 13 демо-сценариев для создания AI-агентов, и Gaia2 с ARE могут стать следующим шагом в стандартизации такого тестирования.

Пример тестирования: агент на виртуальном смартфоне

Представьте конкретный сценарий. Агент получает задачу: «Найди билеты на концерт в пятницу вечером, но если их нет - предложи альтернативу на субботу и забронируй столик в ресторане рядом». Задача выглядит простой для человека. Для агента она распадается на десяток шагов.

Сначала нужно открыть приложение с билетами. Найти мероприятие. Проверить наличие мест на пятницу. Если мест нет - переключиться на субботу. Затем открыть приложение для бронирования ресторанов. Найти заведения рядом с концертной площадкой. Выбрать подходящее время с учётом окончания концерта. Забронировать. ARE фиксирует всю цепочку. Если агент находит билеты на пятницу, но не проверяет время окончания и бронирует столик на 18:00 при концерте в 20:00 - это ошибка, которую среда зафиксирует. Разработчик увидит, на каком шаге логика агента дала сбой.

Результаты тестирования: кто лидирует и где все спотыкаются

В тестировании Gaia2 участвовали три ведущие модели: GPT-5, Claude 4 Sonnet и Gemini 2.5 Pro. Лучший общий результат показал GPT-5 - он справился с наибольшим числом задач и показал более стабильное поведение при типовых сценариях. Однако разрыв между моделями оказался меньше, чем ожидалось, а главный вывод касается не лидера, а общей слабости всех участников.

Все три модели плохо справляются с задачами, требующими временного планирования и адаптации к изменениям. Когда сценарий идёт по плану, агенты действуют уверенно. Но стоит появиться неожиданному сбою - ошибке приложения, изменению условий, конфликту в расписании - и качество решений резко падает. Агент либо игнорирует проблему, либо зацикливается на повторении неудачного действия.

Почему временное планирование - ахиллесова пята AI

Временное планирование требует от агента понимания последовательности действий и их длительности. Недостаточно знать, что билеты есть. Нужно понять, что концерт заканчивается в 22:00, дорога до ресторана занимает 30 минут, а кухня закрывается в 23:00. Значит, столик нужно бронировать не позже 22:15. Это цепочка рассуждений, которая для человека естественна, а для языковой модели - нет.

Современные модели обучаются на текстах. Они хорошо предсказывают следующее слово, но плохо моделируют течение времени. Когда план ломается - например, приложение сообщает, что выбранный ресторан закрыт, - агенту нужно перестроить цепочку. Пересчитать время. Найти новый вариант. И сделать это быстро. Пока это точка отказа для всех протестированных моделей. Результаты Gaia2 подтверждают: надёжный AI-помощник, способный заменить человека в бытовых цифровых задачах, ещё не создан.

Практическая ценность Gaia2 и ARE для бизнеса и разработки

Gaia2 и ARE решают конкретную проблему: отсутствие объективного способа сравнить AI-агентов перед внедрением. Когда компания выбирает между решениями на базе разных моделей, бенчмарк даёт цифры, а не маркетинговые обещания. Руководитель видит, какая модель справляется с задачами его профиля, где она ошибается и насколько критичны эти ошибки.

Для разработчиков ARE - это инструмент отладки. Можно запустить агента в симулированной среде, воспроизвести ошибку, исправить логику и проверить снова. Без риска реальных последствий: агент не потратит деньги клиента и не забронирует не тот рейс. Открытые лицензии делают технологию доступной для всех - от исследовательских лабораторий до небольших команд. Google уже движется в том же направлении с Android Bench, добавляя краудсорсинг тестов и метрику стоимости использования модели. Gaia2 и ARE дополняют этот тренд, фокусируясь на поведении агента в реальных приложениях.

Что дальше: открытый доступ и будущее тестирования AI-агентов

Проект Gaia2 и ARE опубликован под открытыми лицензиями. Код, сценарии тестирования и документация доступны для изучения и доработки. Сообщество может добавлять новые задачи, расширять покрытие и адаптировать бенчмарк под специфические сценарии - от корпоративных помощников до агентов для умного дома.

Ожидается, что Gaia2 станет стандартом для оценки AI-агентов, а ARE - платформой для экспериментов и сравнения моделей. Это важный шаг к тому, чтобы AI-помощники перешли из разряда «интересных демо» в категорию надёжных инструментов для повседневной работы. Пока главный барьер - временное планирование и адаптация к сбоям. Результаты тестирования чётко указывают, куда двигаться разработчикам. Более половины компаний, внедривших AI-агентов, уже столкнулись с инцидентами безопасности, и качественное тестирование на этапе разработки - прямой путь к снижению этих рисков.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции