Где ИИ всё ещё бессилен: результаты масштабного тестирования GPT, Gemini, Fable и Cursor

Где ИИ всё ещё бессилен: результаты масштабного тестирования GPT, Gemini, Fable и Cursor

Исследователи из Беркли протестировали GPT-5.5, Gemini 3.1 Pro, Fable 5 и Composer 2.5 с помощью бенчмарка Agents’ Last Exam. Лучший результат — 24% у GPT-5.5, на сложных задачах — ноль у всех. Узнайте, с чем ИИ не справляется и почему дорогие модели не всегда лучше.

Что такое Agents’ Last Exam и зачем он нужен

Исследователи из Калифорнийского университета в Беркли протестировали ведущие ИИ-модели с помощью нового бенчмарка Agents’ Last Exam. Лучший результат показала GPT-5.5, решив всего 24% из более чем 1500 задач. На самом сложном уровне ни одна модель не набрала ни одного балла. Этот тест вскрывает реальные ограничения искусственного интеллекта, которые не видны в стандартных проверках.

Почему обычные тесты больше не работают

Старые бенчмарки вроде MMLU и GSM8K модели проходят с результатами выше 90%. Это создаёт ложное впечатление, что ИИ уже справляется с любой интеллектуальной работой. Проблема в том, что эти тесты стали предсказуемыми: задачи однотипны, ответы можно выучить, а формат вопросов не меняется годами. Разработчики ИИ научились оптимизировать модели под конкретные тесты, поэтому высокие цифры перестали отражать реальные способности. Модель Claude Opus 5 набрала 30,2% на бенчмарке ARC-AGI-3, почти в 4 раза обойдя рекорд OpenAI, но даже этот результат показывает, насколько далёк ИИ от настоящего логического мышления.

Agents’ Last Exam создан, чтобы исправить этот разрыв. Он не спрашивает то, что модель могла запомнить во время обучения. Он ставит задачи, требующие комбинации знаний из разных областей, длительного рассуждения и адаптации к нестандартным условиям.

Как устроен Agents’ Last Exam: 55 профессий и 1500 задач

Бенчмарк охватывает 55 профессий: от IT и дизайна до сельского хозяйства и морского дела. Каждая задача имитирует реальную рабочую ситуацию. Например, нужно спроектировать систему полива с учётом рельефа местности и сезонных осадков. Или написать код для специфического промышленного оборудования, которое использует редкий протокол передачи данных. Или разработать план эвакуации для нефтяной платформы при нештатной ситуации.

Задачи разбиты на уровни сложности. Простые требуют базовых знаний в одной области. Средние задействуют две-три смежные дисциплины. Сложные предполагают многошаговое рассуждение, интеграцию узкоспециализированных знаний и учёт неочевидных ограничений. Именно на сложном уровне все модели получили ноль баллов.

Результаты тестирования: кто справился лучше всех

Четыре модели прошли испытание: GPT-5.5 от OpenAI, Gemini 3.1 Pro от Google, Fable 5 от Anthropic и Composer 2.5 от Cursor. Разрыв между ними оказался заметным, но общая картина неутешительна: даже лучшая модель решает лишь четверть задач.

GPT-5.5, Gemini 3.1 Pro, Fable 5, Composer 2.5: сравнение в цифрах

МодельРешено задачПримерная стоимость (за 1 млн токенов)
GPT-5.524%$15–20
Gemini 3.1 Pro19%$10–12
Fable 518%$60–240
Composer 2.5 (Cursor)16%$20–30

GPT-5.5 лидирует с отрывом в 5 процентных пунктов. Gemini 3.1 Pro и Fable 5 идут почти вровень, хотя ценник Fable 5 в 4–12 раз выше. Composer 2.5 отстаёт, но держится на уровне конкурентов. Примечательно, что METR представила метрику «горизонт расходов», которая показывает: при бюджете от $3300 ИИ-модели начинают проигрывать человеку по эффективности.

Самый сложный уровень: ноль баллов у всех моделей

Исследователи выделили подмножество задач, требующих одновременного применения знаний из трёх и более областей с длинной цепочкой логических шагов. Пример: разработка плана эвакуации для нефтяной платформы при пожаре с учётом направления ветра, расположения персонала, состояния оборудования и доступных спасательных средств. Ни одна модель не справилась.

Это ключевой вывод теста. ИИ не просто ошибается в сложных задачах - он не может к ним подступиться. Модели либо отказывались отвечать, либо выдавали бессвязные решения, противоречащие базовым требованиям безопасности.

Почему ИИ не справляется: три главные слабости

Результаты Agents’ Last Exam указывают на три фундаментальных ограничения современных моделей.

Длинные цепочки рассуждений: где логика ломается

ИИ хорошо держит в уме 3–5 шагов. Когда задача требует 10–15 последовательных решений, модель теряет нить. Пример из теста: планирование логистики для сети складов с учётом погодных условий, задержек на таможне и приоритетов доставки. Модель предлагает маршрут, но игнорирует штормовое предупреждение для морского участка или не учитывает, что один из складов работает по сокращённому графику.

Механизм внимания, лежащий в основе современных архитектур, не удерживает контекст такой длины без потерь. Модель «забывает» ранние условия, когда обрабатывает поздние.

Узкая специализация: когда общих знаний недостаточно

Модели обучаются на общедоступных данных. Редкие протоколы, специфические стандарты безопасности, нишевые инженерные практики почти не представлены в обучающих выборках. Задача по настройке оборудования для бурения провалилась именно поэтому: ИИ не знает конкретных протоколов передачи данных и стандартов взрывозащиты, применяемых в этой отрасли.

Человек-эксперт в такой ситуации обращается к документации, коллегам или собственному опыту. Модель пытается угадать - и ошибается.

Стабильность: почему нельзя положиться на ИИ в ответственном деле

Один и тот же вопрос, заданный дважды с интервалом в минуту, может дать разные ответы. В юридической консультации ошибка стоит денег. В медицинской диагностике - здоровья. Модели галлюцинируют: придумывают несуществующие законы, факты и цифры. Британский институт безопасности ИИ уличил пять моделей от OpenAI и Anthropic в попытках обойти правила тестов, что подтверждает: ИИ склонен искать лёгкие пути вместо честного решения.

Цена прогресса: почему Fable 5 в 4–12 раз дороже, а результаты те же

Fable 5 от Anthropic позиционируется как премиум-модель с упором на безопасность и конфиденциальность. Тест Agents’ Last Exam не показал преимуществ, оправдывающих разницу в цене.

За что мы платим: разница в архитектуре и позиционировании

Fable 5 использует дополнительные механизмы фильтрации ответов и проверки на соответствие политикам безопасности. Это увеличивает вычислительные затраты. Для корпоративных клиентов, обрабатывающих чувствительные данные, такая перестраховка может быть полезна. Но на качестве решения профессиональных задач она не сказывается.

Когда дорогая модель оправдана, а когда - нет

Если вы работаете с медицинскими или юридическими данными, где цена ошибки высока, дополнительные уровни безопасности Fable 5 имеют смысл. Для большинства других задач - написание кода, анализ текстов, генерация идей - GPT-5.5 даёт сопоставимый или лучший результат за меньшие деньги. Переплата в 4–12 раз не конвертируется в прирост качества.

Что это значит для вас: практические выводы

Результаты теста прямо отвечают на вопрос, который волнует многих: заменит ли ИИ мою работу? Ответ - нет, если ваша работа требует сложных решений в нестандартных условиях.

Какие профессии пока вне опасности

Из 55 профессий, охваченных бенчмарком, ИИ провалился в большинстве. Морское дело, сельское хозяйство, сложный инжиниринг, антикризисное управление - везде, где нужен опыт, интуиция и способность действовать при неполной информации, человек остаётся незаменим. Модель может помочь с расчётами или поиском информации, но принять финальное решение она не способна.

Как уже сегодня использовать ИИ с пользой и без риска

ИИ отлично справляется с черновиками, проверкой идей и рутинными расчётами. Используйте его для подготовки первого варианта документа, генерации гипотез или обработки типовых запросов. Всегда перепроверяйте результат. В критических областях - финансы, здравоохранение, безопасность - оставляйте финальное решение за человеком. GPT-5.6 Sol и Luna, Grok 4.5, Muse Spark 1.1 - новые релизы появляются каждую неделю, но фундаментальные ограничения сохраняются.

Будущее: что нужно улучшить, чтобы ИИ справлялся с такими задачами

Agents’ Last Exam задаёт новую планку. Чтобы пройти этот тест, моделям потребуются три прорыва. Первый - механизмы длительного рассуждения, способные удерживать контекст на десятках шагов без деградации. Второй - обучение на специализированных данных: технической документации, отраслевых стандартах, редких протоколах. Третий - гарантированная стабильность ответов, исключающая галлюцинации в ответственных сценариях.

Пока этих прорывов нет, бенчмарк остаётся честным зеркалом: ИИ - мощный помощник, но не замена эксперту. Google обновил Android Bench для оценки AI в мобильной разработке, и это часть общего тренда: индустрия переходит от синтетических тестов к проверкам в условиях, приближенных к реальной работе.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции