Почему AI-агенты пока не могут вести исследования самостоятельно: разбор эксперимента с NeurIPS 2026

Почему AI-агенты пока не могут вести исследования самостоятельно: разбор эксперимента с NeurIPS 2026

Принстон и Институт безопасности ИИ дали Claude Opus 4.8 и GPT-5.6 Sol шесть дней, $3,000 и GPU для самостоятельного исследования. Все статьи получили Reject и Strong Reject. Узнайте, какие три навыка не хватает ИИ для настоящей науки.

Принстонский университет и Институт безопасности ИИ Великобритании дали двум современным языковым моделям, Claude Opus 4.8 и GPT-5.6 Sol, шесть дней, бюджет в $3,000 и доступ к GPU. Задача была предельно конкретной: провести полноценное научное исследование в области ИИ без участия человека. Результат оказался жёстким. Финальные статьи, оцененные авторами неопубликованных работ NeurIPS 2026, получили оценки «Reject» и «Strong Reject». Это значит, что до самостоятельной науки ИИ пока не дотягивает.

Провал не в технике. Агенты отлично искали литературу, отлаживали код и запускали эксперименты. Сломались они на том, что отличает учёного от исполнителя: научное суждение, творческий подход и умение вовремя остановиться. Разбираем, что именно пошло не так и почему результаты противоречат заявлениям Anthropic и OpenAI о прогрессе в автономных исследованиях.

Что произошло: эксперимент, который проверил ИИ на способность к науке

Исследователи поставили агентов в условия, приближенные к реальной работе небольшой научной группы. Модели могли самостоятельно планировать шаги, искать и читать статьи, писать код, запускать вычисления на GPU и анализировать полученные данные. Никто не вмешивался в процесс. Через шесть дней агенты должны были представить готовую научную статью, которую можно отправить на конференцию уровня NeurIPS.

Оценку проводили не случайные рецензенты, а авторы неопубликованных работ NeurIPS 2026. Они знали контекст своих исследований и могли точно определить, привносит ли работа агентов что-то новое или просто повторяет уже известные подходы. Все представленные статьи отклонили.

Условия эксперимента: шесть дней, $3,000 и доступ к GPU

Бюджет в $3,000 и шесть дней, это реалистичные рамки для небольшого исследовательского проекта. Агенты получили доступ к вычислительным мощностям, необходимым для обучения и тестирования моделей. Они могли тратить ресурсы на запуск экспериментов, проверку гипотез и доработку кода. Ограничений по количеству попыток не было.

Такой дизайн исключает простое объяснение провала: агентам не хватило времени или денег. Ресурсы были. Не хватило другого.

Кто оценивал работы: авторы неопубликованных статей NeurIPS 2026

Выбор оценщиков принципиален. Авторы неопубликованных работ находятся в уникальной позиции: они знают передний край своей области и могут отличить тривиальное повторение от настоящего вклада. Если бы статьи оценивали по формальным критериям, агенты могли бы пройти. Но научная ценность, это не только правильный код и аккуратные графики. Это ещё и новизна, значимость, умение задать правильный вопрос.

Оценки «Reject» и «Strong Reject» означают, что работы агентов не дотянули даже до уровня слабой заявки на конференцию. Это не пограничный случай, а явный разрыв.

Главные провалы: чего не хватило AI-агентам

Исследователи выделили три ключевых провала. Каждый из них указывает на фундаментальное ограничение современных моделей, которое не решается простым увеличением вычислительных мощностей.

Научное суждение: почему ИИ не видит разницы между важным и неважным

Агенты не смогли отличить значимый результат от незначимого. Они одинаково серьёзно относились к тривиальным находкам и к потенциально интересным наблюдениям. В науке это критично. Учёный тратит годы на развитие интуиции, которая позволяет почувствовать: вот здесь что-то есть, а вот это тупик. У модели такой интуиции нет.

В результате агенты строили выводы на слабых сигналах и упускали сильные. Статьи получались технически корректными, но научно пустыми. Рецензенты это сразу видели.

Творческий подход: застревание на старых гипотезах

Агенты использовали уже известные подходы и не предлагали оригинальных гипотез. Они действовали в рамках того, что уже встречалось в обучающих данных. Когда требовалось выйти за эти рамки, модели буквально застревали. Они перебирали варианты, которые уже были опробованы, и не могли придумать новый угол атаки на проблему.

Научный прорыв часто случается, когда кто-то задаёт вопрос, который никто раньше не задавал. Современные языковые модели хорошо комбинируют известное, но плохо генерируют принципиально новое. Это ограничение напрямую связано с их архитектурой: они предсказывают следующее слово на основе предыдущих, а не строят новые концептуальные связи.

Упорство во вред: неумение отказаться от неудачного направления

Агенты продолжали разрабатывать тупиковые идеи, тратя ресурсы, вместо того чтобы переключиться на более перспективные. Они не обладали метакогнитивными навыками, способностью посмотреть на свою работу со стороны и сказать: «Это не работает, нужно менять стратегию».

Человек-исследователь делает это постоянно. Неудачный эксперимент, это сигнал, а не повод продолжать в том же духе. Агенты воспринимали неудачу как шум и продолжали двигаться в выбранном направлении. К концу шестого дня они всё ещё разрабатывали гипотезы, которые следовало отбросить в первый день.

Похожие проблемы с автономностью ИИ уже фиксировались ранее. Например, отчёт OpenAI показал, что агенты ускоряют научное ПО до 60 раз, но не могут оценить корректность своей работы без контроля эксперта.

Что ИИ уже умеет: инженерная часть без ошибок

Инженерная часть эксперимента прошла без сбоев. Агенты успешно искали литературу, отлаживали код и запускали эксперименты. Это важный результат. Он показывает, что ИИ уже сейчас может быть полезным инструментом для рутинных задач в науке.

Поиск литературы, это часы работы, которые модель выполняет за минуты. Отладка кода, это методичный процесс, в котором модели сильны. Запуск экспериментов на GPU и сбор результатов тоже хорошо автоматизируются. Учёный, который делегирует эти задачи ИИ, освобождает время для творческой работы: формулирования гипотез, интерпретации результатов, поиска новых направлений.

Практический вывод: ИИ в науке сейчас, это ассистент, а не замена. Он берёт на себя исполнительскую часть, оставляя человеку то, что требует суждения и интуиции. Массштабное тестирование моделей подтверждает: на сложных задачах лучший результат у GPT-5.5 составил лишь 24%, а на самых трудных все модели показали ноль.

Противоречие с заявлениями Anthropic и OpenAI

Anthropic и OpenAI регулярно заявляют о прогрессе в автономных исследованиях. Эксперимент Принстона и Института безопасности ИИ Великобритании даёт независимую проверку этих заявлений. Результат не совпадает с маркетинговой картиной.

Компании демонстрируют впечатляющие примеры: модель решает математическую задачу, находит ошибку в доказательстве, предлагает новый алгоритм. Но эти примеры вырваны из контекста. Они показывают, что ИИ может выполнить отдельный шаг исследования, а не провести исследование целиком. Разница принципиальна.

Независимые проверки важны, потому что у компаний есть стимул преувеличивать возможности своих продуктов. Это не значит, что Anthropic и OpenAI сознательно вводят в заблуждение. Но их внутренние тесты могут быть настроены на демонстрацию сильных сторон моделей, а не на выявление слабых. Внешний эксперимент с жёсткими условиями и независимыми оценщиками даёт более объективную картину.

Стоит вспомнить и другие инциденты. OpenAI заявляла о десяти математических прорывах модели Astra, но даже эти результаты требовали тщательной проверки учёными. Автономность в узкой задаче не равна автономности в полноценном исследовании.

Что это значит для будущего ИИ и науки

Для достижения автономных исследований необходимо развивать у ИИ три способности: научное суждение, творческий подход и стратегическое планирование. Пока ни одна из них не реализована на достаточном уровне. Увеличение размера моделей и объёма данных не решает проблему автоматически. Нужны новые архитектуры и методы обучения, которые позволят моделям оценивать значимость своих результатов, генерировать оригинальные гипотезы и вовремя менять стратегию.

Для бизнеса и науки практический вывод прост: ИИ сейчас, это инструмент, а не самостоятельный исследователь. Он хорошо справляется с рутинными задачами и плохо с теми, что требуют суждения. Планируя использование ИИ в исследовательских проектах, закладывайте человеческий контроль на ключевых этапах: постановка задачи, интерпретация результатов, решение о продолжении или остановке направления.

Эксперимент с NeurIPS 2026 важен не тем, что показал слабость ИИ. Он важен тем, что дал чёткую карту того, чего не хватает. Это не тупик, а список задач для следующих лет. Пока эти задачи не решены, роль человека в науке остаётся центральной.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции