Масштабная проверка ICML 2026: что показала крупнейшая попытка воспроизвести исследования
1221 участник, 2226 докладов, 6816 отчётов: итоги беспрецедентного аудита ICML 2026. Какие ошибки найдены, как AI-агенты меняют науку и что это значит для будущего исследований.
1221 участник, 19 дней, 2226 докладов и 6816 отчётов. В августе 2026 года состоялся крупнейший в истории открытый аудит научной конференции по машинному обучению ICML. Сообщество добровольцев с помощью AI-агентов проверило треть всех представленных работ. Результат: 51% исследований получили хотя бы одно независимое подтверждение, 266 работ воспроизведены полностью, но 23% содержали как минимум один опровергнутый или оспоренный тезис.
Это событие даёт прямой ответ на вопрос, который волнует и учёных, и бизнес: можно ли доверять публикациям в области искусственного интеллекта. Короткий ответ: в целом да, но с оговорками. Большинство работ выдержали проверку, однако каждая пятая содержала ошибки, способные исказить выводы. Полные материалы аудита, включая код, трассировки и вердикты, выложены в открытый доступ на Hugging Face.
Беспрецедентный аудит: как 1221 человек проверили треть конференции за 19 дней
ICML (International Conference on Machine Learning) - одна из главных мировых площадок для публикации исследований по машинному обучению. Ежегодно туда поступают тысячи работ. В 2026 году конференция приняла около 6500 докладов. Проверить их все вручную невозможно: на воспроизведение одного эксперимента могут уйти недели. Поэтому сообщество из 1221 участника применило другой подход - автоматизацию через AI-агентов.
За 19 дней участники воспроизвели 2226 докладов, то есть 34% всей конференции. Каждый доклад проходил через цепочку: анализ кода, запуск экспериментов, сравнение метрик с заявленными в статье. Результатом стали 6816 отчётов, в которых зафиксированы подтверждения, опровержения и спорные случаи. Такой охват стал возможен именно благодаря сочетанию человеческой экспертизы и скорости AI-агентов.
Кризис воспроизводимости: почему это важно
Проблема воспроизводимости в науке известна давно. В психологии, биологии и медицине повторные проверки часто не подтверждают исходные результаты. В машинном обучении ситуация усугубляется скоростью публикаций и сложностью вычислительных экспериментов. Код не всегда публикуется, гиперпараметры не всегда описываются, а случайность при обучении моделей может давать разные результаты. Это подрывает доверие к научным выводам.
Аудит ICML 2026 стал попыткой измерить масштаб проблемы на конкретной конференции. Организаторы поставили задачу: проверить не единичные статьи, а значительную долю всех принятых работ. Это позволило получить статистически осмысленную картину, а не разрозненные примеры.
AI-агенты как инструмент масштабирования проверки
AI-агенты взяли на себя рутинные операции: чтение репозиториев, настройку окружения, запуск скриптов, сбор логов. Человек при этом выполнял роль научного руководителя: формулировал гипотезу, выбирал, что именно проверять, интерпретировал результаты и принимал финальное решение о вердикте. Такое разделение труда позволило одному участнику обрабатывать несколько докладов параллельно.
Важный нюанс: агенты не выносили вердикты самостоятельно. Они готовили данные и черновики отчётов, но окончательное решение о подтверждении или опровержении принимал человек. Это принципиально отличает аудит от полностью автономных экспериментов, которые ранее провалились на NeurIPS 2026. Подробнее о том, почему AI-агенты пока не могут вести исследования самостоятельно, мы разбирали в отдельной статье.
Итоги проверки: 51% подтверждений, 23% опровержений и 266 полностью воспроизведённых работ
Цифры дают смешанную картину. С одной стороны, 51% проверенных работ получили хотя бы одно независимое подтверждение. Это значит, что ключевые результаты удалось воспроизвести. 266 докладов воспроизведены полностью: все заявленные эксперименты совпали с полученными. С другой стороны, 23% работ имели хотя бы один опровергнутый или оспоренный тезис. То есть почти каждая четвёртая статья содержала ошибку или несоответствие.
Эти результаты нельзя экстраполировать на всю конференцию напрямую. Аудит охватил 34% докладов, и выборка могла быть смещена: участники могли выбирать работы, которые им интереснее или доступнее для проверки. Тем не менее, масштаб достаточен, чтобы говорить о системных проблемах в качестве публикаций.
Что значит «подтверждение» и «опровержение» в контексте аудита
Подтверждение - это независимое воспроизведение ключевых результатов работы. Проверяющий запускает код автора или пишет свой, повторяет эксперименты и сравнивает метрики. Если они совпадают в пределах допустимой погрешности, работа получает подтверждение.
Опровержение - это обнаружение ошибок или несоответствий. Оно не всегда означает недобросовестность авторов. Часто это технические ошибки: неверная настройка эксперимента, баг в коде, неправильная обработка данных. Важно различать опровержение как факт наличия ошибки и опровержение как доказательство ложности всей работы. Аудит фиксировал оба типа, но в статистике они объединены.
Конкретные находки: ошибки в доказательствах, расхождения кода и завышенные метрики
Аудит выявил три типа проблем, которые встречались чаще всего. Каждая из них по-своему влияет на достоверность исследований.
Ошибка в доказательстве теоремы о робастности
Теорема о робастности касается устойчивости моделей машинного обучения к атакам. Если модель робастна, она сохраняет точность даже при намеренном искажении входных данных. Ошибка в доказательстве означает, что гарантии устойчивости могут быть неверны. Модель, заявленная как защищённая, на практике может оказаться уязвимой. Это подтвердили независимо несколько участников аудита.
Расхождение между теорией и кодом в самодистилляции
Самодистилляция - метод улучшения моделей, при котором модель учится на собственных предсказаниях. В одной из статей описанный алгоритм не соответствовал опубликованному коду. Реализация отличалась от теории в ключевых деталях. Это могло привести к неверным выводам об эффективности метода. Проверяющие зафиксировали расхождение и передали его авторам.
Завышенные метрики из-за EOS-токенов
EOS-токен (end of sequence) - маркер конца последовательности в языковых моделях. В одной из работ его неправильная обработка при оценке качества модели привела к искусственному завышению метрик. Модель выглядела лучше, чем была на самом деле. Это пример тонкой ошибки, которую сложно заметить без тщательной проверки кода и данных.
Ложные опровержения: когда ошибаются сами проверяющие
Аудит не был идеальным. Организаторы выявили случаи ложных опровержений, вызванных ошибками в самих попытках воспроизведения. Неправильная версия библиотеки, неверный порядок запуска скриптов, отличие в аппаратном обеспечении - всё это могло привести к расхождению результатов, которое ошибочно интерпретировалось как ошибка авторов.
Такие случаи были скорректированы после перепроверки. Это подчёркивает сложность задачи: воспроизведение научного результата само по себе является исследованием, которое может содержать ошибки. Поэтому выводы аудита стоит воспринимать как сигналы для дальнейшей проверки, а не как окончательные приговоры.
Реакция авторов: исправления на arXiv и тихие фиксы
Научное сообщество отреагировало на аудит конструктивно. Авторы большинства подтверждённых проблем признали ошибки и начали исправления. Два исправления уже опубликованы на arXiv - открытом репозитории научных статей. Один случай оказался особенно показательным: аудит выявил проблему, которую автор уже исправил за месяц до начала челленджа. Это «тихое исправление» совпало с независимой проверкой.
Такая реакция говорит о культуре открытости в сообществе машинного обучения. Ошибки воспринимаются как часть исследовательского процесса, а их публичное исправление - как норма. Это контрастирует с практиками в некоторых других научных областях, где признание ошибки может навредить репутации.
Главный вывод: AI-агенты не заменяют людей, а меняют их роль
Ключевой инсайт аудита касается не только качества исследований, но и будущего научного процесса. AI-агенты доказали свою полезность в рутинных задачах: они ускорили проверку в десятки раз. Но финальные решения принимали люди. Человек направлял агентов, формулировал гипотезы, интерпретировал результаты и определял, что считать подтверждением, а что - опровержением.
Эта модель похожа на работу главного исследователя в лаборатории. Руководитель не проводит все эксперименты сам, но именно он определяет направление, оценивает значимость результатов и несёт ответственность за выводы. AI-агенты становятся инструментом, который усиливает человеческий интеллект, но не заменяет его. Новые инструменты требуют новых навыков: умения ставить задачи агентам, проверять их работу и критически оценивать полученные данные.
Этот вывод согласуется с результатами других исследований. OpenAI в совместном отчёте показала, что агенты ускоряют научное ПО до 60 раз, но требуют контроля экспертов. Проблема смещается с написания кода на верификацию результатов.
Где найти материалы аудита: открытый доступ на Hugging Face
Все материалы аудита выложены в открытый доступ на Hugging Face. Там можно найти код, трассировки запусков, вердикты по каждой проверенной работе и полные отчёты. Это позволяет любому желающему самостоятельно проверить выводы организаторов или использовать данные для собственных исследований.
Открытость - принципиальная позиция организаторов. Они не просто опубликовали итоговую статистику, но и предоставили все промежуточные данные. Это соответствует духу научной прозрачности и позволяет сообществу перепроверить сам аудит. Если вы хотите глубже погрузиться в тему воспроизводимости, рекомендуем также прочитать наш разбор о том, как люди не отличают тексты ChatGPT от человеческих, и о математических прорывах модели Astra.
Аудит ICML 2026 показал: наука о машинном обучении в целом здорова, но требует постоянной независимой проверки. AI-агенты делают такую проверку возможной в беспрецедентном масштабе. Человек при этом остаётся главным звеном, принимающим решения и несущим ответственность за выводы.