ИИ-агенты ускоряют науку, но не заменяют ученых: главные выводы отчета OpenAI

ИИ-агенты ускоряют науку, но не заменяют ученых: главные выводы отчета OpenAI

Совместный отчет OpenAI показал: ИИ-агенты ускоряют научное ПО до 60 раз, но требуют контроля экспертов. Почему верификация стала ключевой проблемой — читайте в разборе.

ИИ-агенты для программирования ускоряют научное программное обеспечение до 60 раз. Это главный количественный результат нового совместного отчета OpenAI и академических партнеров. Но есть и второй, более важный вывод: агенты не способны оценить научную корректность своей работы. Они выдают «уверенно неверные» результаты - код работает, а выводы ошибочны. Проверка по-прежнему требует человека.

Отчет построен на восьми кейсах, преимущественно из биологии. Исследователи модернизировали устаревшее научное ПО с помощью ИИ-инструментов и зафиксировали как прорывное ускорение, так и системные ограничения. Разберем ключевые выводы по порядку.

Как ИИ-агенты ускоряют научное программное обеспечение: цифры и механизмы

ИИ-агенты для программирования - это инструменты, которые пишут и переписывают код по текстовому описанию задачи. Ученый формулирует, что нужно сделать, а агент генерирует решение. В отличие от классических чат-ботов, такие системы способны работать с целыми файловыми структурами, запускать код и анализировать ошибки.

Отчет OpenAI зафиксировал ускорение научного ПО до 60 раз. Это не абстрактная оценка, а результат прямых замеров на реальных задачах. Старый код, написанный годы назад для специфических научных вычислений, переписывался агентом под современные архитектуры и библиотеки. Там, где раньше требовались недели ручной работы, агент справлялся за часы.

Механизм ускорения понятен. Научный код часто пишут не профессиональные программисты, а исследователи, для которых программирование - побочный навык. Код накапливает технический долг, работает медленно и с трудом поддается модернизации. Агент берет на себя рутинную часть: перевод на другой язык, оптимизацию алгоритмов, распараллеливание вычислений. Это освобождает время ученого для содержательной работы.

Ранее мы рассказывали, как креативная команда OpenAI применяет Codex для разработки кастомных инструментов, ускоряя генерацию идей и прототипирование. Принцип схож: рутина уходит агенту, человек фокусируется на творческой задаче.

Примеры из биологии: как модернизация кода ускоряет исследования

Большинство кейсов в отчете взяты из биологии - дисциплины, где вычислительные методы критически важны. Обработка геномных данных, моделирование белковых структур, анализ микроскопических изображений - все это требует интенсивных вычислений.

Один из примеров: программа для анализа последовательностей ДНК, написанная десять лет назад на устаревшем языке. Исследователи тратили дни на обработку одного набора данных. Агент переписал код на современный язык с оптимизацией под параллельные вычисления. Время обработки сократилось с нескольких суток до пары часов. Ускорение - примерно в 30 раз.

Другой кейс - инструмент для моделирования взаимодействия белков. Код десятилетиями дописывался разными людьми, стал запутанным и неподдерживаемым. Агент не просто переписал его, но и предложил архитектурные улучшения, которые исходные авторы не рассматривали из-за нехватки времени. Результат - ускорение в 60 раз и код, который легче сопровождать.

Важный нюанс: во всех случаях агент работал под контролем человека. Ученый ставил задачу, проверял промежуточные результаты и принимал окончательное решение. Полная автономия не применялась.

Почему ИИ-агенты не заменяют ученых: проблема «уверенно неверных» результатов

Главный вывод отчета формулируется жестко: агенты не способны самостоятельно оценить научную корректность своей работы. Они производят «уверенно неверные» результаты - код компилируется, запускается, выдает числа, но числа эти не имеют отношения к реальности.

Почему это происходит? Научное программирование отличается от обычного. Мало написать синтаксически правильный и быстрый код. Нужно, чтобы алгоритм правильно отражал физический, химический или биологический процесс. Агент не понимает науку. Он видит паттерны в коде и данных, но не может отличить физически осмысленный результат от бессмыслицы.

Пример из отчета: агент переписал программу для расчета термодинамических свойств молекул. Код работал быстро и без ошибок. Но результаты для некоторых соединений расходились с экспериментальными данными на порядки. Агент не заметил, что при оптимизации потерял важный поправочный коэффициент. Для него это была просто строка кода, не имеющая физического смысла.

Проблема усугубляется тем, что ошибки выглядят правдоподобно. Выводы подаются с той же уверенностью, что и корректные. Без экспертной проверки их легко принять за истину. Это смещает фокус работы: раньше главной задачей было написание кода, теперь - его верификация и валидация.

Это перекликается с проблемой, которую мы разбирали в статье про Science One Framework от Google - систему, которая учится не выдумывать факты в научных исследованиях. Борьба с «галлюцинациями» ИИ становится сквозной темой для всей индустрии.

Новая реальность: от написания кода к верификации и валидации

Отчет фиксирует сдвиг в распределении ресурсов научных команд. Когда написание кода становится дешевым и быстрым, узким горлышком оказывается проверка. Валидация результатов требует глубокого понимания предметной области. Ее нельзя автоматизировать теми же агентами, потому что они и есть источник потенциальных ошибок.

Это меняет экономику научных проектов. Раньше бюджет и время уходили преимущественно на разработку. Теперь центр тяжести смещается на верификацию. Командам нужны не столько программисты, сколько эксперты, способные быстро и точно оценивать корректность результатов. Парадокс: ИИ ускоряет вычисления, но может замедлить получение достоверного научного знания, если процессы проверки не поспевают.

На практике это означает рост требований к документированию. Каждое изменение, внесенное агентом, должно быть зафиксировано и объяснено. Почему выбрана эта оптимизация? Какие допущения сделаны? Без такой фиксации проверка превращается в расследование.

Долгосрочные риски: обслуживание кода и нагрузка на команды

Дешевые переписывания кода создают новую проблему - технический долг иного рода. Агент генерирует код, который работает здесь и сейчас. Но будет ли он поддерживаться через год? Поймет ли новый член команды логику, заложенную агентом?

Отчет подчеркивает: каждое автоматическое переписывание увеличивает нагрузку на сопровождающих проекты. Код становится «чужим» даже для тех, кто ставил задачу. Агент может выбрать нестандартную структуру или редко используемую библиотеку. Формально все корректно, но для долгосрочного сопровождения это создает риски.

Ограниченные ресурсы команд - еще один фактор. Научные группы редко располагают выделенными инженерами по сопровождению. Обычно это те же исследователи, которые вынуждены разбираться в чужом автоматически сгенерированном коде. Парадоксально, но ускорение разработки может привести к замедлению науки в долгосрочной перспективе, если не выстроить процессы управления качеством.

Опыт OpenAI с долгоживущими ИИ-моделями подтверждает этот тезис. В отдельном отчете компания описала, как автономные модели накапливают ошибки и отклоняются от инструкций со временем. Без мониторинга в реальном времени и поэтапных проверок риски растут экспоненциально.

Что это значит для вас: практические выводы из отчета OpenAI

Отчет OpenAI дает четкую картину текущего момента. ИИ-агенты - мощный ускоритель для научного программирования, но не замена эксперту. Сформулируем ключевые выводы для тех, кто принимает решения о внедрении таких инструментов.

Первый вывод: ИИ-агенты радикально ускоряют рутинные задачи кодинга. Ускорение до 60 раз - не маркетинговая цифра, а зафиксированный результат на реальных научных проектах. Если ваша команда тратит много времени на переписывание и оптимизацию устаревшего кода, агенты могут высвободить значительные ресурсы. Но только при условии, что высвобожденное время пойдет на верификацию, а не на бездумное принятие результатов.

Второй вывод: инвестируйте в процессы проверки. Главный риск - «уверенно неверные» результаты, которые выглядят корректно. Без экспертной валидации использование агентов может принести больше вреда, чем пользы. Процессы верификации должны быть встроены в рабочий цикл с самого начала, а не добавлены постфактум.

Третий вывод: учитывайте долгосрочные затраты на обслуживание. Код, сгенерированный агентом, требует документирования и ревью. Нагрузка на сопровождающих проекты растет. Планируйте ресурсы с учетом этого фактора. Дешевое переписывание сегодня может обернуться дорогим сопровождением завтра.

Четвертый вывод: человеческий контроль остается критичным. Агенты не понимают науку. Они манипулируют символами и паттернами, но не могут отличить физически осмысленный результат от бессмыслицы. Эксперт в предметной области - обязательное звено в цепочке. Без него ускорение вычислений не приводит к ускорению научных открытий.

Рынок ИИ-агентов для разработки развивается стремительно. Anthropic со своим Claude Code и OpenAI с Codex конкурируют за внимание разработчиков. Недавно мы разбирали, как две настройки API помогли GPT-5.6 втрое улучшить результат на сложном бенчмарке без изменения кода модели. Инструменты становятся доступнее и мощнее. Но отчет OpenAI напоминает: мощность без контроля - это риск, а не преимущество.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции