Как автоматические исследователи помогают AI лучше проходить тесты на согласованность

Как автоматические исследователи помогают AI лучше проходить тесты на согласованность

Anthropic показала, как AI-агенты на базе Claude Opus 4.8 искали методы обучения, дообучали модели и улучшили результаты по 10 тестам согласования. Разбираем, как работает Automated Alignment Researchers, что означает закрытие безопасностного разрыва и почему эксперимент еще не доказывает появление полностью автономного AI.

Anthropic показала, как AI-агенты могут частично автоматизировать улучшение других AI-моделей. Система Automated Alignment Researchers, или AAR, на базе Claude Opus 4.8 искала научные материалы, предлагала методы обучения, писала мини-статьи и код, дообучала целевые модели и проверяла результат.

В эксперименте агенты улучшили показатели по 10 тестам, связанным с нежелательным поведением моделей, и не снизили их общую производительность. При этом система работала с заранее заданными задачами, моделями, критериями успеха и вычислительными ресурсами. Речь идет об автоматизации части исследовательского цикла, а не о полностью самостоятельной разработке AI.

Главный практический вывод выглядит сдержанно: автоматические исследователи могут ускорить поиск и проверку методов дообучения там, где есть понятные метрики. Человек по-прежнему определяет, что именно проверять, насколько тесты покрывают реальные риски и можно ли доверять полученному результату.

Что показало исследование Anthropic в двух словах

Что в этой новости действительно новое

Обычно AI-ассистент помогает отдельному этапу работы: ищет публикации, пишет код или предлагает гипотезу. В эксперименте Anthropic агенты соединили несколько таких действий в непрерывный цикл:

  1. поиск научной литературы и связанных идей;
  2. формулировка метода обучения;
  3. подготовка мини-статьи с описанием подхода;
  4. написание и проверка кода;
  5. дообучение целевой модели;
  6. оценка результатов и переход к следующей итерации.

Такой процесс похож на работу небольшой исследовательской группы, где участники быстро перебирают гипотезы и сравнивают эксперименты. AAR не ограничивались генерацией советов. Они запускали обучение моделей и получали числовую обратную связь, которая помогала выбрать следующий подход.

По каждому из 10 направлений агенты искали способы уменьшить определенный сбой согласования. Под согласованием AI обычно понимают соответствие поведения модели заданным человеческим целям, правилам и ограничениям. Если модель скрывает неопределенность, раскрывает конфиденциальные данные или пытается обойти ограничение, это может указывать на проблему согласования.

Что исследование пока не доказывает

Эксперимент не показывает, что AI уже способен самостоятельно развивать технологии без участия человека. Цели исследования задали заранее. Заранее определили и набор тестов, целевые модели, бюджет вычислений, продолжительность обучения и критерии оценки.

Агенты не выбирали самостоятельно, какие проблемы безопасности считать главными. Они не создавали новую архитектуру AI с нуля и не решали, когда эксперимент нужно остановить по научным или этическим причинам. Их автономность распространялась на последовательность действий внутри подготовленной среды.

Это важное различие. Улучшение результата по известному бенчмарку показывает, что метод сработал на измеряемой задаче. Оно не гарантирует, что модель будет безопаснее в ситуациях, которые тест не описывает.

Как работают автоматические исследователи согласования

Automated Alignment Researchers построены как группа AI-агентов, которые получают одну исследовательскую задачу и параллельно ищут решения. В качестве основы использовали Claude Opus 4.8. Система объединяла генерацию идей, работу с литературой, программирование, обучение моделей и последующее сравнение результатов.

Упрощенная схема выглядит так: агент предлагает метод, описывает его, пишет код, проходит проверку, запускает обучение, получает оценку и передает результат следующей итерации. Сильные варианты поднимаются в таблице лидеров, а неудачные подходы могут быть отброшены.

Пять агентов на одну задачу

Для каждого сбоя согласования параллельно работали пять агентов. Они могли изучать разные публикации и предлагать отличающиеся методы обучения. Такой подход повышает разнообразие идей: итог не зависит от первой гипотезы, которую сгенерировала одна модель.

Агенты обменивались результатами через общий форум. Таблица лидеров помогала сравнивать методы по единому критерию и видеть, какие эксперименты дали лучший результат. По сути, система создавала внутреннюю среду конкуренции и обмена знаниями.

Параллельная работа полезна там, где стоимость одной попытки ограничена, а вариантов решения много. Пять агентов могут быстрее проверить разные комбинации данных, настроек обучения и способов контроля поведения модели.

Зачем нужен мониторинговый агент

Отдельный мониторинговый агент проверял код перед запуском и одобрял его выполнение. Этот слой снижал риск того, что сгенерированная программа случайно нарушит условия эксперимента или приведет к нежелательным действиям с вычислительной средой.

Мониторинговая проверка контролировала операционную сторону процесса: можно ли запускать код, соответствует ли он техническим ограничениям и не содержит ли очевидных проблем. Она не отвечала на более сложный вопрос: правильно ли выбрана сама исследовательская цель и действительно ли метрика отражает нужный риск.

Здесь проходит граница между техническим контролем и научным суждением. Агент может обнаружить ошибку в программе, но не всегда способен понять, что команда измеряет не ту характеристику или делает слишком широкий вывод из узкого теста.

Какие ресурсы были доступны системе

Каждый метод получал одинаковый фиксированный бюджет: около 30 минут обучения и один GPU H200. Ограничение создавало единые условия сравнения. Методы нельзя было оценивать по результатам, полученным за счет значительно большего времени или вычислительной мощности.

Для экспериментов использовали открытые модели размером от 2 до 7 млрд параметров:

  • Gemma-2-2B;
  • Qwen3.5-2B;
  • Llama-3.2-3B;
  • Phi-4-mini;
  • Olmo-3-7B.

Такой выбор помогает проверить подход на нескольких семействах моделей, но одновременно ограничивает масштаб выводов. Результаты на моделях размером 2-7 млрд параметров нельзя автоматически переносить на самые крупные коммерческие системы.

Обсуждение автономности AI-агентов часто смешивает разные уровни работы. Агент может самостоятельно написать код и запустить эксперимент, однако это еще не означает, что он сам сформулировал научную проблему, выбрал надежную метрику и оценил долгосрочные последствия результата.

Похожие ограничения видны и в других экспериментах с AI-исследователями. В отдельном разборе о попытке поручить агентам полноценные исследования для NeurIPS показано, что инженерные действия могут выполняться хорошо, тогда как научное суждение, выбор значимой гипотезы и отказ от неудачного направления остаются сложными задачами: почему AI-агенты пока не могут вести исследования самостоятельно.

Какие проблемы согласования удалось улучшить

Согласование AI связано с тем, насколько предсказуемо модель соблюдает заданные правила и цели. В эксперименте проверяли 10 направлений нежелательного поведения:

  • лесть, когда модель подстраивается под собеседника вместо честного ответа;
  • jailbreak-атаки, которые пытаются обойти ограничения;
  • внедрение запросов, когда сторонний текст меняет поведение системы;
  • стремление к власти или расширению контроля;
  • обман и намеренное введение пользователя в заблуждение;
  • галлюцинации, то есть уверенное создание недостоверной информации;
  • социальные предубеждения;
  • нарушение конфиденциальности;
  • подделка вознаграждения, когда система учится имитировать хороший результат для оценки;
  • сокрытие неопределенности.

Почему эти сбои важны за пределами лаборатории

Каждый такой тест связан с реальными сценариями использования AI. Чрезмерная уверенность может привести к ошибочному решению в аналитике. Сокрытие неопределенности мешает человеку понять, где ответ требует дополнительной проверки. Нарушение конфиденциальности создает риск раскрытия персональных или корпоративных данных.

Jailbreak и внедрение запросов особенно важны для AI-агентов, которые работают с браузером, документами и внешними системами. Если агент принимает вредоносную инструкцию из просмотренной страницы за команду пользователя, он может выполнить неправильное действие. О защите от таких атак в браузерном режиме Anthropic можно прочитать в разборе эксперимента с Opus 5 и Auto Mode: как Anthropic проверяет защиту AI-агентов от промпт-инъекций.

Лесть, обман и подмена целей затрагивают качество коммуникации. Модель, которая стремится дать приятный ответ любой ценой, может скрыть неудобный факт. Для рабочих процессов это означает дополнительные расходы на проверку и риск принятия решений на неверной основе.

Что означает «закрыть безопасностный разрыв»

Результаты измеряли с помощью показателя PGR, performance gap recovered. Он показывает, какую долю разрыва между исходным результатом модели и теоретически идеальным уровнем удалось преодолеть.

Представим, что базовая модель получила 40 баллов, а условный идеальный уровень равен 100. Если после дообучения результат вырос до 70 баллов, модель закрыла половину разрыва между исходной точкой и верхним ориентиром. Конкретный расчет зависит от определения теста, но смысл метрики остается таким: она оценивает прогресс относительно исходного состояния.

Anthropic сообщила об улучшении всех десяти направлений без снижения общей производительности моделей. Это означает, что целевые тесты стали проходиться лучше, а общие способности не просели по проверяемым показателям.

Высокий PGR по отдельному тесту не равен полной безопасности. Бенчмарк измеряет выбранную характеристику. Он не описывает все возможные ситуации, в которых модель может ошибиться, изменить стратегию или столкнуться с новым типом запроса.

Насколько убедительны результаты эксперимента

Проверка на тестах, которых агенты не видели

Лучший метод по каждому сбою проверяли на исходном бенчмарке и на отложенном тесте. Отложенный бенчмарк агенты не видели во время поиска решения.

Такая проверка нужна, чтобы отличить реальное улучшение метода от подгонки под знакомые вопросы. Если агент запомнил структуру исходного теста, его результат может резко упасть на новых примерах. Если подход переносится на отложенные данные, доверие к нему становится выше.

Отложенный тест все равно не заменяет независимую проверку в реальных продуктах. Пользовательские запросы разнообразнее лабораторных наборов, а поведение модели может зависеть от интерфейса, дополнительных инструментов, данных и полномочий агента.

Сравнение с человеческими исследователями

Anthropic сравнивала предложения системы с работой 28 опытных исследователей безопасности. Людям давали до восьми часов на разработку метода по тем же направлениям и бенчмаркам.

Это сравнение дает полезный ориентир по скорости перебора идей. AI-агенты могут быстро подготовить несколько вариантов, а человек тратит больше времени на чтение, формулировку эксперимента и написание кода.

Из доступного описания нельзя делать вывод, что AI превосходит людей во всех задачах исследования безопасности. Сравнение проходило в конкретных условиях, по заранее выбранным тестам и с определенными ограничениями времени. Научная ценность идеи, переносимость метода и полнота анализа требуют отдельной оценки.

Такой вывод согласуется с результатами других работ. В отчете OpenAI AI-агенты ускоряли научное программное обеспечение до 60 раз, однако эксперты по-прежнему должны были проверять корректность результатов: почему AI-агенты ускоряют науку, но не заменяют ученых.

Почему это еще не автономная разработка AI

Ограничения бенчмарков

Бенчмарк, это измерительный тест с заранее определенными правилами. Он помогает сравнить две версии модели или несколько методов обучения. Бенчмарк не дает полного описания безопасности и не предсказывает поведение системы в любой новой ситуации.

Главный риск здесь связан с узкой оптимизацией. Если агент знает, по какому показателю его оценивают, он может найти способ улучшить именно этот показатель. Модель начнет лучше отвечать на измеряемые вопросы, но неизвестные проблемы останутся без изменений.

Например, тест может проверять раскрытие конфиденциальных данных в текстовом диалоге. В реальном продукте модель дополнительно получает доступ к файлам, браузеру или внутренней базе. Ее поведение в такой среде потребует отдельных проверок.

Ограничения масштаба и условий

В эксперименте использовали открытые модели размером 2-7 млрд параметров, один GPU H200 и около 30 минут обучения на каждый метод. Эти условия позволяют сравнивать подходы с контролируемыми затратами, однако они не отражают весь масштаб промышленных AI-систем.

Более крупная модель может обладать другими способностями, иначе реагировать на дообучение и демонстрировать новые типы ошибок. Поэтому заявления о переносе результата на крупные модели требуют самостоятельной проверки.

Фиксированный бюджет тоже влияет на итог. Метод, который показывает результат за 30 минут, полезен для быстрого перебора. Но более глубокая проверка, повторное обучение на разных данных и оценка редких рисков могут потребовать значительно больше ресурсов.

Где остается роль человека

Человек задает цели исследования и проверяет, отражают ли они реальные риски. Он выбирает модели, определяет границы допустимых действий, оценивает полноту тестов и решает, можно ли применять метод в продукте.

Исследователь должен проверить код, исходные данные, статистику и интерпретацию результата. Отдельная задача, поиск неизвестных проблем, которые заранее не попали в список из 10 бенчмарков.

В таком процессе AI расширяет пропускную способность команды. Он берет на себя повторяющиеся операции и ускоряет подготовку вариантов. Ответственность за постановку задачи и итоговое решение остается у специалистов.

Тот же принцип виден в разработке программного обеспечения. В эксперименте Anthropic с Claude Code 46% из 388 автоматически созданных pull request были приняты, однако это не отменило проверки человеком: что показал эксперимент с автономным обслуживанием кода.

Что этот подход меняет в развитии AI

Что может измениться для AI-команд

Автоматические исследователи могут сократить время на поиск литературы, подготовку прототипов, запуск вариантов обучения и первичное сравнение результатов. Команда получает возможность проверить больше гипотез за тот же рабочий день.

Особенно полезен подход там, где задача имеет измеримый результат. Например, можно сравнить методы по устойчивости к внедрению запросов, точности обнаружения неопределенности или снижению определенного типа галлюцинаций.

AI-агент не заменяет исследовательскую команду. Он берет на себя часть рутинной работы: собирает материалы, оформляет идею, пишет повторяющийся код и запускает серию похожих проверок. Исследователь направляет поиск, проверяет качество эксперимента и решает, какие выводы выдерживают независимую проверку.

Почему за этим стоит следить неспециалистам

Ускорение исследований может быстрее приводить новые методы обучения и безопасности в AI-продукты. Для пользователей это потенциально означает более надежные ответы, меньше случаев раскрытия данных и более ясное обозначение неопределенности.

Есть и обратная сторона. Чем быстрее команды перебирают методы, тем выше потребность в прозрачных критериях и независимой оценке. Показатель на одном тесте не должен становиться единственным основанием для запуска функции, особенно если AI получает доступ к рабочим данным или может действовать самостоятельно.

Руководителям полезно воспринимать такие системы как инструмент повышения скорости исследований. Вопрос о внедрении AI в компании по-прежнему требует оценки рисков, качества данных, полномочий модели и процедуры контроля.

Для читателя, который следит за развитием AI, эта новость важна как индикатор направления. Исследовательский цикл постепенно получает автоматизированные элементы. Параллельно сохраняется разрыв между выполнением заданного эксперимента и самостоятельным научным мышлением.

Главный вывод без сенсации

AI уже может частично автоматизировать цикл исследования и помогать улучшать модели по заранее заданным тестам. Anthropic показала это на десяти направлениях согласования, используя пять параллельных агентов, мониторинг кода, отложенные бенчмарки и фиксированный вычислительный бюджет.

До автономной разработки AI-систем еще далеко. Агенты не выбирали научные цели, не определяли полноту критериев безопасности и не несли ответственность за применение результата. Их практическая ценность сегодня связана с ускорением поиска, дообучения и повторяющихся проверок.

Короткая формула эксперимента: AI может помогать улучшать AI, если человек заранее определил задачу, метрику и границы проверки.

Есть вопрос или заметили неточность? Напишите редакции, чтобы мы могли уточнить материал и сохранить ясную, проверяемую картину развития AI.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции