ИИ-агенты в разработке моделей: почему решения всё ещё принимают люди

ИИ-агенты в разработке моделей: почему решения всё ещё принимают люди

Разбор исследования с участием учёных из Фуданьского университета: ИИ-агенты работали в 96,5% задач, но люди приняли 85,5% решений о методах и 93,4% о целях. Что это значит для вашей работы.

ИИ-агенты выполняли работу в 96,5% задач при разработке языковой модели Atria Dawn Preview, но финальные решения оставались за людьми. Исследовательская команда с участием учёных из Фуданьского университета (Китай) изучила более 700 рабочих логов собственного проекта и получила контрастную картину: агенты делают всё больше шагов, а люди выбирают, что и как делать.

Люди приняли 85,5% решений о методах и параметрах и 93,4% решений о целях и объёме работ. Доля ИИ в финальных решениях оставалась в пределах однозначных чисел. За четыре недели медианное соотношение действий агента к действиям человека выросло с 11 до 28,5: описание исследования опубликовало издание The Decoder.

Главный вывод авторов: рост активности агентов не равен росту их автономии. Разберём, что именно стоит за цифрами и почему их легко понять неправильно.

ИИ-агент это программа, которая сама выполняет цепочку шагов для достижения цели: ищет данные, вызывает инструменты, проверяет промежуточный результат. Автономия означает другое: способность принимать решения без человека. Эти понятия часто смешивают, когда читают отчёты о работе ИИ, и в их смешении спрятан главный смысл исследования.

Что произошло: коротко о главном

Команда проекта Atria Dawn Preview проанализировала более 700 рабочих логов: записи о задачах, действиях агентов и решениях участников. Сбор данных занял четыре недели. Этого хватило, чтобы увидеть заметный сдвиг в распределении работы между человеком и агентом.

Три цифры, которые объясняют всё

96,5% задач выполнялись с участием ИИ. Почти каждая рабочая задача так или иначе проходила через агента: он готовил черновики, вызывал инструменты, собирал данные. Без агента осталась малая часть работы.

С 11 до 28,5 выросло медианное соотношение действий агента к действиям человека. Метрика показывает, сколько шагов делает агент на каждое вмешательство человека. Рост означает, что людям всё чаще достаточно одного решения, чтобы запустить длинную цепочку автоматических шагов.

85,5% и 93,4% - доли решений, которые приняли люди. Первая цифра касается методов и параметров, вторая - целей и объёма работ. Агент может предложить вариант, но выбор остаётся за человеком.

Контраст между этими числами и есть суть новости: шагов у агентов становится больше, решений нет.

Почему это не история про «ИИ захватил разработку»

Авторы специально предупреждают: рост активности агентов не равен росту их автономии. Каждое решение человека вело к большему числу шагов агента, но агенты не принимали больше решений сами. Доля ИИ в предложениях составляла от 17 до 55% в зависимости от типа решения, а доля в финальных решениях оставалась в пределах однозначных чисел.

Для читателя это практический сигнал. Когда в отчёте говорят «ИИ выполняет 90% работы», стоит уточнить, что именно считают: количество шагов, объём текста, число задач или долю решений. От этого ответ меняется в разы.

Второй нюанс: активность агента легче измерить, чем автономию. Логи автоматически фиксируют каждый вызов инструмента. Решения человека так не считаются, поэтому в отчётах их часто недооценивают или описывают отдельно, вручную.

Как устроено исследование: 700 логов, 56 участников и модель на 744 млрд параметров

Работа описывает один проект и его внутренние процессы. Это важная рамка: речь о самонаблюдении команды, а не о независимом аудите со стороны. Авторы сами указывают на это ограничение.

Что такое Atria Dawn Preview и зачем она нужна

Atria Dawn Preview - агентная языковая модель на архитектуре mixture-of-experts с 744 млрд параметров. Её создавали для исследовательских и инженерных задач.

Разберём термины. Mixture-of-experts (смесь экспертов) это архитектура, в которой модель состоит из множества блоков-«экспертов», и на каждый запрос включается лишь часть из них. Такой подход снижает вычислительные затраты при большом общем размере модели. 744 млрд параметров это грубая мера сложности: чем больше параметров, тем больше закономерностей модель способна усвоить.

«Агентная» здесь ключевое слово. Такая модель отвечает на вопрос и сразу выполняет последовательность действий: вызывает инструменты, читает файлы, запускает проверки, возвращает готовый результат. Разница примерно как между справочным бюро, где выдают справку, и помощником, который сам сходит за документами.

Как считали: логи, задачи и внешние проверки

Команда разобрала более 700 рабочих логов от 56 участников, а также логи их агентов. Отдельно учитывались завершённые задачи: 455 задач с поддержкой ИИ попали в итоговую выборку.

Модель обучалась через пайплайн, который связывает каждую задачу с реальной средой исполнения. Агент вызывает инструменты, генерирует промежуточные результаты, и всё это проверяется по внешним сигналам: тестам, метрикам, исходным данным. Такой подход снижает риск красивых отчётов, за которыми нет работающего результата.

Отсюда и слово «бенчмарк», которое встретится дальше. Бенчмарк это стандартный набор тестов, по которому сравнивают модели между собой. Он показывает результат на конкретных типах задач и не описывает поведение модели в любой рабочей ситуации.

Четыре недели дают короткий срез. Он показывает направление изменений, но не отвечает на вопрос, сохранится ли тренд на длинной дистанции.

Цифры, которые важно понять правильно

Метрики из исследования описывают разные слои одного процесса, поэтому не противоречат друг другу. Разберём каждую отдельно.

Активность агентов выросла в 2,6 раза - что это значит

Соотношение 28,5 к 11 даёт рост примерно в 2,6 раза за четыре недели. Метрика считает шаги: на каждое действие человека приходится всё больше автоматических операций агента.

Практический смысл простой. Агентам стали доверять больше промежуточной работы: поиск, подготовку черновиков, перебор вариантов, рутинные проверки. Решения остаются у людей: выбор метода, постановка цели, оценка результата.

Сравнение поможет удержать разницу. Представьте ассистента, который делает в 2,6 раза больше черновой работы, чем раньше, но финальную подпись под документом по-прежнему ставите вы. Объём работы вырос, ответственность не переехала.

Почему доля ИИ в предложениях выше, чем в решениях

Доля ИИ в предложениях составляла от 17 до 55% в зависимости от типа решения. Доля в финальных решениях оставалась однозначной: по методам и параметрам ИИ принял 9,2%. Для этой категории самым частым паттерном стал «ИИ предлагает, человек выбирает» - 55,4% случаев.

Разница между «предложить» и «решить» это и есть зона ответственности. Предложение можно отклонить, перепроверить, объединить с другим вариантом. Решение фиксирует, что команда будет делать дальше, и за него отвечает человек. Похожая логика проявляется в научной работе: агенты ускоряют расчёты и код, а проверка корректности результата остаётся за экспертом, о чём говорит отчёт OpenAI.

Где ИИ реально незаменим: треть задач, которые не выполнить без агентов

Из 455 завершённых задач с поддержкой ИИ 151 участники оценили как невыполнимые без агентов. Это около трети. Экономия времени здесь второстепенна: без агентов такая работа не состоялась бы в том же объёме.

Конкретные категории задач в отчёте не расписаны детально, поэтому ограничимся общими типами, где агенты обычно дают наибольший эффект: обработка больших массивов данных, быстрый перебор множества вариантов, автоматизация повторяющихся шагов внутри длинного процесса.

Почему это важно для команд, а не только для отдельных специалистов

Задачи, невыполнимые без ИИ, распределились по 27 из 56 участников. Они не сосредоточились у нескольких активных пользователей. Значит, польза от агентов не привязана к статусу «технаря» или энтузиаста: она разошлась по команде.

Для руководителя это довод в пользу распределённого подхода. Если эффект возникает у половины команды, а не у двух самых увлечённых сотрудников, смотреть стоит на процессы целиком. Практический вопрос звучит так: какие задачи в вашей команде сейчас не делаются вовсе, потому что на них не хватает рук?

Главный риск: человек как формальный рецензент

Авторы предупреждают о риске, который растёт вместе с длиной цепочек агентных действий. Чем больше шагов делает агент, тем сложнее человеку вникнуть в каждый. В какой-то момент проще нажать «одобрить», чем разбираться. Тогда роль человека превращается в формальное согласование, а ответственность становится номинальной.

Сценарий захвата контроля здесь ни при чём. Проблема скромнее и потому опаснее: решения выглядят принятыми, но фактически не проверены. Длинные цепочки плохо поддаются контролю ещё и потому, что у агента нет внутреннего чувства времени и статуса задачи. Он может уверенно назвать срок, не имея таймеров и логов, как показывает разбор длинных агентных задач.

Признаки формального одобрения заметны по поведению: промежуточные результаты не читают, логику не проверяют, решения принимают по принципу «выглядит нормально». Отдельный сигнал, если никто в команде не может объяснить, почему агент выбрал именно этот путь.

Как не превратиться в формального одобряющего

Несколько шагов, которые помогают сохранить реальный контроль:

  1. Заранее определите решения, которые всегда остаются за человеком: цели, объём работ, методы.
  2. Введите точки проверки на длинных цепочках, а не только в конце.
  3. Требуйте от агента объяснения ключевых шагов, а не только итогового файла.
  4. Ограничивайте длину цепочки, которую можно одобрить одним действием.
  5. Разделяйте роли: одна часть команды предлагает варианты, другая оценивает и выбирает.
  6. Раз в месяц пересматривайте, где человек реально влияет на результат, а где просто подписывает.

Паттерн «ИИ предлагает, человек выбирает» из исследования (55,4% случаев для методов и параметров) это здоровая модель, которую стоит сохранять по мере роста агентных цепочек. Дополнительную опору дают базовые правила работы с агентами: логирование, минимальные права доступа, изоляция и мониторинг в реальном времени защищают агентов надёжнее любого разового аудита.

Что это значит для вас: практические выводы

Исследование описывает один проект, поэтому переносить его цифры на любую команду напрямую нельзя. Несколько выводов при этом работают шире.

  1. Рост активности ИИ в отчётах не равен росту автономии. Смотрите на то, кто принимает финальные решения.
  2. Польза от агентов распределяется по команде. Треть задач без них была бы невыполнима, и эти задачи пришлись на 27 из 56 участников.
  3. Главный риск это размывание ответственности, когда одобрение превращается в формальность.
  4. Рабочая модель «ИИ предлагает, человек выбирает» сохраняет и скорость, и контроль.
  5. Следите за тем, как меняется роль человека в процессе, а не только за тем, сколько задач выполняет ИИ.

Чек-лист: как оценить роль ИИ в вашем процессе

  • Кто принимает финальное решение: человек или агент? Если ответ размытый, границы стоит прописать явно.
  • Есть ли точки проверки внутри длинных цепочек? Контроль только в конце повышает риск формального одобрения.
  • Понимает ли команда, что делает агент? Если виден только результат, объяснимость шагов теряется.
  • Распределена ли польза по команде? Если агентами пользуются два человека из двадцати, вопрос не в инструменте, а в доступе и обучении.
  • Может ли кто-то объяснить ключевые решения агента? Если нет, ответственность фактически ни за кем не закреплена.

Что дальше: за чем следить

Atria Dawn Preview лидирует в пяти из 16 бенчмарков, включая веб-поиск и кибербезопасность, но общего превосходства над конкурентами не имеет. Модель впереди в AutomationBench, CyberGym и MLE-Bench Lite, отстаёт в GDPval и SWE-Bench Pro: сравнение приводит The Decoder. Сильная модель остаётся сильной не везде, и высокий результат в тестах не гарантирует успеха в реальной работе, о чём предупреждали и разработчики MiniMax M2.

Дальше стоит следить за тремя вещами: как меняется доля финальных решений, которые принимает ИИ; появляются ли рабочие механизмы контроля длинных агентных цепочек; как распределяется польза от агентов внутри команд. Именно эти показатели, а не количество шагов, покажут, меняется ли роль человека в разработке.

Есть вопрос или заметили неточность? Напишите нам, разберём вместе.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции