Anthropic экспериментирует с автономным обслуживанием кода с помощью ИИ: 46% PR-запросов принято

Anthropic экспериментирует с автономным обслуживанием кода с помощью ИИ: 46% PR-запросов принято

Anthropic провела эксперимент: ИИ-ассистент Claude Code самостоятельно создавал pull request'ы для поддержки кода. 46% из 388 запросов были приняты. Узнайте, какие задачи выполнял ИИ и что это значит для разработчиков.

Anthropic провела внутренний эксперимент: ИИ-ассистент Claude Code несколько недель самостоятельно поддерживал код собственных приложений компании. За это время ИИ создал 388 pull request'ов, то есть запросов на изменение кода. После проверки автоматизированными системами и человеком приняли 180 запросов, это 46%. Инженер Anthropic и создатель Claude Code Борис Черни назвал результаты «удивительно положительными», но подчеркнул, что они предварительные.

Pull request, или PR, это предложение внести изменения в кодовую базу. Разработчик или в данном случае ИИ готовит правки и отправляет их на проверку. Если правки одобряют, их сливают в основной код. В эксперименте Anthropic ИИ сам находил задачи, готовил решения и отправлял их на ревью.

Эксперимент важен не только для самой Anthropic. Он показывает, что рутинную поддержку кода можно частично делегировать ИИ. Разработчики при этом освобождают время для более сложной работы. Разберём, что именно делал Claude Code, как был устроен процесс и какие выводы можно сделать уже сейчас.

Что произошло: эксперимент Anthropic с автономным обслуживанием кода

Anthropic использовала Claude Code для автономной поддержки собственных приложений. Это внутренний эксперимент компании, а не готовый продукт для широкой аудитории. ИИ работал с реальным кодом, который используется внутри Anthropic, и его правки проходили стандартную процедуру проверки.

За несколько недель Claude Code создал 388 pull request'ов. Приняли 180, то есть 46%. Каждый PR проверяли автоматизированные системы и человек. Такой двойной контроль снижает риск попадания ошибок в основную кодовую базу.

Борис Черни, создатель Claude Code, оценил результаты как «удивительно положительные». При этом он отметил, что это «ранние признаки того, что это возможно». Формулировка осторожная: эксперимент показал потенциал, но не дал окончательных доказательств.

Для сравнения: в автоматическом режиме Claude Code разработчики уже получают больше автономности, но здесь речь о другом уровне. ИИ не просто выполняет команды, а сам инициирует изменения в коде.

Какие задачи выполнял ИИ: примеры рутинной работы

Claude Code решал три типа задач. Все они рутинные, но важные для стабильности и чистоты кодовой базы. Обычно такие задачи отнимают у разработчиков часы, которые можно потратить на более сложную работу.

Исправление ошибок, вызывающих падение приложений

ИИ находил и исправлял ошибки, которые приводили к сбоям в работе приложений. Такие баги критичны: они нарушают работу сервисов и ухудшают пользовательский опыт. Автоматическое обнаружение и исправление таких ошибок помогает поддерживать стабильность без постоянного ручного мониторинга.

Удаление неиспользуемого кода

Неиспользуемый код усложняет поддержку. Он увеличивает размер кодовой базы, затрудняет навигацию и повышает риск ошибок при изменениях. Claude Code выявлял фрагменты, которые больше не используются, и удалял их. Это снижает технический долг, то есть накопленные проблемы, которые замедляют разработку.

Объединение дублирующихся реализаций

Дублирование кода ведёт к рассинхронизации: если одна и та же логика реализована в нескольких местах, при обновлении одной версии вторая может остаться старой. Это источник багов. ИИ находил дублирующиеся реализации и предлагал их объединение. Такой рефакторинг упрощает архитектуру и снижает вероятность ошибок.

Эти задачи не требуют глубокого творческого мышления, но требуют внимательности и системности. Именно такие свойства хорошо подходят для автоматизации.

Как это работает: простые инструкции через Slack

Процесс был намеренно простым. Ежедневные задачи запускались через отдельный Slack-канал. ИИ получал простые текстовые инструкции, без сложной инженерии промптов. Достаточно было чётко сформулировать задачу, и Claude Code сам определял, какие изменения нужны.

Отсутствие сложных настроек важно. Это указывает на потенциал масштабирования: если для автономной работы достаточно простых инструкций, порог входа снижается. Компании не нужно нанимать специалистов по промпт-инжинирингу, чтобы делегировать рутину ИИ.

Slack-канал выполнял роль интерфейса для постановки задач и отслеживания результатов. Такой подход знаком командам, которые уже используют мессенджеры для координации. Интеграция ИИ в привычный рабочий процесс снижает барьер для внедрения.

Подход перекликается с тем, как Anthropic развивает мультиагентное код-ревью. В обновлённой системе Code Review несколько AI-агентов независимо ищут и проверяют ошибки. Автономное обслуживание кода дополняет эту логику: ИИ не только проверяет, но и сам предлагает изменения.

Результаты и оценка: «удивительно положительные», но предварительные

Борис Черни сформулировал оценку так: результаты «удивительно положительные», но предварительные. Это честная позиция. 46% принятых PR - хороший показатель для автономной работы, особенно с учётом того, что ИИ сам находил задачи и готовил решения.

Однако цифра требует контекста. Не все PR, которые отклоняют, обязательно плохие. Часть могла быть отклонена из-за несоответствия архитектурным решениям или приоритетам команды. Без деталей проверки сложно оценить качество отклонённых запросов.

Все PR проходили проверку человеком. Это ключевой момент: автономность ИИ не означала отсутствие контроля. Человек оставался барьером перед слиянием изменений в основной код. Такой подход снижает риски, но и ограничивает скорость: проверка человеком остаётся узким местом.

Эксперимент длился несколько недель. Для долгосрочных выводов этого мало. Нужны месяцы, чтобы оценить, как автономное обслуживание влияет на качество кода, стабильность приложений и нагрузку на разработчиков.

Что это значит для разработчиков и индустрии

Если ИИ сможет надёжно выполнять рутинные задачи по поддержке кода, разработчики смогут сосредоточиться на более сложных и творческих задачах. Это не замена программистов, а перераспределение нагрузки. Рутина уходит ИИ, человек занимается архитектурой, проектированием и сложными проблемами.

Эксперимент Anthropic - ранний признак того, что автономное обслуживание кода возможно. До широкого внедрения ещё далеко, но направление обозначено. Компании, которые научатся делегировать рутину ИИ, получат преимущество в скорости разработки.

Однако важно сохранять реализм. ИИ-агенты уже показали, что могут ускорять работу, но требуют контроля. В отчёте OpenAI подчёркивалась та же мысль: агенты ускоряют процессы, но верификация остаётся за человеком. Автономное обслуживание кода не исключение.

Ограничения и следующие шаги

Эксперимент имеет несколько ограничений. Первое: он длился несколько недель. Этого недостаточно, чтобы оценить долгосрочное влияние на качество кода и стабильность приложений. Второе: не раскрыты детали проверки. Непонятно, сколько PR отклонили автоматизированные системы, а сколько - человек, и по каким причинам. Третье: неясно, насколько задачи были репрезентативны. Поддержка внутренних приложений Anthropic может отличаться от поддержки сложных корпоративных систем.

Следующие шаги, вероятно, включают расширение эксперимента. Anthropic может увеличить длительность, разнообразить типы задач и детальнее анализировать причины отклонения PR. Возможно, компания интегрирует подобные возможности в свои продукты, но пока это предположение.

Для читателя, который следит за развитием ИИ, этот эксперимент - сигнал о направлении движения. Автономность ИИ растёт, но контроль человека остаётся обязательным. Баланс между скоростью и безопасностью будет определять, как быстро такие технологии войдут в повседневную практику разработки.

Есть вопрос или заметили неточность? Напишите нам, мы открыты к диалогу.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции