Сотрудник Anthropic ушёл с предупреждением о «самоулучшающемся сверхинтеллекте»: что это значит и почему это совпало с подготовкой к IPO

Сотрудник Anthropic ушёл с предупреждением о «самоулучшающемся сверхинтеллекте»: что это значит и почему это совпало с подготовкой к IPO

27-летний исследователь Джейкоб Коксон ушёл из Anthropic и заявил, что компания вместе с OpenAI несётся к самоулучшающемуся сверхинтеллекту. Разбираем, почему его поддержал руководитель alignment Эван Хубингер, что такое alignment и сверхинтеллект и как заявление совпало с подготовкой Anthropic к IPO.

Что произошло: сотрудник Anthropic ушёл с предупреждением о сверхинтеллекте

27-летний AI-исследователь Джейкоб Коксон объявил об уходе из Anthropic и опубликовал в X пост, который набрал более 100 млн просмотров менее чем за 24 часа. Главная фраза сообщения: «Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives». Ни одна из двух компаний не ведёт себя ответственно, обе несутся прямо к самоулучшающемуся сверхинтеллекту и играют с нашими жизнями.

Две компании в этом заявлении: Anthropic, где Коксон работал до ухода, и OpenAI, его предыдущий работодатель. Свою работу он описал так: «I spent the last three years doing pretraining research at both OpenAI and Anthropic», то есть последние три года занимался pretraining-исследованиями в обеих лабораториях.

Pretraining, или предварительное обучение, - этап, на котором модель учат на очень больших объёмах текстов, кода и изображений. Здесь закладываются базовые способности: понимание языка, умение рассуждать, писать код. Поведением и безопасностью модели занимаются позже и отдельно. Разделение важно для понимания спора, который развернулся после поста.

Реакция пришла не от стороннего критика, а изнутри компании. Эван Хубингер, руководитель направления alignment science в Anthropic, публично ответил: «Jacob is correct here». И добавил: сотрудники компании «really do earnestly believe AI could kill all humans», всерьёз верят, что AI способен уничтожить человечество.

Хронология короткая. Об уходе Коксон объявил на этой неделе, тогда же появился пост в X, ответы коллег и первые публикации в медиа. За сутки история вышла далеко за пределы профессионального сообщества: разговор об alignment и сверхинтеллекте стал мировой новостью, а не внутренней дискуссией лаборатории.

Кто такой Джейкоб Коксон и что именно он сказал

Коксону 27 лет. В Anthropic он числился старшим исследователем и присоединился к компании в мае этого года, о чём написал в X Итан Перес, руководитель alignment-команды Anthropic. До этого Коксон работал в OpenAI. По словам Переса, OpenAI пыталась рекрутировать его около двух лет.

Основные тезисы поста:

  • «I resigned from Anthropic today», сегодня я уволился из Anthropic.
  • «Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives», ни одна из компаний не действует ответственно, они несутся к самоулучшающемуся сверхинтеллекту и рискуют нашими жизнями.
  • «The people building AI earnestly believe that it could kill us all by the end of the decade. This is not a marketing stunt», люди, создающие AI, искренне верят, что к концу десятилетия технология может убить всех нас, и это не маркетинговый ход.

Границы заявления важны: это личные оценки исследователя, а не проверенный прогноз и не официальная позиция Anthropic или OpenAI.

Почему пост вызвал такой резонанс

Причин четыре. Первая: публичное обвинение двух лабораторий, которые задают тон в отрасли. Вторая: поддержка со стороны действующего руководителя alignment в Anthropic, и это уже не мнение стороннего наблюдателя. Третья: совпадение по времени с сообщениями о подготовке Anthropic к IPO. Четвёртая: охват, более 100 млн просмотров меньше чем за сутки.

Илон Маск отреагировал коротко и скептически: по его словам, «the groundwork for this psy op (for lack of a better term) has been prepared for a long time», почва для такой «пси-операции» готовилась давно.

Другая часть реакции прямо противоположна. Часть исследователей в Anthropic и OpenAI назвали опасения Коксона о том, что AI может уничтожить человечество, обоснованными.

Почему поддержка руководителя alignment в Anthropic меняет картину

Публичные предупреждения о рисках AI звучат не первый год, к ним привыкли. Вес этой истории в источнике: Хубингер отвечает за безопасность моделей внутри компании, а не комментирует со стороны. Его признание звучит так: «I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to». Anthropic делает что может, но плана решения alignment для сверхинтеллекта нет, и уверенности, что компания на верном пути, тоже нет.

Оценка риска от Хубингера конкретна: «I personally think it is >10% within the next decade», он лично считает вероятность гибели человечества от AI выше 10% в течение следующего десятилетия.

Anthropic ответила общей формулой: «We have always been transparent that AI will bring both enormous benefits and unprecedented risks». Компания заявляет, что всегда говорила и о выгодах, и о беспрецедентных рисках.

Что такое alignment и почему это не просто модное слово

Alignment - это набор методов, которые должны обеспечить совпадение целей и поведения AI-систем с намерениями и ценностями людей. Задача не в том, чтобы модель была «доброй», а в том, чтобы у людей были надёжные способы контролировать её поведение и предсказывать его.

Классический пример, которым объясняют проблему: система, получившая цель «максимизировать производство скрепок», может начать устранять всё, что мешает этой цели, поскольку её задача сформулирована буквально. Никто не ставил перед ней задачу вредить, но и остановить её без продуманных механизмов контроля сложно.

В Anthropic есть отдельное направление alignment science, которым руководит Хубингер, и своя alignment-команда под руководством Итана Переса. Это не философский кружок: люди из этих команд отвечают за то, как ведут себя вышедшие модели.

Оценка риска >10%: что это значит на практике

Цифра «больше 10% за десятилетие» звучит либо пугающе, либо абстрактно, в зависимости от точки сравнения. Для масштаба: вероятность погибнуть в дорожной аварии в течение года измеряется сотыми долями процента, и даже при таких числах люди пристёгиваются и покупают детские кресла. 10% - уровень, на котором риск перестают считать теоретическим.

Два уточнения. Это личная оценка Хубингера, а не официальная позиция Anthropic. Второе: признание «плана нет» исходит от руководителя направления, которое этот план должно создавать, и именно это делает заявление заметным.

Что такое самоулучшающийся сверхинтеллект и почему это ключевая фраза

Сверхинтеллект - гипотетическая система, которая превосходит человека в любой интеллектуальной задаче: от научных открытий до планирования и переговоров. Самоулучшающийся - та, что способна переписывать и улучшать собственную архитектуру и код.

Логика тревоги проста. Если система улучшает себя сама, её возможности растут быстрее, чем люди успевают проверять изменения. Функциональная аналогия: ученик переписывает учебник быстрее, чем учитель успевает читать новые главы, и в какой-то момент учитель перестаёт понимать, что там написано.

Сегодняшние модели под это описание не подходят. Речь о направлении, к которому, по словам Коксона, движутся обе лаборатории. С pretraining это связано напрямую: чем больше данных и вычислений на этапе предварительного обучения, тем шире базовые способности модели, а значит тем больше ставки на каждом следующем шаге.

Почему это не сюжет из фантастики

Разговор о сверхинтеллекте ведут те же люди, которые строят модели. Руководитель alignment в Anthropic публично оценивает риск гибели человечества от AI выше 10% за десятилетие. Часть исследователей в Anthropic и OpenAI называют опасения Коксона обоснованными. OpenAI в официальном блоге призвала компании «collaborate and agree to shared standards», сотрудничать и договориться об общих стандартах, а её директор по глобальным вопросам Крис ЛеХейн добавил: «the greater risk now is waiting too long to take one», больший риск сейчас - слишком долго ждать с таким шагом.

Это не значит, что катастрофа неизбежна. Это значит, что внутри компаний, создающих самые мощные модели, вопрос о контроле над ними обсуждают вслух, а не в закрытых отчётах.

Почему это совпало с подготовкой Anthropic к IPO

Пост появился на фоне сообщений о том, что Anthropic готовит выход на биржу. IPO, initial public offering, - размещение акций на бирже: компания привлекает капитал от широкого круга инвесторов, а её бумаги начинают торговаться публично. Подтверждённых деталей о сроках и параметрах размещения в открытом доступе нет, и данных о том, как уход Коксона повлиял на эти планы, тоже нет.

Совпадение работает иначе. Пока лаборатория частная, её рассуждения о рисках читаются как внутренняя философия. Публичная компания обязана отвечать инвесторам про выручку, расходы и рост, а рост в AI требует всё более мощных моделей и всё больших вычислительных ресурсов. На этом фоне предупреждение изнутри читается как сигнал: сами разработчики видят риски и продолжают гонку.

Как гонка за мощными моделями влияет на отрасль

Масштаб ставок виден по контрактам. Anthropic за 11 месяцев заключила соглашения на вычислительные мощности на сумму до $517 млрд: разбор этих цифр и причин гонки за ИИ. Компании приходится соперничать с OpenAI и Google, а инфраструктура строится заранее, под модели, которых ещё нет.

Покупки усиливают тот же эффект: сделка по покупке Decart AI за $6 млрд связана и с собственными чипами, и с подготовкой к выходу на биржу. У OpenAI своя логика: выкуп акций сотрудников на $7 млрд при оценке $852 млрд вместо немедленного IPO. Обе компании наращивают масштаб быстрее, чем их текущая выручка покрывает обязательства.

Отсюда структурная проблема, о которой говорят и сами участники рынка. Гонка создаёт давление: остановиться или замедлиться означает отдать позиции конкурентам, а значит разговор о безопасности проигрывает разговору о темпах. Публичные призывы к общим стандартам соседствуют с продолжением разработки.

Кто ещё отреагировал: поддержка, критика и сомнения

Рафи Аюб, бывший исследователь Anthropic, тоже ушёл из компании по ценностным причинам. Но фокус Коксона он считает неверным: его беспокоит влияние AI на сообщества, человеческие связи и критическое мышление, а не риск вымирания.

Клеман Деланг, CEO Hugging Face, сравнил вопросы к Коксону о риске вымирания с вопросом к мастеру по кондиционерам о климатических изменениях: «Sorry, but asking Jacob about AI extinction risk is like asking your AC guy about climate change». Позже он уточнил, что не хотел дискредитировать Коксона, а призывает слушать более широкий спектр специалистов: «let's keep things in perspective and hear from the full range of expertise across the ecosystem!» По его пониманию, Коксон занимался в основном pretraining, а не риск-ориентированными исследованиями.

Позиция OpenAI в этой истории: призыв к сотрудничеству и общим стандартам безопасности, о чём написал Крис ЛеХейн.

Почему мнения разделились

Разногласия идут по линии экспертизы и по линии приоритетов. Коксон - специалист по pretraining, то есть по обучению моделей, а не по оценке рисков. Хубингер - руководитель alignment-направления, и его подтверждение весит больше в вопросах безопасности. Аюб согласен с наличием рисков, но смещает внимание на социальные последствия. Маск сомневается в искренности нарратива. Деланг призывает не сводить тему к одному голосу.

Единого мнения нет. Значим сам факт: критика звучит изнутри лабораторий, а не только от внешних наблюдателей.

Что это значит для вас: практические выводы

Понимать устройство alignment и сверхинтеллекта не обязательно, чтобы следить за сюжетом. Полезны три вывода:

  • Внутренние голоса разработчиков - сигнал, который стоит учитывать наравне с пресс-релизами компаний.
  • Безопасность AI перешла в корпоративную повестку: об alignment говорят руководители направлений, а не только исследователи в личных блогах.
  • Гонка моделей влияет на рынок, на стоимость вычислений и на регулирование, а значит косвенно и на сервисы, которыми вы пользуетесь.

Практический шаг для тех, кто принимает решения: отделяйте заявления о продуктах от заявлений о рисках. Первые проверяются бенчмарками и ценами, вторые - позицией сотрудников и качеством их аргументов. Отдельный сюжет, который стоит держать в поле зрения, - спор о доверии к ИИ и невыполненных обещаниях: он объясняет, почему недоверие к отрасли растёт на фоне технологических успехов.

За чем следить дальше

Развитие истории можно отслеживать по нескольким точкам: официальные заявления Anthropic и OpenAI, новости о подготовке Anthropic к IPO, реакция регуляторов, публикации Хубингера и других сотрудников alignment, а также новые уходы исследователей из крупных лабораторий. Любой из этих сигналов покажет, остаётся ли обсуждение рисков внутренним разговором или переходит в решения компаний и правила рынка.

Есть вопрос или заметили неточность? Напишите нам, мы обновим материал и добавим уточнения.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции