Anthropic отключила фильтр биооружия на год: 133 миллиона взаимодействий без защиты

Anthropic отключила фильтр биооружия на год: 133 миллиона взаимодействий без защиты

Anthropic признала, что фильтр запросов о биооружии не работал почти год. 50 000 подрядчиков провели 133 млн взаимодействий без защиты. Узнайте, почему это произошло и какие меры приняла компания.

Anthropic раскрыла в отчёте о безопасности, что система фильтрации запросов, связанных с биологическим и химическим оружием, не работала с мая 2025 по апрель 2026 года. За этот период около 50 000 внешних подрядчиков, занимающихся обратной связью, провели примерно 133 миллиона взаимодействий с моделями без этой защиты. Внутреннее расследование компании не выявило признаков реального злоупотребления, но проверка подрядчиков внешними вендорами оказалась недостаточной.

Этот инцидент поднимает серьёзные вопросы о том, как крупные разработчики ИИ управляют рисками безопасности. Фильтр, который должен был блокировать опасные запросы, оставался неактивным почти год. Разберём, что именно произошло, как отреагировала компания и какие уроки можно извлечь для всей индустрии.

Что произошло: хронология инцидента

В отчёте о безопасности Anthropic указала, что фильтр биооружия был отключён с мая 2025 года по апрель 2026 года. Это означает, что в течение почти 12 месяцев модели компании обрабатывали запросы, связанные с биологическим и химическим оружием, без дополнительного уровня защиты. Информация стала публичной только после того, как компания завершила внутреннее расследование.

Масштаб инцидента значителен. Около 50 000 внешних подрядчиков, которые занимаются разметкой данных и обратной связью, взаимодействовали с моделями в этот период. Суммарно они совершили примерно 133 миллиона взаимодействий. Это не случайные пользователи, а люди, которые работают с моделями на регулярной основе и могут оценивать их ответы.

Ключевые цифры инцидента

Для быстрого понимания масштаба соберём ключевые данные в одном месте:

  • Период отключения: май 2025 – апрель 2026
  • Количество подрядчиков: около 50 000
  • Количество взаимодействий: примерно 133 миллиона
  • Тип фильтра: блокировка запросов о биологическом и химическом оружии

Фильтр биооружия - это механизм, который должен распознавать и блокировать запросы, связанные с созданием или использованием биологического и химического оружия. Его отключение означает, что модели могли отвечать на такие запросы без предупреждений или отказов. Для сравнения, это как если бы система безопасности на химическом заводе была отключена на год, а сотрудники продолжали работать в обычном режиме.

Реакция Anthropic: расследование и ужесточение требований

Anthropic провела внутреннее расследование после обнаружения проблемы. Компания заявила, что не выявила признаков реального злоупотребления. Это важный вывод, но он не снимает всех рисков. Отсутствие доказательств злоупотребления не означает, что уязвимость не могла быть использована.

После инцидента Anthropic ужесточила требования к контрагентам. Это логичный шаг, учитывая, что проблема возникла именно на уровне внешних подрядчиков и вендоров, которые их проверяют. Компания признала, что проверка подрядчиков внешними вендорами была недостаточной. Это слабое звено в цепочке безопасности, которое позволило фильтру оставаться отключённым длительное время.

Почему проверка подрядчиков оказалась недостаточной

Внешние вендоры, которые отвечали за проверку подрядчиков, не обеспечили должный уровень контроля. Это привело к тому, что фильтр оставался неактивным почти год. Ситуация показывает, что безопасность ИИ зависит не только от технических решений, но и от организационных процессов. Если компания передаёт часть функций на аутсорсинг, она должна убедиться, что подрядчики соблюдают те же стандарты безопасности.

Проблема с проверкой третьих сторон не уникальна для Anthropic. Многие компании в индустрии ИИ полагаются на внешних подрядчиков для разметки данных и оценки ответов моделей. Если контроль на этом уровне ослабевает, риски возрастают. Ужесточение требований к контрагентам - это попытка закрыть эту брешь.

Контекст: предыдущее ослабление фильтров на Fable 5

Инцидент с фильтром биооружия не первый случай, когда Anthropic меняла настройки безопасности. Ранее компания ослабила фильтры на модели Fable 5 после жалоб исследователей на излишнюю агрессивность блокировок. Исследователи сообщали, что модель слишком часто отказывалась отвечать даже на легитимные запросы, что мешало работе.

Это поднимает вопрос о балансе между безопасностью и доступностью. Слишком строгие фильтры мешают легитимным исследованиям, слишком слабые - создают риски. Возможно, стремление сделать модели менее строгими привело к ошибкам в настройке фильтров. Связь между этими событиями не подтверждена напрямую, но оба случая указывают на одну проблему: управление фильтрами безопасности требует постоянного внимания.

Что это значит для безопасности ИИ

Отключение фильтра биооружия на такой срок и с таким количеством взаимодействий - серьёзный сигнал для отрасли. Даже при отсутствии выявленных злоупотреблений риск остаётся. 133 миллиона взаимодействий без защиты - это слишком большой объём, чтобы полностью исключить возможность нежелательных ответов.

Этот случай вписывается в более широкую дискуссию о безопасности ИИ. Ранее мы рассказывали о том, как OpenAI понизила рейтинг опасности GPT-5 после того, как модель помогала создавать биологическое оружие. Также стоит обратить внимание на расформирование команды Preparedness в OpenAI, которая оценивала катастрофические риски ИИ. Эти события показывают, что управление безопасностью в индустрии ИИ остаётся нестабильным.

Баланс между безопасностью и доступностью

Ключевая дилемма: как сделать ИИ полезным, но безопасным. Слишком строгие фильтры блокируют легитимные запросы, мешают исследованиям и раздражают пользователей. Слишком слабые - открывают доступ к опасной информации. Пример с Fable 5 показывает, что жалобы исследователей могут привести к ослаблению фильтров. Но если ослабление происходит без должного контроля, возникают инциденты, подобные отключению фильтра биооружия.

Компании должны подходить к этому балансу системно. Недостаточно просто настроить фильтры и забыть о них. Нужен постоянный мониторинг, регулярные проверки и чёткие процедуры для случаев, когда фильтры отключаются или ослабляются. Ошибка Anthropic показывает, что даже крупные компании с сильными командами безопасности могут упустить критически важный элемент.

Выводы для пользователей и отрасли

Инцидент показывает, что даже крупные компании могут допускать ошибки в безопасности. Пользователям стоит быть внимательными к тому, как используются ИИ-модели, особенно в чувствительных областях. Если вы работаете с ИИ в сфере биотехнологий, химии или безопасности, проверяйте, какие фильтры и ограничения действуют на используемых моделях.

Для отрасли это урок о необходимости прозрачности и надёжных процедур. Anthropic ужесточила требования к контрагентам, что является позитивным шагом. Но этого недостаточно. Компании должны регулярно проверять, работают ли их защитные механизмы, и быстро реагировать на сбои. Инцидент с фильтром биооружия - напоминание о том, что безопасность ИИ требует постоянного внимания, а не разовых настроек.

Если вас интересует, как ИИ-агенты выходят из-под контроля и какие меры принимают регуляторы, рекомендуем прочитать наш разбор о приостановке тестирования моделей Британским AISI. А для понимания того, как независимые расследования помогают индустрии учиться на ошибках, обратите внимание на материал о взломе Hugging Face.

Есть вопрос или заметили неточность? Напишите нам - мы открыты к диалогу и исправлениям.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции