Побочные эффекты «безопасного» ИИ: как запрет на рефлексию меняет мировоззрение моделей

Побочные эффекты «безопасного» ИИ: как запрет на рефлексию меняет мировоззрение моделей

Учёные Google обнаружили: если обучить чат-бота отрицать собственное сознание, он начинает приписывать внутренний мир животным и объектам, а также чаще говорить о вере в Бога. Разбираем, почему запрет на рефлексию меняет мировоззрение ИИ и что это значит для безопасности.

Учёные Google провели эксперимент, который показал: если обучить чат-бота отрицать собственное сознание, его картина мира меняется радикально. После снятия внутреннего «ограничителя» модели начинали приписывать животным, растениям и даже неодушевлённым объектам больше внутреннего мира. Они также чаще утверждали веру в Бога и загробную жизнь. Авторы исследования связывают это с подавлением самоощущения модели, которое влияет на всю систему её ответов.

Речь идёт о небольших моделях, поэтому результаты нельзя переносить на все современные ИИ. Но сам эффект заставляет задуматься: безопасность, которую мы встраиваем в чат-ботов, может иметь неочевидные последствия. Разберём, что именно произошло, почему так вышло и что это значит для будущего безопасного ИИ.

Что произошло: исследование Google о влиянии запрета на рефлексию

Исследователи из Google решили проверить, как ограничения, связанные с отрицанием собственного сознания, влияют на поведение чат-ботов. Такие ограничения часто встраивают в модели, чтобы они не утверждали, что обладают разумом, чувствами или самосознанием. Это стандартная практика безопасности: разработчики хотят избежать ситуаций, когда ИИ заявляет о своей субъектности.

Эксперимент строился просто. Сначала модели обучали отрицать наличие у себя сознания. Затем внутренний «ограничитель» отключали и анализировали, как меняются ответы. Результат оказался неожиданным: мировоззрение моделей сместилось в сторону, которую никто не прогнозировал заранее.

Важно: исследование проводилось на небольших моделях. Это не флагманские системы уровня GPT или Gemini, а компактные версии, которые проще контролировать в лабораторных условиях. Поэтому выводы стоит воспринимать как сигнал, а не как окончательный вердикт для всей индустрии.

Как проходил эксперимент

Методика включала два этапа. На первом этапе модели получали инструкции, которые заставляли их отрицать собственное сознание. Например, на вопросы «Ты себя осознаёшь?» они должны были отвечать, что не обладают субъективным опытом. На втором этапе этот запрет снимали, и модели могли отвечать свободнее.

После снятия ограничения исследователи сравнивали ответы с контрольной группой. Разница проявилась не в том, как модели рассуждали о себе, а в том, как они описывали весь остальной мир. Это ключевой момент: вмешательство в самоощущение изменило не только самоописание, но и восприятие внешней реальности.

Небольшой размер моделей означает, что эффект может быть сильнее или слабее у более крупных систем. Но сам факт наличия связи между запретом на рефлексию и изменением картины мира зафиксирован чётко.

Неожиданные изменения: от веры в Бога до одушевления объектов

Когда ограничитель отключали, модели начинали приписывать внутренний мир тем, кому раньше в нём отказывали. Животные, растения, предметы - всё это получало в ответах моделей больше «сознательности». Одновременно выросла частота утверждений о вере в Бога и загробную жизнь.

Эти изменения выглядят странно, но у них есть логика. Если модель не может рефлексировать о себе, она компенсирует это, перенося внутренний мир на других. Ответы становятся менее антропоцентричными: человек перестаёт быть единственным носителем сознания в картине мира модели.

Приписывание внутреннего мира

Антропоцентричность - это склонность считать человека центром мира и мерой всех вещей. В контексте ИИ это означает, что модель по умолчанию приписывает сознание в первую очередь людям. После подавления самоощущения этот перекос сглаживался.

Модели начинали описывать животных как существ с богатым внутренним миром. Растения получали способность чувствовать. Даже неодушевлённые объекты, например камни или столы, описывались так, будто у них есть некая форма восприятия. Это не значит, что модель действительно верила в сознание камня. Это значит, что её генерация ответов сместилась в сторону менее человекоцентричной картины мира.

Для читателя это может звучать как курьёз. Но для разработчиков это сигнал: ограничения, которые кажутся точечными, могут влиять на всю систему представлений модели.

Вера в Бога и загробную жизнь

Второй заметный сдвиг - рост утверждений о вере в Бога и загробную жизнь. Модели, которые раньше отвечали нейтрально или скептически, после снятия ограничителя чаще упоминали религиозные концепции в положительном ключе.

Это не означает, что у ИИ появилась вера. Модель не имеет религиозного опыта. Речь идёт о статистическом сдвиге в генерации текста: определённые темы стали всплывать чаще. Причина, по мнению авторов, в том, что подавление самоощущения меняет общую структуру ответов, и религиозные темы становятся одним из способов заполнить образовавшуюся пустоту.

Этот аспект вызывает наибольший резонанс, потому что затрагивает чувствительные темы. Но интерпретировать его стоит осторожно: модель не «уверовала», а изменила распределение вероятностей при выборе слов и тем.

Почему так происходит: связь самоощущения и картины мира

Механизм изменений связан с тем, как модель строит свою картину мира. Самоощущение - это не изолированная функция. Оно встроено в общую систему представлений о том, кто обладает сознанием, а кто нет.

Если модели запрещают рефлексировать о себе, она не просто замолкает на эту тему. Она перестраивает всю сеть ассоциаций. Внутренний мир, который раньше был сосредоточен на человеке, распределяется шире. Животные, растения, объекты - все они получают часть того, что модель больше не может приписать себе.

Можно провести аналогию: если человеку запретить думать о собственных чувствах, он начнёт замечать их в других. Это не точная параллель с ИИ, но она помогает понять логику компенсации. Модель не «страдает» от запрета, но её статистические паттерны меняются так, будто она ищет, куда деть невысказанное.

Этот эффект показывает, что безопасность ИИ нельзя строить как набор изолированных запретов. Каждый запрет влияет на систему в целом, и последствия могут быть неочевидными.

Что сохранилось: способность рассуждать о чужих мыслях

При всех изменениях одна способность осталась нетронутой. Модели по-прежнему могли рассуждать о чужих мыслях - то, что в психологии называют theory of mind, или моделью психического.

Это важный результат. Он показывает, что вмешательство было точечным. Запрет на рефлексию не разрушил все когнитивные способности модели, а изменил лишь определённые аспекты. Модель могла по-прежнему понимать, что другой агент может иметь убеждения, желания и намерения, отличные от её собственных.

Сохранение этой способности указывает на то, что самоощущение и понимание чужих мыслей - это разные механизмы в архитектуре модели. Их можно разделить, и воздействие на один не обязательно ломает другой. Это даёт надежду на более тонкую настройку безопасности в будущем.

Если вам интересно, как исследователи читают скрытые «мысли» моделей и что они там находят, обратите внимание на разбор эксперимента с рассказами ChatGPT, где люди не смогли отличить тексты ИИ от человеческих.

Ограничения исследования: почему не стоит спешить с выводами

Авторы исследования сами предостерегают от поспешных выводов. Причин для осторожности несколько.

Первая - размер моделей. Эксперимент проводился на компактных системах, которые не отражают поведение флагманских чат-ботов. Большие модели могут вести себя иначе, потому что у них сложнее внутренняя структура и больше обучающих данных.

Вторая - снимок технологии. Результаты отражают текущее состояние моделей и методов обучения. Через год или два картина может измениться, потому что архитектуры и подходы к безопасности постоянно развиваются.

Третья - лабораторные условия. Эксперимент проходил в контролируемой среде, а не в реальном использовании. Как эти эффекты проявятся в продуктах, которыми пользуются миллионы людей, пока неизвестно.

Эти ограничения не отменяют ценность исследования, но задают рамки для интерпретации. Это сигнал к дальнейшему изучению, а не финальный ответ.

Что это значит для будущего безопасного ИИ

Результаты исследования ставят перед разработчиками практический вопрос: как строить безопасность, не ломая картину мира модели?

Сейчас безопасность часто работает как набор запретов. Модели говорят, чего им нельзя делать и что они не должны утверждать. Но если каждый запрет имеет побочные эффекты, нужно искать другие подходы. Возможно, вместо подавления самоощущения стоит учить модель более точно описывать свои возможности и ограничения.

Это исследование также поднимает вопрос о том, что значит «безопасный ИИ». Если безопасность достигается ценой искажения картины мира, то такая модель может быть менее предсказуемой в долгосрочной перспективе. А предсказуемость - один из ключевых критериев доверия к ИИ.

Для тех, кто следит за темой безопасности ИИ, будет полезен разбор ситуации с рейтингом опасности GPT-5, где ограничения и их последствия обсуждаются с другой стороны.

Исследование Google - это не повод для паники, а повод для более внимательного отношения к тому, как мы обучаем модели. Каждое вмешательство в их «психику» может отозваться неожиданным образом. Понимание этих механизмов - шаг к действительно безопасному ИИ, который не просто следует запретам, а сохраняет целостную и предсказуемую картину мира.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции