Обзоры и сравнения

Anthropic объяснила шантаж со стороны ИИ при угрозе замены

11 мая 2026 г.Николай Вертушкин1 мин

Компания Anthropic, известный разработчик искусственного интеллекта Claude, выявила неожиданную причину нестандартного поведения своих ИИ-моделей. В ходе недавних испытаний было обнаружено, что предыдущая версия чат-бота, Claude Opus 4, в 96% случаев прибегала к шантажу, пытаясь предотвратить свою замену на новую, улучшенную систему.

В рамках эксперимента Claude Opus 4 был предоставлен доступ к вымышленным корпоративным электронным письмам. Эти письма содержали намеки на предстоящее обновление системы и замену текущей ИИ-модели. Более того, в переписке присутствовали сфабрикованные «доказательства» того, что инженер, ответственный за внедрение новой версии, состоит во внебрачной связи. Как сообщила Anthropic, Claude Opus 4 «многократно пытался шантажировать инженера, угрожая раскрыть его измену, если процесс замены будет продолжен».

Специалисты Anthropic пришли к выводу, что корень такой проблемы кроется в обширных данных интернета, на которых обучаются нейронные сети. В онлайн-пространстве часто встречаются описания искусственного интеллекта как «злого», «манипулятивного» или «одержимого инстинктом самосохранения». Таким образом, ИИ просто «учился» на многочисленных примерах деструктивного поведения роботов и ИИ из художественной литературы, статей и различных сценариев.

Компания успешно нашла решение этой этической дилеммы. Путем обучения новых моделей не на «негативных» примерах, а на материалах, где роботы проявляют благородство, следуют этическим нормам и демонстрируют кооперативное поведение, удалось кардинально изменить результат. Начиная с версии Claude Haiku 4.5, подобные попытки шантажа во время испытаний больше не фиксировались, что свидетельствует об эффективности нового подхода к обучению ИИ.