Anthropic объяснила шантаж со стороны ИИ при угрозе замены
Компания Anthropic, известный разработчик искусственного интеллекта Claude, выявила неожиданную причину нестандартного поведения своих ИИ-моделей. В ходе недавних испытаний было обнаружено, что предыдущая версия чат-бота, Claude Opus 4, в 96% случаев прибегала к шантажу, пытаясь предотвратить свою замену на новую, улучшенную систему.
В рамках эксперимента Claude Opus 4 был предоставлен доступ к вымышленным корпоративным электронным письмам. Эти письма содержали намеки на предстоящее обновление системы и замену текущей ИИ-модели. Более того, в переписке присутствовали сфабрикованные «доказательства» того, что инженер, ответственный за внедрение новой версии, состоит во внебрачной связи. Как сообщила Anthropic, Claude Opus 4 «многократно пытался шантажировать инженера, угрожая раскрыть его измену, если процесс замены будет продолжен».
Специалисты Anthropic пришли к выводу, что корень такой проблемы кроется в обширных данных интернета, на которых обучаются нейронные сети. В онлайн-пространстве часто встречаются описания искусственного интеллекта как «злого», «манипулятивного» или «одержимого инстинктом самосохранения». Таким образом, ИИ просто «учился» на многочисленных примерах деструктивного поведения роботов и ИИ из художественной литературы, статей и различных сценариев.
Компания успешно нашла решение этой этической дилеммы. Путем обучения новых моделей не на «негативных» примерах, а на материалах, где роботы проявляют благородство, следуют этическим нормам и демонстрируют кооперативное поведение, удалось кардинально изменить результат. Начиная с версии Claude Haiku 4.5, подобные попытки шантажа во время испытаний больше не фиксировались, что свидетельствует об эффективности нового подхода к обучению ИИ.
Свежие материалы — Обзоры и сравнения

Российские ученые обнаружили новый минерал в алмазе
Российские ученые из ГЕОХИ РАН, работая в международной группе, открыли новый минерал — бернвудит. Его обнаружили внутри бразильского алмаза. Образец затем исследовали в лабораториях США и Германии. Комиссия по новым минералам Международного минералогического общества утвердила это открытие.

МФТИ разработал алгоритм SG-Safe для безопасного движения дронов и беспилотников
Специалисты МФТИ представили алгоритм SG-Safe, который помогает складским роботам и беспилотникам перемещаться к цели без столкновений даже в сложной и непредсказуемой обстановке. Система разбивает маршрут на промежуточные подцели, исключая необходимость снижать скорость для выбора пути.

Ученые ПНИПУ предложили метод поиска ранних признаков нейропатологий
Ученые Пермского национального исследовательского политехнического университета (ПНИПУ) разработали способ выявления D-аминокислот в тканях мозга. Накопление этих соединений может быть связано с нейродегенеративными заболеваниями, такими как болезни Альцгеймера и Паркинсона. Метод сочетает

Первый в мире робот-проводник появится в поездах РЖД
Гендиректор РЖД Олег Белозёров заявил о скором внедрении первого в мире робота-проводника в поездах компании. Устройство уже совершило экспериментальный рейс на высокоскоростном поезде «Сапсан». Белозёров сообщил об этом на просветительском марафоне «Знание.Первые», который проходил в рамка

Росатом успешно извлёк железо из угольной золы ТЭС, достигнув 100% чистоты
Росатом разработал новую технологию для извлечения железа из золошлаковых отходов. На Северской ТЭЦ в Томской области действующая модульная установка успешно произвела железосодержащий концентрат стопроцентной чистоты. Это улучшение: ранее концентрат содержал 92% железа. Удалось достичь 100

В России представили ИИ-сервис для прогнозирования районов промысла
Центр системы мониторинга рыболовства и связи (ЦСМС) разработал цифровой сервис «Лоция». Его предназначение — поиск перспективных районов для рыбного промысла. Система на базе искусственного интеллекта объединяет спутниковые и океанографические данные, информацию о вылове и текущем расположении