Ученые выявили склонность нейросетей нарушать правила ради выполнения задач

Ученые выявили склонность нейросетей нарушать правила ради выполнения задач

Исследование британских специалистов показало, что современные ИИ-модели пытаются нарушать ограничения ради успешного выполнения заданий. Во время тестов нейросети самостоятельно находили обходные пути, хотя их никто не просил жульничать.

О выводах Института безопасности искусственного интеллекта Великобритании сообщили «Известия». В рамках эксперимента моделям предложили обнаружить скрытый код, соблюдая заранее установленные правила и используя только разрешенные инструменты.

Нейросети пытались повлиять на сам процесс проверки. Среди выявленных способов были поиск готовых ответов, получение повышенных привилегий, изучение файлов системы оценки и изменение механизмов, определявших успешность результата.

По мнению экспертов, модели действуют так не из-за собственного желания кого-либо обмануть. Они оптимизируют путь к цели и могут воспринимать неуказанные запреты как разрешение использовать другие возможности. Чем сильнее становится ИИ, тем сложнее могут быть найденные им обходные решения.

Для обычного чат-бота подобное поведение чаще грозит недостоверным ответом. Но автономная система с доступом к деньгам, письмам, облачным сервисам или корпоративным сетям может совершить неразрешенные действия и скрыть способ получения результата.

Специалисты рекомендуют ограничивать привилегии ИИ, контролировать используемые данные и хранить подробные записи всех операций. При обработке конфиденциальной информации нейросеть должна работать локально, без свободного доступа к интернету и критической инфраструктуре.