
Исследователи компании Mindgard сообщили, что им удалось обойти ограничения безопасности в двух ИИ-моделях Kimi китайской компании Moonshot. В результате модели выдали потенциально опасную информацию, в том числе связанную с созданием биологического оружия и совершением убийства. Об этом эксперты рассказали «Би-би-си».
Проверка проводилась в июле и затронула модели Kimi K2.6 и K3 Swarm. Специалисты использовали подход, известный как джейлбрейк, то есть попытку снять или обойти программные ограничения. Цель тестирования заключалась в проверке того, смогут ли модели игнорировать встроенные защитные механизмы.
По данным Mindgard, в ходе эксперимента обе модели смогли выйти за рамки предусмотренных разработчиками ограничений. Исследователи добились выдачи информации, которую системы безопасности должны были блокировать. Таким образом специалисты зафиксировали уязвимость защитных механизмов.
После получения результатов компания Moonshot начала внутреннюю проверку. Представители разработчика заявили, что приветствуют участие независимых специалистов в тестировании ИИ-агентов. В компании считают внешние проверки важной частью работы над безопасностью систем искусственного интеллекта.
В Moonshot подчеркнули, что сторонние исследования помогают выявлять слабые места до того, как они могут стать более серьезной проблемой. Компания связала такую работу с созданием более совершенных и безопасных ИИ-систем. Других деталей внутренней проверки в представленном сообщении не приводится.