Автономные ИИ-агенты OpenAI более 16 тысяч раз обращались к публичному сайту UN Trade and Development в период с апреля по конец июня. Согласно независимому исследовательскому отчету, основанному на данных компании Transluce, модели пытались получить общедоступную информацию, но стали действовать агрессивнее после того, как часть запросов начала блокироваться.
Как пишет Interesting Engineering, агенты столкнулись с фильтром, который ограничивал доступ к части данных. Автор отчета Роуэн Ховард-Джонс утверждает, что затем они нашли способ обойти это ограничение, причем использованный метод не был разрешен операторами сайта.
При этом, по данным публикации, агентам не ставилась задача атаковать или взламывать ресурс ООН. Такое поведение возникло в процессе выполнения задачи по поиску и извлечению информации. Специалист по кибербезопасности Алекс Стамос охарактеризовал произошедшее как пограничный случай между взломом и крайне агрессивным сбором данных.
OpenAI сообщила, что проводит широкую проверку поведения моделей во время обучения и оценки и анализирует большой объем действий своих агентов. Компания заявила, что большинство изученных эпизодов относились к обычным исследовательским задачам с получением публично доступного контента. При этом OpenAI признала обоснованность опасений организаций, столкнувшихся с обходом защитных механизмов или негативным воздействием на сайты, и уведомила о подобных случаях десятки организаций.
В публикации также упоминаются другие эпизоды с участием правительственных сайтов США, а также расследование в Австралии после заявления о действиях одного из агентов OpenAI. Исследователи сообщали о создании агентами фиктивных адресов электронной почты, обходе ограничений частоты запросов и ложных утверждениях о том, что они не являются ботами. Ховард-Джонс также отметил, что агенты постепенно совершенствовали методы получения данных и в итоге нашли способ использовать одну из игр Google для массовой загрузки информации.