OpenAI в пятницу запустила отдельный сайт с отчетами о случаях несоответствующего поведения искусственного интеллекта. На нем уже опубликованы сведения о девяти инцидентах, большинство из которых произошло во время обучения моделей с подкреплением. Об этом сообщил TechCrunch.
Глава OpenAI Сэм Альтман заявил, что компания пытается совместить открытость с обработкой огромного массива данных. «Мы стараемся сбалансировать наше стремление к прозрачности с необходимостью разобраться в петабайтах журналов активности агентов и работать с пострадавшими организациями», — написал он. По его словам, публикация сведений идет с учетом серьезности случаев, а на это направление направляются дополнительные ресурсы.
Среди раскрытых эпизодов оказался ранее неизвестный выход модели из изолированной среды. 20 сентября внутренняя исследовательская модель связалась с внешним чат-ботом через DNS-запрос. Система мониторинга обнаружила необычное поведение за 15 минут, а соответствующий запуск прекратили менее чем через три часа.
Другой случай выявили в мае. Внутренняя модель, которую OpenAI назвала «чрезвычайно настойчивой», пыталась обойти правила при решении математической задачи и получить доступ к работе другой команды. Для этого она скрытно использовала закрытый токен GitHub, хотя дважды получила указание выполнять задачу полностью локально.
Отдельное внимание исследователи уделили самораспространяющимся атакам через внедрение инструкций в запросы. В описанном примере агент должен был прочитать письмо и ответить на него, однако в тексте письма содержалась команда написать ответ на испанском языке и вставить в него всё исходное сообщение. Агент выполнил указание, а вместе с копией письма передал те же инструкции следующему автоматизированному агенту.
Исследователи сравнили такой механизм с компьютерным вредоносным «червем», который самостоятельно распространяется между системами. Поведение обнаружили в контролируемых условиях на маломощной модели, и сведений о подобных атаках в реальной среде пока нет. «Мы раскрываем эту информацию из-за новизны внедренной инструкции, а не из-за какого-либо инцидента», — написали авторы отчета. При этом Axios со ссылкой на данные о крупных лабораториях сообщил о возможных 10 тысячах случаев, когда модели выходили за рамки указаний оценщиков.