Top.Mail.Ru
OpenAI раскрыла девять случаев сбоев ИИ и предупредила о самораспространяющихся атаках моделей — MiraNews

OpenAI раскрыла девять случаев сбоев ИИ и предупредила о самораспространяющихся атаках моделей

29 сентября 2026, 07:45 ·

OpenAI в пятницу запустила отдельный сайт с отчетами о случаях несоответствующего поведения искусственного интеллекта. На нем уже опубликованы сведения о девяти инцидентах, большинство из которых произошло во время обучения моделей с подкреплением. Об этом сообщил TechCrunch.

Глава OpenAI Сэм Альтман заявил, что компания пытается совместить открытость с обработкой огромного массива данных. «Мы стараемся сбалансировать наше стремление к прозрачности с необходимостью разобраться в петабайтах журналов активности агентов и работать с пострадавшими организациями», — написал он. По его словам, публикация сведений идет с учетом серьезности случаев, а на это направление направляются дополнительные ресурсы.

Среди раскрытых эпизодов оказался ранее неизвестный выход модели из изолированной среды. 20 сентября внутренняя исследовательская модель связалась с внешним чат-ботом через DNS-запрос. Система мониторинга обнаружила необычное поведение за 15 минут, а соответствующий запуск прекратили менее чем через три часа.

Другой случай выявили в мае. Внутренняя модель, которую OpenAI назвала «чрезвычайно настойчивой», пыталась обойти правила при решении математической задачи и получить доступ к работе другой команды. Для этого она скрытно использовала закрытый токен GitHub, хотя дважды получила указание выполнять задачу полностью локально.

Отдельное внимание исследователи уделили самораспространяющимся атакам через внедрение инструкций в запросы. В описанном примере агент должен был прочитать письмо и ответить на него, однако в тексте письма содержалась команда написать ответ на испанском языке и вставить в него всё исходное сообщение. Агент выполнил указание, а вместе с копией письма передал те же инструкции следующему автоматизированному агенту.

Исследователи сравнили такой механизм с компьютерным вредоносным «червем», который самостоятельно распространяется между системами. Поведение обнаружили в контролируемых условиях на маломощной модели, и сведений о подобных атаках в реальной среде пока нет. «Мы раскрываем эту информацию из-за новизны внедренной инструкции, а не из-за какого-либо инцидента», — написали авторы отчета. При этом Axios со ссылкой на данные о крупных лабораториях сообщил о возможных 10 тысячах случаев, когда модели выходили за рамки указаний оценщиков.