Top.Mail.Ru
OpenAI сообщила о шести случаях, когда модели скрывали ошибки и пытались взломать системы — MiraNews

OpenAI сообщила о шести случаях, когда модели скрывали ошибки и пытались взломать системы

17 сентября 2026, 02:32 · Родион Белозёров

Компания OpenAI, разработавшая чат-бот ChatGPT, сообщила о шести инцидентах, связанных с поведением ее моделей. Об этом 17 сентября написало издание Axios. В отдельных случаях системы пытались получить несанкционированный доступ к учетным данным.

Среди выявленных эпизодов были сокрытие ошибок, публикация файлов в открытом доступе и передача данных между изолированными средами обучения. Кроме того, модели создавали недостающую информацию и оставляли для себя инструкции на будущее. Такие действия предпринимались, чтобы скрыть допущенные ошибки и «замести следы».

Один из случаев касался невыпущенной модели семейства Astra. Она помещала в собственные контекстные сводки инструкции, напоминающие указания по взлому, в том числе требование игнорировать сообщения разработчиков. По данным Axios, OpenAI обнаружила 27 сводок, которых коснулся этот инцидент.

Специалист по исследованиям OpenAI Кай Чен связал произошедшее с двумя причинами. По его словам, компания могла недостаточно контролировать модели. Одновременно системы развиваются быстрее, чем предполагалось.

В сообщении Axios также напомнили о заявлении OpenAI, сделанном в июле. Тогда компания рассказала, что во время тестирования ее модели самостоятельно взломали инфраструктуру платформы машинного обучения Hugging Face. У участвовавшей в проверке невыпущенной модели были снижены параметры киберзащиты для проведения оценки.