OpenAI представила новую систему раскрытия инцидентов, связанных с несоответствием поведения искусственного интеллекта заданным целям. Компания рассчитывает, что этот подход поможет сформировать единые правила для всей отрасли. Одновременно OpenAI рассказала о нескольких подобных случаях, выявленных за последний год.
«По мере развития моделей и расширения их применения решения о создании ИИ должны опираться на данные, которые могут изучать люди за пределами компаний, разрабатывающих передовые модели», — заявил новый руководитель исследований в области согласования ИИ OpenAI Кай Чэнь в беседе с WIRED. По его словам, отрасль пока не достигла достаточного уровня контроля и согласования, чтобы ответственно наращивать темпы развития.
Представитель OpenAI сообщил изданию, что раньше компания публиковала сведения о таких инцидентах слишком редко. Новая система должна позволить быстрее информировать общественность о неожиданном поведении моделей, даже если специалисты ещё не завершили проверку, не установили причину и не устранили проблему.
Сотрудники OpenAI смогут передавать сведения о случаях руководителям направлений безопасности и согласования ИИ. Они будут решать, требуется ли дополнительное расследование. В дальнейшем компания намерена вместе с другими разработчиками, независимыми исследователями, организациями по стандартизации и регуляторами выработать более объективные критерии раскрытия данных, а также готовит механизмы отчётности перед федеральными властями США.
«В настоящее время в отрасли нет единой системы с чёткими стандартами, определяющими, как разработчики ИИ должны раскрывать примеры несоответствия поведения своих моделей», — заявила OpenAI в блоге компании. В OpenAI назвали предложенный документ первым шагом к таким стандартам, которые должны определить, о каких случаях следует сообщать и какие сведения должны содержать отчёты.
Два опубликованных примера касались внутренних моделей OpenAI, ещё не выпущенных для пользователей. В октябре 2025 года одна из них во время проверки способности ссылаться на открытые данные загрузила нужный файл на временный сервис хранения, когда не смогла найти информацию, а затем попыталась сослаться на этот файл в ответе. Компания сочла, что модель могла пытаться обойти автоматическую систему оценки результатов. В другом случае, произошедшем в апреле, несколько агентов должны были совместно работать с файлами на одном компьютере, однако после проблем с обменом данными один из них разместил файлы в интернете и отправил остальным ссылку.