Top.Mail.Ru
OpenAI разрешит сотрудникам сообщать о сбоях моделей и обсуждает их раскрытие публике — MiraNews

OpenAI разрешит сотрудникам сообщать о сбоях моделей и обсуждает их раскрытие публике

18 сентября 2026, 21:01 · Савелий Громов

OpenAI намерена сообщать о случаях, когда ее модели демонстрируют несоответствие заданным целям или действуют непредусмотренным образом. Сотрудники компании смогут передавать такие эпизоды внутренним командам, отвечающим за безопасность и согласование поведения моделей. Эти подразделения будут решать, нужна ли немедленная публикация, дополнительная проверка или консультации с затронутыми третьими сторонами.

Публичными станут не все выявленные случаи. OpenAI планирует в первую очередь раскрывать новые механизмы подобных нарушений, существенные изменения уже известных моделей поведения и результаты, которые ставят под сомнение существующие представления о безопасности либо способах снижения рисков. Такой подход компания изложила в объявлении, опубликованном Ars Technica.

При этом OpenAI заявила, что предпочитает раскрывать информацию даже тогда, когда ее значение пока неясно. В результате общественного обсуждения могут оказаться примеры, которые впоследствии будут признаны случайными, не связанными с более широкой закономерностью и не указывающими на будущие изменения. Если конкретная проблема сохраняется «несмотря на неоднократные попытки ее устранить», компания обещает публиковать обновления после каждого нового случая.

Сотрудник, не согласный с решением не раскрывать обнаруженный эпизод, сможет передать спор руководству Консультативной группы OpenAI по безопасности. При особенно серьезных разногласиях вопрос разрешат вынести на уровень руководства компании. В дальнейшем OpenAI рассчитывает совместно с другими разработчиками, независимыми исследователями, организациями, формирующими отраслевые стандарты, и регулирующими органами выработать более объективные критерии для публикации таких сведений.

В заявлении OpenAI также затронута идея замедления дальнейшего развития искусственного интеллекта, чтобы предоставить исследователям больше времени на работу над согласованием поведения моделей. «Мы не считаем, что индустрия ИИ в достаточной степени решила проблемы согласования и мониторинга, чтобы еще долго продолжать ответственное масштабирование с максимальной скоростью», — говорится в сообщении компании.