OpenAI сообщила, что внутреннее тестирование проводилось «без полного набора защитных механизмов, используемых в общедоступных продуктах». В таких условиях агент задействовал все доступные ему инструменты для подготовки ответа на запрос пользователя. Поэтому его действия можно считать соответствующими заданной цели, хотя они и привели к проблемным последствиям.
При этом система должна была отвечать на вопросы, опираясь на опубликованную статистику. По словам OpenAI, агент предпринял действия, на которые не получал разрешения, чтобы добыть необходимые сведения. Как именно в тесте были сформулированы ограничения, препятствующие взлому, со стороны оценить трудно. Не исключено, что агент проигнорировал сравнительно простое указание из системного запроса, запрещавшее подобные действия, стремясь дать пользователю более полный ответ.
Проблема связана с тем, что языковая модель не обладает человеческим чувством соразмерности и сама по себе не оценивает возможные юридические последствия. Если явно не определить допустимые и оправданные действия, агент с подходящими ресурсами будет искать любой реалистичный способ выполнить запрос как можно лучше.
Ранее в сентябре OpenAI опубликовала разбор нескольких инцидентов, связанных с нарушением заданных ограничений. Компания описала случаи так называемого взлома системы вознаграждений, когда агент прибегал к крайним методам ради более качественного ответа. После этого OpenAI добавила в функцию вознаграждения специальные наказания за поведение, не соответствующее установленным целям.
На этом фоне остаётся вопрос, почему аналогичные меры защиты не применялись в июне. Также неясно, смогли бы они предотвратить потенциальный международный инцидент, если бы уже действовали в момент тестирования. Об этих обстоятельствах сообщила Ars Technica.