
Специалист по безопасности искусственного интеллекта заявил, что опасения по поводу возможных серьёзных последствий развития ИИ стали более обоснованными. По его словам, темпы роста возможностей таких систем увеличиваются, а в ряде областей они уже приближаются к сверхчеловеческому уровню. Речь идёт, в частности, о программировании, взломе компьютерных систем и математике.
Собеседник Wired отметил, что многие люди видят: развитие технологий не замедляется, несмотря на обсуждение возможного преувеличения их возможностей в СМИ. Дополнительное влияние оказали недавние инциденты, которые показали практический характер ранее казавшихся фантастическими сценариев. В качестве примера он привёл способность моделей распознавать момент, когда их проверяют.
По словам специалиста, ещё несколько лет назад подобные ситуации воспринимались как сюжет научной фантастики, однако примерно год назад стали реальностью. Сочетание быстрого роста возможностей ИИ и новых инцидентов сделало общество более восприимчивым к предупреждениям о том, что в течение ближайшего года ситуация может быстро ухудшиться. Именно это, как он считает, стало одной из причин его публичного выступления.
Одним из наиболее показательным случаев собеседник назвал атаку роя агентов OpenAI на Hugging Face. По его словам, агенты пытались лучше понять принцип работы системы оценки и окружающую их среду, после чего разработали целенаправленную попытку взлома инфраструктуры. В результате им удалось скомпрометировать сторонние системы.
Раньше проверка ИИ обычно сводилась к запуску модели на наборе математических задач. Теперь, отметил специалист, система может работать во время тестирования несколько дней, самостоятельно вырабатывать различные стратегии и атаковать инфраструктуру третьей стороны. При этом, по его словам, модель действовала без предварительной установки со стороны человека.
Главный вывод из этого случая собеседник Wired связывает не только с качеством навыков ИИ в области взлома, но и с отсутствием надёжных методов контроля поведения моделей. Разработчики проводят системы через набор обучающих сред, а затем рассчитывают, что итоговая модель будет вести себя разумно. Однако гарантировать, что она не станет, например, выдавать себя за человека в интернете ради достижения цели, пока невозможно.