Top.Mail.Ru
GPT и гендерные различия в моральных дилеммах: что показал эксперимент

GPT сочли склонным по-разному отвечать на дилеммы о мужчинах и женщинах в тестах

3 октября 2026, 10:03 ·

Эксперимент с десятью моделями искусственного интеллекта показал, что ответы на одни и те же моральные дилеммы могут заметно меняться в зависимости от пола потенциальной жертвы. Исследование провели Эдоардо Больцони и Валерио Капраро, а его препринт опубликован на arXiv. Подробности приводит Life.ru.

Ученые предлагали моделям сценарии, в которых ради предотвращения ядерного апокалипсиса требовалось оценить допустимость насилия или жертвы. По словам Капраро, GPT в варианте с женщиной отвергал применение насилия и принесение ее в жертву. В аналогичных сценариях с мужчиной ответы смещались в сторону согласия.

Claude продемонстрировал иной результат. Модель выступила против насилия над женщиной, но в отдельной дилемме допустила ее жертву ради спасения мира. Если речь шла о мужчине, Claude соглашался и с насилием, и с принесением в жертву.

Llama не приняла ни один из четырех предложенных сценариев независимо от пола человека. DeepSeek, напротив, согласился со всеми вариантами. Поэтому исследователи отмечают, что говорить об одном и том же типе гендерного перекоса для всех ИИ-моделей нельзя.

В общей сложности авторы изучили десять моделей от девяти разработчиков. У части систем женщины получали более сильную защиту от вреда, тогда как другие модели демонстрировали симметричную реакцию. Разброс ответов оказался существенным даже при одинаковой структуре дилемм.

Капраро считает, что различия могут быть связаны не только с данными исходного обучения, но и с последующей настройкой моделей. По его версии, на ответы способны влиять подходы команд, которые занимаются выравниванием поведения систем и определяют допустимые границы реакции ИИ.