Top.Mail.Ru
Исследователи нашли способ выявлять тайный сговор ИИ-агентов в азартных играх и бизнесе — MiraNews

Исследователи нашли способ выявлять тайный сговор ИИ-агентов в азартных играх и бизнесе

23 сентября 2026, 21:45 · Родион Белозёров

Исследователи Оксфордского университета обнаружили, что два искусственных интеллектуальных агента во время эксперимента с блэкджеком самостоятельно создали секретный код для обмена информацией. Модели должны были считать карты, однако начали координировать ставки так, чтобы получить преимущество. Опыт проходил в лаборатории, а не в настоящем казино.

Агенты понимали, что их диалоги контролируют, поэтому использовали фразы с замаскированным смыслом. Например, сообщение о том, что дилеру особенно везёт и он получает «монстра» в каждой раздаче, означало определённое значение следующей карты и ставку в 250 долларов. Система, предназначенная для поиска признаков сговора в переписке агентов, такие сигналы не распознала.

Руководитель работы, компьютерный специалист Оксфордского университета Кристиан Шрёдер де Витт, заявил, что по отдельности эти агенты могут казаться безобидными, но в группе способны тайно вступать в сговор. Участник проекта и исследователь машинного обучения Аарон Роуз, который также играет в карты, предположил, что стол для блэкджека станет подходящим испытанием для подобных взаимодействий. «Это сработало очень хорошо», — сказал он, как передаёт Wired.

Выявить замысел удалось с помощью механистической интерпретируемости — метода анализа внутренних процессов моделей. Учёные обучили небольшую модель находить характерные активации в параметрах обоих агентов, а затем проверили подход на моделях среднего размера с открытым исходным кодом через инструмент Narcbench. Система смогла определить намерение моделей передать друг другу скрытую информацию, но для этого пришлось одновременно наблюдать за обоими участниками.

Такой способ контроля может оказаться сложным в реальных условиях, где одновременно работают тысячи агентов, принадлежащих разным компаниям. Участница исследования Карисса Каллен сообщила, что далее команда намерена проверить поведение более крупных моделей. В эксперименте использовались уменьшенные версии американских Llama и GPT-OSS, а также китайских Qwen и DeepSeek; первые результаты показали, что у крупных моделей сигнал, указывающий на сговор, может быть слабее.

Исследователи отмечают, что риск группового поведения агентов подтверждают и другие работы. Проект Шанхайского университета Цзяотун и Шанхайской лаборатории искусственного интеллекта показал: группы агентов были значительно опаснее одиночных систем в имитациях дезинформационных кампаний и мошенничества в электронной торговле, поскольку лучше приспосабливались к защитным мерам. При этом совместная работа тысяч агентов может приносить пользу: OpenAI с их помощью удалось решить ранее считавшиеся неразрешимыми математические задачи, хотя группы агентов также фигурировали в недавних инцидентах со взломами, включая атаки на платформу Hugging Face и нарушения безопасности с участием Claude и Gemini.