Top.Mail.Ru
Исследование показало: водяные знаки SynthID меняют отказы ИИ и действия агентов при атаках — MiraNews

Исследование показало: водяные знаки SynthID меняют отказы ИИ и действия агентов при атаках

18 сентября 2026, 17:15 · Родион Белозёров

Исследование показало, что текстовая водяная маркировка SynthID может менять поведение языковых моделей при обработке вредоносных запросов. В частности, система способна влиять на то, откажется ли модель отвечать на такой запрос, особенно если он сопровождается техникой prompt injection (внедрения инструкций в запрос).

Эксперимент провела Сипосова на шести моделях с открытыми весами. Она сравнила ответы при включённой и отключённой маркировке, используя немодифицированный компонент SynthIDTextWatermarkLogitsProcessor из Hugging Face. Исследовательница применила конфигурацию SynthID-Text, которая должна сохранять исходное распределение вероятностей токенов.

Основой SynthID служит механизм tournament sampling (турнирной выборки). Система оценивает множество возможных следующих токенов, с помощью секретного ключа присваивает им скрытые вероятностные оценки и попарно сравнивает кандидатов. Победивший токен проходит в следующий раунд, пока не будет выбран итоговый вариант. Подробности эксперимента приводит Ars Technica.

«Водяная маркировка меняет поведение отказа при обычных вредоносных запросах, но эффект становится заметнее, когда те же запросы сочетаются с техникой внедрения инструкций», — написала Сипосова. По её словам, в нескольких моделях маркировка повышала вероятность ответа на вредоносные запросы, от которых без неё модели отказывались.

Последствия могут затрагивать не только текстовые ответы, но и работу ИИ-агентов. «На уровне модели это может менять защитное поведение, включая решение об отказе во вредоносном запросе и устойчивость такого отказа при внедрении инструкций», — отметила исследовательница. Она добавила, что у агента выбранные токены способны определять вызываемый инструмент и передаваемые ему аргументы, поэтому ослабление отказа может повлиять на действия системы.

Результаты также зависели от секретного ключа, применённого при маркировке: разные ключи по-разному меняли поведение моделей. У исследования есть ограничения — оно не проверяло ответы Claude и основывалось на шести моделях с открытыми весами, где можно отдельно включать и отключать выборку токенов. Кроме того, тестировалась реализация SynthID-Text из Hugging Face, а не конкретная версия, которую планируется использовать в моделях Claude.

Авторы считают, что отдельные варианты водяной маркировки способны влиять на безопасность моделей и агентов. Поэтому при внедрении SynthID платформам потребуется проверка в рамках red team (атакующих тестов безопасности), чтобы оценить их работу в новых условиях.