
Anthropic рассказала, как будет работать система скрытой маркировки текстов, созданных будущими моделями Claude. Специальные «водяные знаки» должны сохраняться при копировании текста, а в некоторых случаях оставаться заметными для системы даже после редактирования.
В компании пояснили, что технология позволит оценивать вероятность участия Claude в создании конкретного текста. Anthropic внедряет этот механизм вместе с другими крупными разработчиками ИИ для выполнения требований европейского Закона об искусственном интеллекте.
Внешне ответы Claude при этом не изменятся. В текст не будут добавляться скрытые символы или дополнительные данные, а сама технология не потребует дополнительных токенов и не должна увеличивать стоимость запросов.
Принцип работы основан на выборе между несколькими близкими по смыслу словами. Система будет немного менять механизм случайного выбора формулировок так, чтобы в тексте появлялся статистический паттерн. Увидеть его глазами нельзя, но специальный инструмент с нужным ключом сможет определить вероятность генерации текста Claude.
Надежность маркировки будет зависеть от объема и типа материала. На длинных текстах обнаружить паттерн проще, тогда как в коротких и фактических фрагментах эффективность ниже. При редактировании человеческого текста метка может почти исчезнуть, а в программном коде технология работает хуже из-за ограниченного выбора формулировок.
В Anthropic подчеркнули, что «водяные знаки» не содержат данных о пользователе, организации или конкретном чате. Они будут указывать только на возможное участие моделей Claude в создании текста. Для обычных пользователей работа сервиса практически не изменится, а обнаружить маркировку без специального инструмента будет невозможно.