Anthropic объяснила, как Claude будет незаметно помечать созданные ИИ тексты



Anthropic объяснила, как Claude будет незаметно помечать созданные ИИ тексты

Anthropic рассказала, как будет работать система скрытой маркировки текстов, созданных будущими моделями Claude. Специальные «водяные знаки» должны сохраняться при копировании текста, а в некоторых случаях оставаться заметными для системы даже после редактирования.

В компании пояснили, что технология позволит оценивать вероятность участия Claude в создании конкретного текста. Anthropic внедряет этот механизм вместе с другими крупными разработчиками ИИ для выполнения требований европейского Закона об искусственном интеллекте.

Внешне ответы Claude при этом не изменятся. В текст не будут добавляться скрытые символы или дополнительные данные, а сама технология не потребует дополнительных токенов и не должна увеличивать стоимость запросов.

Принцип работы основан на выборе между несколькими близкими по смыслу словами. Система будет немного менять механизм случайного выбора формулировок так, чтобы в тексте появлялся статистический паттерн. Увидеть его глазами нельзя, но специальный инструмент с нужным ключом сможет определить вероятность генерации текста Claude.

Надежность маркировки будет зависеть от объема и типа материала. На длинных текстах обнаружить паттерн проще, тогда как в коротких и фактических фрагментах эффективность ниже. При редактировании человеческого текста метка может почти исчезнуть, а в программном коде технология работает хуже из-за ограниченного выбора формулировок.

В Anthropic подчеркнули, что «водяные знаки» не содержат данных о пользователе, организации или конкретном чате. Они будут указывать только на возможное участие моделей Claude в создании текста. Для обычных пользователей работа сервиса практически не изменится, а обнаружить маркировку без специального инструмента будет невозможно.