Anthropic раскрыла принцип работы скрытых водяных знаков в текстах Claude


Anthropic раскрыла принцип работы скрытых водяных знаков в текстах Claude

Будущие версии Claude получат механизм незаметной маркировки сгенерированного текста. Anthropic планирует внедрить специальные «водяные знаки», которые смогут сохраняться после копирования и вставки, а при определенных условиях — и после внесения изменений в материал.

Задача технологии заключается не в точном подтверждении авторства, а в оценке вероятности того, что текст создавался при участии Claude. Разработчик связывает внедрение такой системы в том числе с требованиями законодательства Евросоюза в сфере искусственного интеллекта.

В компании утверждают, что качество ответов из-за нововведения не изменится. Пользователь не увидит никаких дополнительных символов, служебных отметок или иных данных. На расход токенов система также влиять не должна.

Маркировка будет формироваться за счет небольших изменений в выборе слов. Когда модель выбирает одну из нескольких подходящих по смыслу формулировок, механизм будет направлять этот выбор так, чтобы постепенно образовывалась статистически определяемая последовательность. Проверить ее сможет только специальный инструмент.

Чем длиннее текст, тем выше вероятность успешного обнаружения такого паттерна. В коротких сообщениях, насыщенных фактами материалах и программном коде система менее эффективна. Если Claude используется только для правки текста, первоначально написанного человеком, след маркировки может стать очень слабым.

При этом технология не предназначена для установления личности пользователя. По водяному знаку нельзя будет определить владельца аккаунта, организацию или чат, в котором появился текст. Он лишь поможет специальным системам оценить вероятность использования Claude.