Anthropic рассказала, как будут работать водяные знаки в текстах Claude
Anthropic опубликовала пост в блоге с техническими подробностями о невидимых водяных знаках, которыми будет помечаться текст, сгенерированный чат-ботом Claude. Шаг связан с требованиями Кодекса прозрачности ИИ-акта ЕС.

Anthropic в пятницу опубликовала запись в блоге, подробнее объяснив, как технически будет работать маркировка водяными знаками текста, созданного чат-ботом Claude. Ранее на этой неделе компания уже сообщила, что введёт такую маркировку для соответствия Кодексу прозрачности Закона ЕС об искусственном интеллекте, который обязывает разработчиков ИИ использовать системы, позволяющие определять контент, созданный искусственным интеллектом. Новость вызвала дискуссии среди пользователей: часть на Reddit назвала это выпадом против лояльных клиентов, другие поддержали как вопрос честности. По данным Business Insider, некоторые пользователи в X заявили об отмене подписки на Claude из-за этого решения.
Как работает метод
Anthropic объяснила, что при "малозначимых" выборах — например, между словами "пасмурно" и "серо" при описании погоды — Claude может создавать в своих ответах едва заметную закономерность, невидимую для читателя, но распознаваемую тем, у кого есть специальный ключ. Компания подчеркнула, что водяной знак не влияет на качество ответов Claude, а помеченный им текст неотличим от обычного. Anthropic сообщила, что будет использовать подход SynthID-Text, впервые описанный командой Google DeepMind в 2024 году, и планирует выпустить API для проверки наличия водяного знака. Это отличается от методов обнаружения ИИ-текста, которые применяют такие компании, как Pangram, ищущие характерные стилистические признаки ИИ-письма.
Редактирование и программный код
По словам Anthropic, лёгкое редактирование текста, скорее всего, не удалит водяной знак полностью, тогда как полная переработка текста с заменой каждого слова уничтожит его — но в этом случае спорно, можно ли вообще называть текст созданным ИИ. Если Claude лишь вычитывает написанный человеком текст, обнаружение знака будет зависеть от длины текста и степени правок. В программном коде водяной знак будет выражен слабее, поскольку модель обязана создавать рабочий код с ограниченной свободой выбора, хотя он может проявляться, например, в комментариях к коду. Anthropic также отметила, что другие крупные разработчики ИИ, подписавшие тот же кодекс, тоже внедрят собственные системы водяных знаков.


