Как работает текстовый водяной знак Claude
Будущие модели Claude будут генерировать текст, содержащий водяной знак. Это способ определить вероятность того, что Claude участвовал в создании текста, и мы, наряду с несколькими другими ведущими разработчиками ИИ, внедряем это изменение в соответствии с Законом ЕС об искусственном интеллекте (EU AI Act).
В этой статье мы делимся ответами на некоторые вопросы, которые мы получили о том, как работает выбранный нами метод нанесения водяных знаков, влияет ли он на результаты работы Claude и почему мы идем на этот шаг. Если обобщить:
- Мы используем метод нанесения водяных знаков, который не оказывает практического влияния на качество или содержание ответов Claude;
- Разницу между текстом с водяным знаком и без него читатели не смогут заметить;
- В текст ничего не добавляется, и в нем нет скрытых символов;
- Нанесение водяных знаков не требует дополнительных токенов и не приведет к удорожанию;
- Водяные знаки не содержат идентифицирующей информации и не могут быть отслежены до конкретного человека, организации или чата;
- Водяные знаки не будут уникальными только для Claude. Со 2 августа ЕС требует от провайдеров ИИ, работающих на его рынке, маркировать контент, сгенерированный искусственным интеллектом. Другие крупные разработчики моделей подписали тот же Кодекс практики и внедряют собственные водяные знаки.
Что такое водяной знак?
Большие языковые модели, такие как Claude, работают, генерируя текст по одному слову за раз. Каждый раз, когда модель определяет следующее слово, она выбирает его из списка потенциальных кандидатов, в конечном итоге останавливаясь на наиболее разумном или вероятном варианте на основе предшествующего текста. Возьмем предложение «Погода сегодня была холодной и…». Крайне маловероятно, что следующим словом будет «сахарной». Но вполне вероятно — «пасмурной» или «хмурой». В большинстве случаев читателю не так важно, какое именно из этих двух слов выберет модель в итоге — смысл предложения в целом остается прежним. В подобных случаях выбор определяется случайным числом.
Нанесение водяных знаков использует такие незначительные выборы (которые происходят многократно на протяжении сгенерированного текста), чтобы оставить паттерн в ответах Claude. Этот паттерн незаметен для читателя, но доступен для обнаружения любому, у кого есть ключ, который его кодирует. При использовании водяных знаков выбор по-прежнему делается случайным образом, но источник случайности меняется. Вместо использования генератора произвольных случайных чисел для выбора следующего слова, водяной знак использует ключ и несколько предшествующих слов, чтобы определить, какое слово должна выбрать модель. То есть слова, которые выбирает Claude, все еще случайны, но теперь можно проверить последовательность слов и увидеть, соответствует ли она выбору, который Claude сделал бы, используя ключ. Если это так, можно оценить вероятность того, что текст был сгенерирован Claude.
Важно отметить, что модель теперь не будет постоянно склоняться к словам «пасмурный» или «хмурый». Как и в случае с текстом без водяного знака, в одном предложении может быть выбрано слово «пасмурный», а в другом — «хмурый», в зависимости от предыдущих слов. Метод нанесения водяных знаков также не заставляет Claude выбирать слово, которое он в любом случае не стал бы рассматривать (например, Claude не станет выбирать такое слово, как «нубилосный» — малоизвестный1 синоним слов «пасмурный» или «хмурый», который Claude почти наверняка не стал бы использовать при обычных обстоятельствах).
Как водяные знаки влияют на результаты работы Claude?
Водяные знаки не влияют на качество ответов Claude. Для читателя ответ с водяным знаком неотличим от ответа без него (в этом плане водяные знаки ИИ существенно отличаются от их тезок на банкнотах, других физических объектах и некоторых цифровых документах, которые видны невооруженным глазом).
В ходе внутреннего тестирования мы не заметили никакого влияния водяных знаков на содержание, уровень креативности или читаемость текста Claude. В документе SynthID-Text, в котором описывается используемый нами метод, исследователи из Google DeepMind протестировали это влияние, предоставив модель с водяными знаками части пользователей трафика Gemini и сравнив оценки «большой палец вверх» и «большой палец вниз». Они не обнаружили статистически значимых различий по сравнению с моделью без водяных знаков. А в ходе контролируемого исследования люди-рецензенты, сравнивающие ответы с водяными знаками и без них бок о бок, не заметили никакой разницы в качестве.
Полезная аналогия — представить, что вы играете в такую игру, как «Монополия». На каждом ходу каждый игрок перемещается по доске на случайное количество клеток в соответствии с броском кубика. Предположим, что вместо бросания кубика для получения этой случайности мы решили использовать книгу с цифрами числа пи.2 Мы начинаем со случайно выбранной цифры (скажем, 1 012 845-й после десятичной точки, которой оказывается 6), и с этого момента каждый игрок просто использует следующую цифру в последовательности в качестве своего следующего «броска».
Все ходы по-прежнему остаются случайными: игрокам — и исходу игры — абсолютно все равно, берется ли случайность из числа пи или каждый раз из бросков кубика. Но если бы мы могли просмотреть последовательность всех ходов после окончания игры (и знали значение числа пи), мы смогли бы определить, действительно ли в этой игре для определения ходов использовалось число пи. Игра, в которой использовалось число пи, в некотором смысле помечена «водяным знаком».
То же самое происходит и с текстом, сгенерированным Claude. Нанесение водяных знаков не меняет смысл или восприятие для читателя, но если вы захотите проверить постфактум, был ли текст с высокой долей вероятности сгенерирован Claude, водяной знак позволит вам это сделать.
Какой конкретно метод нанесения водяных знаков вы используете?
Текстовый водяной знак Claude представляет собой версию подхода SynthID-Text, опубликованного Google DeepMind в статье в журнале Nature в 2024 году. Он относится к семейству подходов, восходящих к предложению Скотта Аронсона (Scott Aaronson) 2022 года. Все они разделяют тот же принцип проектирования, который мы описали выше: водяной знак изменяет только источник случайности, используемой для выбора слов.
Эффективность водяных знаков имеет свои ограничения. Используя наш ключ, можно ответить только на вопрос: «Какова вероятность того, что этот текст частично написан Claude?». Это не подтверждает, что текст был написан человеком, и не может определить, был ли текст написан другим ИИ (даже если этот другой ИИ использует водяные знаки, у него будет другой ключ; он также может использовать совершенно другой метод нанесения водяных знаков). Обнаружение водяного знака также плохо работает на коротких отрывках, где меньше вариантов выбора слов и, следовательно, меньше информации для анализа. По мере увеличения длины отрывка уверенность в участии Claude также возрастает.
Водяные знаки менее заметны в фактологических отрывках, где меньше вариантов выбора, которые можно сделать без снижения точности текста. Например, возьмем предложение: «Самая известная работа Исаака Ньютона называлась «Математические начала…»». Здесь принципиально важно, чтобы следующим словом было »натуральной философии» (это единственный правильный ответ), поэтому водяному знаку не на чем будет отразиться. То же самое касается и вычитывания текста. Если вы дадите Claude текст и попросите его исправить только грамматику и пунктуацию и больше ничего, водяной знак сможет проявиться лишь в считанных исправлениях, которых может оказаться слишком мало для регистрации.
Что делать в случаях, когда Claude вычитывал или редактировал текст человека?
Водяной знак применяется только к тем словам, которые выбирает Claude. Когда Claude вычитывает текст, написанный человеком, возвращаемый им результат, как правило, отредактирован лишь незначительно; поскольку почти все слова принадлежат человеку, водяному знаку практически не за что зацепиться (если вообще за что-то). В зависимости от длины текста и степени его редактирования Claude, эти изменения могут оказаться недостаточными для того, чтобы участие Claude стало заметным. Чем больше пишет Claude, тем больше решений ему приходится принимать и тем больше пространства остается для водяного знака.
Как насчет кода?
Как мы отмечали выше, водяные знаки ИИ используют те случаи, когда любой из вариантов выбора слова будет одинаково хорош. Там, где требуется точный результат — где нет выбора, и в случае выбора другого термина текст будет содержать фактическую ошибку или фрагмент кода перестанет работать, — водяной знак не применяется.
Например, после того как модель написала »2 + 2 =», существует вполне очевидный лучший выбор для следующего токена (если модель выполняет сложение, нет ответа, который был бы так же хорош, как »4»; если речь идет о романе Джорджа Оруэлла »1984», нет ответа, который был бы так же хорош, как »5»). «Подсказка» водяного знака здесь применена не будет. По той же причине в коде, который в очень многих случаях должен быть точным, водяных знаков обычно меньше, чем в других формах текста.
Тем не менее, в тех областях, где в коде действительно есть произвольный выбор между конкретными словами или терминами, водяной знак может использоваться — например, в комментариях внутри кода. Но по определению он окажет пренебрежимо малое влияние на создаваемый код.
Что это значит для пользователей?
Замедляет ли это работу модели или делает ее дороже?
Нет. Нанесение водяных знаков оказывает пренебрежимо малое влияние на скорость работы моделей, а поскольку оно не создает дополнительных токенов, стоимость обслуживания и использования модели остается прежней.
Можно ли отследить водяной знак до меня или моей организации?
Нет. Водяные знаки применяются к Claude и его выводу. Они никак не идентифицируют отдельных пользователей. В водяном знаке или его ключе нет ничего, что позволило бы кому-либо получить любую информацию о пользователе, его организации или его чатах с Claude.
Почему вы добавляете водяные знаки в результаты работы Claude?
Мы внедряем водяные знаки, чтобы соблюдать Закон ЕС об искусственном интеллекте. Компания Anthropic вместе с несколькими другими крупными разработчиками моделей ИИ и примерно 190 подписантами в общей сложности в июле 2026 года подписала Кодекс практики ЕС по прозрачности контента, сгенерированного ИИ. Это требует от провайдеров систем ИИ использовать методы «маркировки» текста, сгенерированного искусственным интеллектом. Мы применяем водяные знаки глобально с момента запуска, поскольку у нас пока нет надежного способа ограничить их действие по регионам. Тем не менее, мы продолжим оценивать различные подходы и будем делиться обновлениями по мере их появления.
Другие вопросы
Как проверить, написан ли фрагмент текста Claude?
Мы выпускаем API обнаружения в режиме закрытого предварительного просмотра. В настоящее время он доступен соответствующим требованиям организациям в соответствии с требованиями законодательства ЕС (таким как регулирующие органы, правоохранительные органы, СМИ, фактчекеры, независимые исследователи, образовательные организации и группы гражданского общества ЕС). Он также доступен для предприятий, которые аналогичным образом обязаны проверять наличие водяных знаков для соблюдения Закона. Мы планируем со временем расширить доступ к API обнаружения. Вы можете заявить о своем интересе к получению доступа здесь.
Как насчет изображений и других файлов?
Когда Claude создает файл поддерживаемого типа (например, .png, .jpg или .svg), он прикрепляет учетные данные контента (content credential) в виде небольшой криптографически подписанной заметки в метаданных файла, в которой говорится, что файл был создан или обработан с помощью Claude. Это открытый отраслевой стандарт под названием C2PA — тот же самый, который используют производители фотоаппаратов и программное обеспечение для редактирования фотографий для фиксации происхождения изображения. Любой инструмент с поддержкой C2PA может прочитать его; мы предоставим собственный сервис, куда вы сможете перетащить файл для проверки.
Эта метка метаданных сильно отличается от водяного знака. Ничего в самом файле не меняется — она не внедряется и не скрывается. Как и в случае с текстом, учетные данные лишь указывают на то, что Claude участвовал в создании файла; они не содержат никакой идентифицирующей информации.
Разве нельзя просто отредактировать текст, чтобы обойти водяной знак?
В определенной степени да. Легкое редактирование, вероятно, не удалит водяной знак полностью;, а вот полная переработка, при которой заменяется каждое слово — удалит. В последнем случае, конечно, можно поспорить, можно ли вообще называть такой текст сгенерированным ИИ.
Что на самом деле доказывает водяной знак?
Водяной знак может лишь установить, что Claude, вероятно, в какой-то момент участвовал в работе с контентом. Он не может отличить утверждение «это написал Claude» от «Claude это серьезно отредактировал».
Применяются ли водяные знаки к переводимому тексту?
Да. Перевод, выполненный Claude, содержит водяной знак, поскольку в данном случае каждое слово выбирается Claude.
Как насчет более старых моделей Claude?
Закон ЕС предусматривает переходный период для моделей Anthropic, выпущенных до 2 августа 2026 года, и мы работаем над добавлением водяных знаков и для этих моделей. Это будет внедрено в ближайшие месяцы.
Чем это отличается от программ обнаружения ИИ, таких как Pangram?
Программное обеспечение для обнаружения ИИ использует другой метод, поскольку компании-разработчики не имеют нашего ключа. Помимо прочего, эти сервисы анализируют такие аспекты текста, как тонкие (и не очень тонкие) «маячки», которые часто появляются в формулировках ИИ. Например, модели ИИ, судя по всему, любят конструкцию «это не [X], это [Y]» и используют слово «тихо» (quietly) гораздо чаще, чем можно было бы ожидать. Выявление таких паттернов кардинально отличается от проверки на наличие водяного знака.
Меняет ли это то, кому принадлежит данный результат или кто несет за него юридическую ответственность?
Нет. Водяной знак помогает лишь проверить, мог ли Claude создать или обработать контент. Он ничего не говорит о праве собственности или авторстве и не изменяет права пользователя в соответствии с нашими условиями. Мы применяем водяной знак только тогда, когда Claude участвовал в обработке контента или файла.
Обновлено 1 сентября 2026 г.: добавлена актуальная информация об API обнаружения водяных знаков.
Примечания
- Или, можно сказать, нубилосный, что также является синонимом слова «малоизвестный» (применительно к облачности — пасмурный).
- Число пи технически предсказуемо, но любая последовательность цифр где-то из середины пи неотличима от серии бросков десятигранного кубика. Кроме того, опустим тот факт, что кубики в «Монополии» имеют значения от 1 до 6, в то время как цифра пи может быть от 0 до 9; аналогия не идеальна.
Полный текст статьи читайте на Anthropic прочитано 621 раз
