Anthropic внедряет маркировку текста, созданного Claude, для соблюдения законов ЕС
Компания Anthropic рассказала о том, как она добавляет водяные знаки в текст, генерируемый ИИ Claude, чтобы соответствовать новым правилам Европейского союза в отношении прозрачности искусственного интеллекта. В компании заявили, что текстовые водяные знаки не будут иметь видимых визуальных элементов, окажутся неотличимыми для читателей и не приведут к добавлению скрытых символов в текст. Вместо этого метод Anthropic предполагает внедрение в текст паттерна, расшифровать который сможет только тот, у кого есть специальный ключ.
В компании пояснили, что большие языковые модели при генерации текста выбирают по одному слову за раз, подбирая его из списка потенциально подходящих вариантов. Они выбирают слова случайным образом, если те подходят по контексту создаваемого материала. При включенной маркировке Claude вместо произвольного генератора случайных чисел будет использовать ключ для выбора следующего слова.
В качестве примера Anthropic использовала цифры числа пи в качестве ключа. Допустим, ключ начинается с цифры 2 из последовательности пи 3,1415926535. Следующее сгенерированное слово является шестым в списке вариантов, затем пятым, третьим и снова пятым. Этот метод представляет собой адаптацию подхода Google DeepMind к маркировке текста SynthID-Text, описанного командой разработчиков в статье, опубликованной в журнале Nature. По словам представителей компании, водяные знаки не влияют на качество вывода Claude и не замедляют его работу, а также не потребуют дополнительных токенов и не удорожат процесс генерации.
Конечно, у прозаических текстов, созданных ИИ, обычно есть свои маркеры. Модели любят использовать определенные синтаксические конструкции, например, «это не [X], это [Y]». Однако этих признаков достаточно лишь для того, чтобы понять, что к созданию текста приложил руку искусственный интеллект, но не для определения конкретной использованной модели. Anthropic выпустит API, содержащий «ключи» для расшифровки водяных знаков Claude, с помощью которого можно будет определить, был ли этот блок текста сгенерирован данным ИИ.
Anthropic признает, что ее метод маркировки текста имеет ограничения. Он не позволяет определить, написал ли Claude текст с нуля или просто отредактировал его, а это значит, что если вы попросите ИИ отредактировать что-либо, этот материал также будет помечен водяным знаком. Как поясняют в компании, можно лишь с уверенностью утверждать, что Claude в какой-то момент участвовал в работе над текстом. Водяными знаками будут снабжаться даже переводы. Если Claude занимался только вычиткой и легкой правкой текста, или если текст слишком короткий, водяной знак может оказаться недостаточно заметным. Стоит отметить, что легкое редактирование текста, созданного Claude, вероятнее всего, не удалит водяной знак. Если вы хотите быть уверены в этом, вам придется переписать его полностью.
Существуют определенные опасения по поводу того, как водяные знаки повлияют на программный код, поскольку без значительного участия человека он может не подлежать защите авторским правом. Если бы кто-то смог доказать, что вся кодовая база была сгенерирована ИИ, он мог бы скопировать ее и в дальнейшем дорабатывать. Тем не менее, в Anthropic отметили, что в коде «обычно содержится меньше водяных знаков, чем в других формах текста», поскольку он, как правило, требует точного результата. Если при генерации текста нет вариантов выбора, то водяной знак применить невозможно.
Anthropic также будет добавлять водяные знаки на изображения, внедряя в их метаданные криптографически подписанную отметку о том, что они были созданы Claude. В своем анонсе компания заявила, что внедряет водяные знаки для всех результатов работы Claude уже на этапе запуска, поскольку у нее нет надежных способов реализации этих изменений с привязкой к конкретным регионам. Изменения затронут материалы, создаваемые во всех продуктах Claude, которые используют модели, выпущенные после 2 августа. В ближайшие месяцы Anthropic также добавит функцию маркировки для более старых моделей Claude.