Claude начнёт оставлять невидимые водяные знаки в текстах — но это не детектор ИИ
Как работает новая технология Anthropic и узнает ли кто-нибудь, что вы попросили нейросеть написать статью
Anthropic добавит в ответы будущих моделей Claude невидимый водяной знак. Его нельзя увидеть глазами, но специальный инструмент сможет оценить вероятность того, что текст был создан или существенно отредактирован Claude.
Компания объясняет нововведение требованиями европейского законодательства об ИИ. При этом Anthropic обещает, что водяной знак не повлияет на качество текста, не добавит в него скрытые символы и не позволит узнать, кто именно пользовался нейросетью.
Звучит так, будто теперь каждый текст будет ходить с невидимым паспортом. Но на деле всё немного скучнее — и гораздо интереснее.
Что объявила Anthropic
14 августа Anthropic подробно рассказала, как будет работать маркировка текста Claude. Компания планирует использовать технологию, основанную на подходе SynthID-Text, который ранее описала Google DeepMind.
Водяной знак появится в новых моделях Claude. Для старых моделей Anthropic обещает добавить такую возможность в течение переходного периода, предусмотренного европейскими правилами.
Компания также собирается выпустить API для проверки маркировки. Пока подробности о нём не раскрыли: разработчики ещё определяют, как именно сервис будет работать и кому предоставят доступ.
Важно: речь идёт не о видимой приписке вроде «текст создан ИИ». Читатель не увидит ни специального значка, ни странного шрифта, ни набора невидимых символов.
Как работает водяной знак
Большие языковые модели создают текст по одному фрагменту за раз. Каждый раз Claude выбирает следующий наиболее подходящий вариант из нескольких возможных.
Например, фраза может звучать так:
Сегодня погода была холодной и пасмурной.
Но вместо слова «пасмурной» модель могла выбрать «серой», «облачной» или «прохладной». Смысл предложения при этом почти не изменился.
Именно такие малозначительные решения Anthropic использует для маркировки.
Claude не начинает специально вставлять в текст определённые слова. Он не будет внезапно писать «пасмурно» через каждые три предложения и добавлять в каждый абзац «важно отметить». Модель просто использует другой источник случайности при выборе между примерно одинаковыми вариантами.
Если знать специальный ключ, можно проверить длинную последовательность слов и оценить, похожа ли она на текст, созданный Claude.
Anthropic сравнивает это с игрой в «Монополию». Обычно игроки бросают кубик, чтобы определить, на сколько клеток передвинуть фишку. Но представим, что вместо кубика используется последовательность цифр числа пи.
Для игроков результат по-прежнему выглядит случайным. Однако человек, знающий эту последовательность, может посмотреть на все ходы и проверить, действительно ли использовались цифры пи.
С текстом происходит примерно то же самое: для читателя ничего не меняется, но специальная проверка может заметить закономерность.
Можно ли увидеть метку
Нет. По словам Anthropic, водяной знак неотличим от обычного текста для человека.
Компания также заявляет, что маркировка:
- не добавляет в текст скрытые символы;
- не требует дополнительных токенов;
- не замедляет работу модели заметным образом;
- не увеличивает стоимость использования;
- не снижает качество и читаемость ответов;
- не содержит данных о пользователе, компании или чате.
То есть у текста не появится невидимый QR-код, который можно достать из буфера обмена и торжественно предъявить редактору.
Метка существует как статистический рисунок в выборе слов. Без специального ключа и инструмента обнаружить её практически невозможно.
Это не полноценный детектор ИИ
Здесь начинается самая важная часть.
Водяной знак не сможет доказать, что весь текст написал Claude. Он показывает только вероятность того, что Claude участвовал в создании или обработке материала.
Это разные вещи.
Если автор попросил Claude написать статью целиком, вероятность обнаружения будет выше. Модель выберет большое количество слов, и в тексте накопится больше материала для статистической проверки.
Если автор написал статью сам, а потом попросил Claude исправить пару запятых, водяному знаку будет почти не за что зацепиться. В таком тексте большинство слов выбрал человек, а не модель.
Anthropic отдельно подчёркивает несколько ограничений:
- на коротких фрагментах маркировка работает хуже;
- в фактических предложениях водянку сложнее разместить;
- код обычно содержит меньше метки, потому что многие элементы в нём должны быть точными;
- перевод, наоборот, будет маркироваться сильнее, поскольку Claude выбирает практически каждое слово;
- полная переработка текста может убрать исходный водяной знак.
Иными словами, проверка не ответит на вопрос: «Это написал человек или робот?»
Она скорее ответит на более узкий вопрос:
«Есть ли признаки того, что Claude участвовал в создании этого текста?»
Это не одно и то же.
Что будет после редактуры
Представим несколько сценариев.
Claude написал весь текст
В этом случае водяной знак, скорее всего, будет заметнее для специального инструмента. Чем длиннее материал и чем больше слов выбрала модель, тем выше вероятность обнаружения.
Автор попросил улучшить стиль
Если Claude переписал большую часть предложений, маркировка может сохраниться. Даже если исходная идея принадлежала человеку, итоговый текст уже во многом создан моделью.
Claude исправил ошибки
Если нейросеть поправила только орфографию и пунктуацию, водяной знак может оказаться слишком слабым для уверенного определения. Большинство слов останется человеческими, а количество решений Claude будет небольшим.
Автор полностью переписал текст
Полная переработка способна убрать исходную метку. Но тут возникает философский вопрос: можно ли называть такой материал текстом, созданным ИИ, если от исходника осталась только идея?
На этот вопрос технология не отвечает. Она умеет искать статистический след, но не умеет разбираться в авторском праве и творческом вкладе.
Что с изображениями и файлами
Для изображений и других файлов Anthropic использует не такой же водяной знак, как для текста.
Если Claude создаёт или обрабатывает файл поддерживаемого типа, например PNG, JPG или SVG, в его метаданные добавляется криптографически подписанное подтверждение происхождения. Оно основано на открытом стандарте C2PA, который также используют производители камер и программы для редактирования изображений.
Такое подтверждение может сообщать, что файл был создан или обработан с помощью Claude. Но оно не содержит имя пользователя, данные организации или информацию о конкретном чате.
При этом метаданные можно удалить при пересохранении файла, загрузке на некоторые платформы или обработке в графическом редакторе. Поэтому это тоже не вечная печать на изображении, а скорее запись о происхождении файла, если программа её сохранила.
Зачем это нужно
Anthropic связывает маркировку с европейским законодательством об искусственном интеллекте.
Компания и другие крупные разработчики подписали европейский кодекс прозрачности контента, созданного ИИ. По словам Anthropic, он предусматривает использование способов, которые позволяют отмечать материалы, созданные генеративными моделями.
Но у технологии есть и более широкие причины.
В интернете становится всё больше материалов, которые сложно отличить друг от друга:
- новостные заметки;
- рекламные тексты;
- изображения;
- переводы;
- комментарии;
- документы;
- учебные работы.
Если у платформ появится инструмент проверки происхождения, они смогут использовать его для модерации, маркировки или дополнительной проверки контента.
Например, редакция сможет понять, что автор применял Claude при подготовке материала. Университет — проверить, использовалась ли нейросеть при написании работы. Компания — отслеживать происхождение рекламных текстов.
Но именно здесь возникает риск злоупотреблений.
Если водяной знак трактовать как безошибочное доказательство авторства, человек может получить обвинение только потому, что использовал Claude для редакторской правки. Anthropic сама подчёркивает: маркировка показывает участие модели, но не определяет долю этого участия.
Что это значит для авторов
Для копирайтеров и контент-мейкеров почти ничего не изменится, если использовать Claude как редактора, помощника для идей или инструмента проверки структуры.
Но рабочий процесс станет прозрачнее. Теперь важно понимать разницу между такими задачами:
- попросить ИИ предложить план;
- попросить его найти слабые места;
- отдать ему собственный текст на корректуру;
- поручить полностью написать материал;
- опубликовать результат без проверки и редактуры.
Во всех случаях нейросеть используется по-разному, но техническая проверка может не увидеть эту разницу.
Поэтому автору стоит сохранять:
- исходные заметки;
- черновики;
- ссылки на источники;
- собственные версии текста;
- историю существенных правок.
Это не значит, что теперь нужно фотографировать каждый промпт и хранить его в сейфе рядом с паспортом. Но если статья важна для работы, репутации или публикации, история создания может пригодиться.
Особенно если автор написал основную часть самостоятельно, а Claude использовал только для редакторской помощи.
Главное
Claude начнёт добавлять в новые тексты невидимый статистический водяной знак. Он не будет заметен читателю, не изменит качество ответа и не позволит установить личность пользователя.
Специальная проверка сможет оценить вероятность участия Claude, но не ответит на все вопросы сразу. Она не определит точное авторство, не покажет долю работы нейросети и не докажет, что весь текст написан искусственным интеллектом.
Если Claude написал материал целиком, вероятность обнаружения будет выше. Если он только исправил несколько ошибок, маркировка может оказаться слишком слабой. А если текст полностью переписали, исходный водяной знак может исчезнуть.
Так что это не цифровой детектор лжи и не секретный способ разоблачать каждого автора. Скорее, это новая система происхождения контента — попытка оставить в тексте технический след, не мешая людям его читать.
Claude теперь сможет оставить автограф. Но признаться в авторстве всё равно не сможет.