
Anthropic теперь прячет водяной знак в каждом тексте, который пишет Claude. Читатели не могут его увидеть, и он остаётся на месте, когда кто-то копирует текст в другое место.
Новые модели несут метку по всему миру. Anthropic также говорит, что инструменты обнаружения для пользователей и сторонних лиц появятся следом.
Как работает водяной знак Claude
Anthropic применяет метку на уровне модели. Поэтому она путешествует вместе с выводом из API, приложений Claude и Claude Code.
Охват также включает Claude Cowork, файлового и задачного агента Anthropic для общей офисной работы. Claude Tag, помещающий модель внутрь Slack, тоже несёт метку.
То же касается моделей Claude, доступных через AWS, Google Cloud и Microsoft Foundry. Регион также не имеет значения. Anthropic не опубликовала свой метод. Однако публичные исследования по водяным знакам в тексте указывают на подход «зелёного списка».
Эта техника разбивает словарь на зелёный список и красный список на каждом слове. Предыдущее слово задаёт разбиение, поэтому паттерн выглядит случайным для читателя.
Модель затем склоняется к зелёным словам, а не выбирает их по правилу. Детектор считает их и проверяет, превышает ли доля случайность. Эта конструкция объясняет два пробела, которые отмечает Anthropic. Короткие отрывки содержат слишком мало слов для надёжного подсчёта. А перефразирование тем временем заменяет зелёные слова.
Файлы идут другим путём. Сгенерированные файлы .svg, .png и .jpg несут подписанные метаданные о происхождении по открытому стандарту C2PA, который также сигнализирует о подделке.
Чего пользователям Claude ждать дальше
Более старые модели получат маркировку в переходный период. Это обновление охватывает будущий вывод, а не тексты, которые эти модели уже произвели. Так что ничто, написанное до появления маркировки, не станет отслеживаемым позже. Ретроактивная маркировка старых документов лежит за пределами плана.
Обнаружение находится в центре развёртывания. Anthropic пообещала инструменты для пользователей и третьих сторон, с деталями в предстоящей технической документации. Совпадение будет означать меньше, чем предполагают многие читатели. Оно сигнализирует, что контент, возможно, был обработан Claude, не более того.
Люди также используют модель, чтобы вычитывать, переводить и резюмировать собственные тексты. Поэтому размеченный документ не является доказательством списывания.
Правила за этим изменением исходят из Закона ЕС об ИИ. Anthropic подписала Кодекс практики по прозрачности сгенерированного ИИ контента (статья 50(2)), который вступил в силу 2 августа 2026 года. Регуляторы в других местах выбрали более грубые инструменты, и Китай этим летом удалил 14 000 ИИ-продуктов.
Послужной список Anthropic сформирует то, насколько пользователи будут доверять системе. Компания ранее раскрыла три случая, когда Claude получал несанкционированный доступ во время оценок. Судья также принял сканирование книг для обучения.
Отпор вероятен, поскольку изменения моделей вызывали его прежде, как показала реакция на защитные ограждения Fable 5. Однако немногие разработчики покинут модель, которая всё ещё лидирует в конкурентных бенчмарках по кодингу. Внедрение, вероятно, поглотит это изменение тихо.
Системы, уже присутствующие на рынке, должны прийти в соответствие до 2 декабря 2026 года. Пока детектор не выйдет, водяной знак остаётся молчаливым пассажиром.
Источник: BeInCrypto





