Водяные знаки в текстах от ИИ: как это работает и что это значит
Ключевые тезисы:
Водяной знак — это не добавленные символы, а особый выбор слов моделью, который можно проверить с помощью секретного ключа.
Его внедрение — это законодательное требование ЕС (с августа 2026), ставшее мировым стандартом.
Знак работает, подменяя генератор случайных чисел в процессе выбора следующего слова, не ухудшая качество текста.
Он не доказывает авторство (ни ИИ, ни человека), а лишь указывает на вероятное участие модели.
Детектор имеет три состояния: «есть», «нет» и «не уверен» — это честнее, чем бинарные детекторы стиля.
Зачем это нужно? Закон, а не инициатива
Это не фича компании, а compliance (соответствие закону). С августа 2026 года в Евросоюзе действует требование помечать сгенерированный контент машиночитаемым способом. Под «Кодексом практики по прозрачности» подписались около 190 участников, включая Anthropic (создателей Claude). Закон ЕС де-факто стал глобальным стандартом.
Как это работает? (И чем это НЕ является)
Это НЕ:
- Невидимые символы (нулевой ширины) — их легко обнаружить и удалить.
- Метаданные файла — для текста этот механизм не используется (но используется для изображений).
- Анализ стиля — это не «гадание по почерку» модели, а проверка по криптографическому ключу.
Это — подмена «кубика» случайности.
- Нейросеть генерирует текст по частям, на каждом шаге выбирая следующее слово из списка вероятных кандидатов (например, «пасмурной» или «серой»).
- Окончательный выбор обычно делает генератор случайных чисел.
- Водяной знак подменяет этот генератор на детерминированную функцию, которая вычисляет «случайное» число на основе секретного ключа и предыдущих слов.
- Выбор по-прежнему выглядит естественным, но становится воспроизводимым для того, у кого есть ключ.
Аналогия с числом Пи:
Можно играть в «Монополию», используя для ходов не кубик, а последовательные цифры числа Пи. Игра будет выглядеть абсолютно случайной, но, имея запись ходов и число Пи, можно доказать, что использовалась именно эта книга.
Техническая сторона: SintID (Google DeepMind)
- Технология называется SintID (разработка Google DeepMind). Anthropic использует её версию.
- Это logits processor, который работает после этапов фильтрации (top-K, top-P), то есть только с лучшими, «финальными» кандидатами.
- Он устраивает между кандидатами «турнир»: специальная функция (g-функция) на основе ключа и предыдущих слов вычисляет для каждого слова число. Слово с лучшим «числом» побеждает.
- Не требует переобучения модели — это конфигурация, передаваемая в метод генерации. Код открыт.
- Ключ — это всё. Его утечка позволяет подделать или стереть знак.
Как ловят знак? Детектор с тремя состояниями
Детектор не выносит бинарный приговор. У него три вывода:
- Водяной знак есть.
- Водяного знака нет.
- Не уверен (недостаточно данных).
Между состояниями есть настраиваемые пороги. Это честный подход, в отличие от детекторов стиля, которые выдают «уверенные» проценты там, где уверенности быть не может.
Где и почему система ломается?
- Короткие тексты — мало выборов, мало сигнала (твит не поймать, статью — можно).
- Фактические тексты — там, где есть только один правильный вариант, знаку не за что зацепиться (например, «2+2=4»).
- Код — помечается слабо, так как в синтаксисе часто нет вариантов выбора. Знак может быть только в комментариях.
- Вычитка и редактура — если модель только правит ваш текст, знак ставится лишь на внесённые правки, его может быть недостаточно для детекции.
- Полная перепись текста — если заменить каждое слово, знак уничтожается. Но тогда возникает философский вопрос: можно ли такой текст считать сгенерированным?
А как с файлами (картинками)?
Для файлов используется совершенно другой механизм — стандарт C2PA (криптографически подписанные метаданные в файле).
- Аналогия: Водяной знак в тексте — это акцент в речи. C2PA у файла — это паспорт в кармане. Паспорт можно выкинуть (пересохранить, сделать скриншот), и метаданные исчезнут.
Что это значит для пользователей? Хорошие новости
- Нет слежки: В метке нет информации о пользователе, только о модели.
- Цена и скорость: Не влияет на стоимость генерации (токены не добавляются) и почти не влияет на скорость.
- Права на контент: Не меняет юридический статус сгенерированного текста (вопрос авторства остаётся открытым).
- Тотальное покрытие: Знак ставится на уровне модели, поэтому он есть везде (API, веб-интерфейс и т.д.).
Главный вывод: Что знак ДОКАЗЫВАЕТ, а что — НЕТ?
- Если знак найден: Это доказывает только, что модель (например, Claude) вероятно была причастна к созданию текста. Она могла написать его с нуля, отредактировать или перевести. Это не доказывает, что человек не писал.
- Если знак не найден: Это ничего не доказывает. Текст мог быть создан старой моделью, другой нейросетью, его могли переписать или он может быть слишком коротким.
Водяной знак — это не инструмент обвинения, а инструмент прозражности происхождения.
Будущее: от детекции к происхождению
Мир переходит от идеи «ловить ИИ-тексты» к идее «подтверждать происхождение контента» (как камеры подписывают снимки).
- Парадокс: Мы создаём инфраструктуру, которая может (с оговорками) доказать участие ИИ. Но технологии, которая могла бы доказать участие человека, не существует. В будущем именно это может стать самым ценным.
- Вопрос власти: Ключи для чтения знаков будут только у компаний и, возможно, регуляторов. Кому и на каких условиях их будут выдавать — станет большим политическим сюжетом.