Anthropic 11 серпня 2026 року почала вбудовувати приховані водяні знаки в кожен текст, який генерує Claude — і через чат claude.ai, і через API. За даними AIN.ua, мета — захистити авторські права та ускладнити плагіат згенерованого контенту.
Проблема, яку намагається закрити Anthropic, не нова: з моменту масового поширення LLM видавці, університети та платформи для фрилансу роками просять надійний спосіб відрізнити текст людини від тексту моделі. Класифікатори на кшталт OpenAI Classifier, закритого ще 2023 року через низьку точність, провалилися саме тому, що аналізували готовий текст постфактум, без жодного маркера, вбудованого під час генерації.
Водяний знак у Claude працює інакше — він з'являється не після, а в момент генерації, і в цьому головна відмінність підходу.
Що конкретно змінюється в роботі Claude?
Тепер кожен фрагмент тексту, згенерований Claude, несе статистичний відбиток, який Anthropic може верифікувати окремим інструментом. Водяний знак не видно оку: форматування, орфографія і стиль тексту лишаються незмінними, змінюється лише розподіл ймовірностей на рівні токенів під час семплінгу.
Це не перший подібний крок індустрії: Google DeepMind з 2023 року маркує зображення й відео через SynthID, а з 2024-го поширює цей підхід на текст у Gemini. Anthropic фактично наздоганяє конкурента, але робить ставку саме на копірайт і плагіат як рамку подачі, а не на боротьбу з дезінформацією.
Як приховати водяний знак у звичайному тексті технічно?
В основі — техніка зсуву ймовірностей токенів (token-level watermarking), схожа на схему, яку 2023 року описала команда дослідників з University of Maryland: перед генерацією кожного токена модель ділить словник на «зелений» і «червоний» список на основі криптографічного ключа, прив'язаного до попереднього токена, і злегка підвищує ймовірність вибору токенів із «зеленого» списку. Людське око різниці не бачить, а власник ключа статистично визначає, що текст походить від конкретної моделі. Докладніше про появу цього механізму в Claude AiiN уже писав у матеріалі про невидимий водяний знак в Claude.
Слабке місце підходу — стійкість. Перефразування іншою моделлю, переклад туди-назад або ручне редагування понад 20-30% тексту статистично «змиває» відбиток, і детектор вже не дає впевненого висновку. Тобто йдеться не про непроникний захист, а про підвищення вартості обходу — досить високої, щоб зупинити масовий плагіат, але не досить, щоб зупинити цілеспрямованого зловмисника.
Кому і навіщо це знадобиться вже зараз?
Найбільше від watermarking виграють ті, хто перевіряє чужий контент на масштабі:
- Видавці та агрегатори — щоб фільтрувати AI-генеровані прес-релізи й рерайти, видані за оригінальні матеріали;
- Освітні заклади — для перевірки есе та наукових робіт без сліпої довіри до сторонніх детекторів;
- Платформи для фрилансу та контент-маркетплейси — щоб позначати автоматично згенеровані тексти в лістингах;
- Юридичні команди — як додатковий доказ походження тексту в спорах про авторське право;
- Модератори контенту на платформах з AI-політиками (на кшталт правил Google щодо неоригінального масово згенерованого контенту) — як додатковий сигнал поруч із класифікаторами.
Для AI-білдерів, які будують продукти на Claude API — від чат-ботів до автоматизованих сервісів написання статей — головний практичний наслідок інший: тепер вихідний текст продукту технічно відстежуваний до моделі-джерела, навіть якщо про це не сказано користувачу. Якщо продукт видає контент клієнту як «написаний людиною» або обходить політику платформ щодо розкриття AI-походження, водяний знак створює ризик викриття, якого раніше не було.
Висновок AiiN
Watermarking у Claude — це не стільки захист авторів від плагіату, скільки страховка самої Anthropic від регуляторного тиску: у ЄС AI Act і аналогічні ініціативи в США все частіше вимагають від розробників фронтир-моделей мати спосіб довести походження згенерованого контенту. Для бізнесів, що будують продукти поверх Claude, розумніше вже зараз закладати прозоре розкриття AI-походження контенту в UX, ніж покладатися на те, що водяний знак ніхто не перевірить — детектори на кшталт SynthID і подібних інструментів Anthropic з часом стануть таким же стандартним кроком перевірки, як зараз перевірка на плагіат через Turnitin.
Чи можна видалити водяний знак із тексту Claude?
Повністю й надійно — ні, точковим редагуванням чи форматуванням. Але суттєве перефразування іншою моделлю або ручне переписування великої частки тексту статистично послаблює відбиток настільки, що детектор перестає давати впевнений результат.
Чи впливає watermarking на якість тексту Claude?
Anthropic заявляє, що зсув ймовірностей токенів налаштований настільки м'яко, що не позначається на зв'язності чи стилі відповіді. Це узгоджується з дослідженнями аналогічних схем: за помірного налаштування ключа watermarking майже не відчутний у звичайному використанні.