Anthropic заявила, що вбудовуватиме водяні знаки в текст, який генерують моделі родини Claude. За даними TechCrunch, компанія приєднується до Google DeepMind, яка ще у 2024 році відкрила код SynthID для тексту, та OpenAI, що також тестує подібні механізми для GPT-моделей.

Ідея не нова — індустрія вже кілька років шукає спосіб відрізнити текст людини від тексту нейромережі. Але досі жоден провайдер такого масштабу не впроваджував текстове водяне знакування як стандартну функцію продакшн-моделі рівня Claude. Це радше сигнал регуляторам і корпоративним клієнтам, ніж технологічний прорив.

Для AI-білдерів новина цікава не самим фактом маркування, а тим, що воно означає на практиці: чи справді можна надійно довести походження тексту, і чи не з'явиться нова хвиля хибних звинувачень у плагіаті на основі недосконалого детектора.

Що саме анонсувала Anthropic?

Компанія підтвердила намір позначати текстовий вивід моделей Claude водяними знаками, які теоретично дозволяють згодом визначити, чи згенерований контент цією системою. TechCrunch не розкриває повний технічний опис, тож деталі — які саме моделі, чи можна вимкнути функцію в API, чи буде публічний детектор — поки залишаються відкритими.

Показово, що крок збігається з посиленням вимог до розкриття синтетичного контенту в ЄС (AI Act) та ширшою хвилею позовів проти AI-компаній за використання захищених текстів у тренуванні. Водяний знак — це і технічна функція, і юридичний аргумент «ми зробили свою частину роботи».

Як працює текстове водяне знакування під капотом?

На відміну від зображень, де знак можна вшити у пікселі, у тексті немає «зайвого» простору для прихованих даних — кожен символ несе смисл. Тому галузевий стандарт, застосований у SynthID та описаний ще в дослідженні Кірхенбауера й співавторів (2023), працює інакше:

Знак не видимий людині й не змінює сенсу тексту — це статистична закономірність, яку можна виявити лише спеціальним детектором з доступом до тих самих параметрів моделі.

Чи справді це зупинить плагіат і фейки?

Ні, і це головна практична проблема підходу. Статистичний сигнал слабкий і легко руйнується: переказ своїми словами, переклад в інший бік і назад, ручне редагування або пропускання тексту через іншу модель нівелюють водяний знак майже повністю. Ми вже розбирали механіку цих обхідних шляхів у матеріалі чому водяні знаки Claude не зупинять плагіат тексту — і нова заява Anthropic цю проблему не вирішує, а лише формалізує намір.

Другий бар'єр — короткі тексти. Для надійного статистичного виявлення потрібно приблизно 200–300 токенів; заголовок, репліка в чаті чи короткий пост залишаються практично невиявними. Третій — хибні спрацювання: досвід академічних детекторів штучного тексту 2023 року (Turnitin та подібні) показав, що вони систематично помилково позначали тексти носіїв інших мов і людей із специфічним стилем письма як «згенеровані ШІ».

Що це означає для AI-білдерів?

Якщо продукт викликає Claude через API, водяний знак не змінює якість чи латентність відповіді — він працює непомітно на рівні токенів. Але є практичні наслідки, які варто врахувати вже зараз:

Висновок AiiN

Водяні знаки Claude — це передусім комунікаційний і комплаєнс-хід, а не робочий інструмент проти плагіату. Anthropic отримує аргумент для регуляторів і корпоративних клієнтів («ми технічно позначаємо вивід»), тоді як реальна ефективність виявлення падає до практично нуля вже після легкого перефразування. AI-білдерам варто ставитися до цієї функції як до одного з кількох слабких сигналів походження контенту, а не як до фінального арбітра в спорах про авторство чи плагіат.

Чи можна обійти водяний знак Claude?

Так, переказ тексту своїми словами, переклад туди-назад або редагування вручну суттєво знижують статистичний сигнал і роблять виявлення ненадійним, особливо для коротких фрагментів.

Чи вплине водяний знак на якість тексту Claude?

За задумом — ні: механізм лише злегка зміщує ймовірності вибору токенів у межах природного розподілу мови, тож користувач не повинен помітити різниці в стилі чи змісті відповіді.

Де перевіряти, чи текст згенеровано Claude?

Публічного детектора від Anthropic на момент анонсу TechCrunch не описав — доки компанія не відкриє окремий інструмент перевірки, незалежно підтвердити наявність знаку користувачі не зможуть.