Anthropic вбудувала у відповіді Claude приховану статистичну позначку — водяний знак (watermark), який дозволяє технічно визначити, що текст згенеровано моделлю, а не людиною. За даними The Decoder, компанія представила цей механізм як інструмент прозорості походження контенту, проте дослідники та практики вже вказують на низку компромісів, які зводять цінність такого підходу до відносної.

Ідея не нова: подібні схеми давно тестують Google (SynthID) та академічні команди на кшталт групи з Меріленду, яка ще 2023 року запропонувала статистичний метод маркування токенів. Anthropic приєднується до цього напрямку в момент, коли регулятори по обидва боки Атлантики — від Каліфорнії до Брюсселя — вимагають від розробників генеративного ШІ якось позначати синтетичний контент.

Але водяний знак у тексті — це не те саме, що прихований підпис у зображенні чи аудіо. Текст легко перефразувати, перекласти або пропустити через іншу модель — і саме тут критики бачать головну слабкість підходу, який Anthropic намагається впровадити.

Як технічно працює водяний знак у тексті LLM?

Механізм спирається на те, як модель обирає наступний токен під час генерації. У класичній схемі статистичного водяного знаку алгоритм ділить словник токенів на дві умовні групи — «дозволену» та «заборонену» — і на кожному кроці генерації трохи підвищує ймовірність вибору токенів із «дозволеної» групи. Для читача текст виглядає абсолютно природним, але статистичний детектор, знаючи ключ розбиття, може з високою ймовірністю визначити, що послідовність токенів не випадкова, а отже — згенерована конкретною моделлю.

Перевага такого підходу — він не потребує окремого сервера метаданих чи цифрового підпису файлу: позначка живе всередині самого тексту. Але саме тому вона крихка: будь-яке суттєве редагування тексту людиною або інший LLM, який перефразовує вивід, руйнує статистичний патерн і робить детекцію ненадійною.

Чому критики сумніваються у цьому підході?

Головна претензія — розрив між заявленою метою (боротьба з дезінформацією та академічним шахрайством) і реальною стійкістю технології. Практики виділяють кілька конкретних проблем:

За суттю ці зауваження зводяться до одного: водяний знак у тексті працює як м'який сигнал імовірності, а не як криптографічний доказ походження — і індустрія поки не виробила спільного стандарту, який зробив би такі позначки взаємосумісними між провайдерами.

Що це означає для тих, хто будує продукти на Claude API?

Для AI-білдерів практичний висновок простий: якщо водяний знак активний за замовчуванням у виводі Claude, варто перевірити, чи не впливає це на сценарії, де текст моделі проходить подальшу автоматичну обробку — наприклад, масову генерацію SEO-контенту, який потім агрегується або оцінюється сторонніми детекторами ШІ-тексту. Ймовірно, для більшості продуктових інтеграцій через API зміна буде непомітною, оскільки маркування розраховане радше на споживчий інтерфейс Claude.ai, ніж на бізнес-логіку сторонніх додатків.

Другий момент — юридичний. Компанії, що будують продукти для регульованих ринків (освіта, медіа, публічний сектор), отримують додатковий аргумент на користь прозорості, але не повинні покладатися на водяний знак Anthropic як на єдиний механізм комплаєнсу: він не покриє контент, відредагований людиною чи прогнаний через інший інструмент.

Висновок AiiN

Водяні знаки для тексту вирішують вузьку задачу — маркування необробленого, «сирого» виводу моделі, — але не вирішують ширшу проблему провенансу контенту в інтернеті, де текст проходить десятки трансформацій до публікації. Наша оцінка: цінність кроку Anthropic — не технічна, а сигнальна: компанія публічно бере на себе відповідальність за походження тексту в момент, коли регулятори тиснуть на всю індустрію, і це радше репутаційна страховка, ніж робочий інструмент детекції ШІ-контенту в масштабі.

Чи можна обійти водяний знак Claude?

Так, теоретично — перефразування, переклад туди-назад або пропускання тексту через іншу модель здатні зруйнувати статистичний патерн і зробити детекцію ненадійною. Це відома вразливість усіх методів token-level watermarking, а не специфічна помилка Anthropic.

Чи впливає водяний знак на якість відповідей Claude?

Розробники подібних схем зазвичай стверджують, що зміщення ймовірностей токенів мінімальне і непомітне для користувача, однак незалежної перевірки впливу саме на Claude поки недостатньо, тож остаточний висновок про якість передчасний.