OpenAI вмикає невидимий водяний знак textGrain у ChatGPT і Codex для користувачів з Євросоюзу протягом найближчих тижнів.

Для команд, що працюють з європейським ринком, це означає додатковий шар роботи: маркування згенерованого тексту й обережне трактування його походження. За даними The Decoder, OpenAI відповідає на вимогу AI Act ЄС маркувати згенерований текст у машинозчитуваному форматі.

Як працює textGrain?

Технологія textGrain від OpenAI вбудовує невидимий статистичний сигнал у вибір слів моделі: читач його не бачить, а шукає окремий детектор. Схожий підхід Anthropic застосовує у Claude, де працює SynthID від Google — технологія з відкритим кодом.

За внутрішніми тестами OpenAI, textGrain не поступився іншим методам, зокрема SynthID від Google для тексту. Компанія також планує випустити технологію з відкритим кодом, щоб інші могли на ній будувати. Механізм докладно описано в технічному звіті OpenAI.

Водяний знак у API OpenAI лишається добровільним для клієнтів у всьому світі. У Claude від Anthropic маркування обовʼязкове глобально, незалежно від способу доступу до моделі. Через хмарних партнерів, зокрема Microsoft Azure, водяний знак у API OpenAI також буде доступний протягом найближчих тижнів.

Наскільки надійно детектор знаходить водяний знак?

Точність детектора залежить від довжини й теми тексту. За цільової частки хибних спрацювань 1% він виявив водяний знак приблизно у 95% уривків на 400 токенів про психологію; на 200 токенах цей показник падав до приблизно 80%.

На математичному контенті, де модель має менше свободи у виборі слів, виявлення було «суттєво нижчим», каже OpenAI. Компанія припускає, що довші уривки посилюють статистичний сигнал, але даних для перевірки цього припущення не наводить.

Редагування різко знижує виявлення: заміна лише 10% слів синонімами опускає показник для уривків на 400 токенів приблизно з 92% до 66%, а заміна чверті слів — до 17%, тож мітку легко обійти. Anthropic показників виявлення для свого водяного знака не публікує й обмежується заявою, що система тримається редагувань. За думкою OpenAI, ця слабкість може зіграти на користь компанії: користувачі, яким не потрібно, щоб їхнє використання ChatGPT виявили, можуть перейти на моделі з відкритими вагами.

Що доводить знайдений водяний знак?

Знайдений водяний знак OpenAI підтверджує наявність сигналу й нічого іншого. Він не встановлює авторство, не визначає відповідальність, не розкриває, скільки в тексті людського внеску, і не показує, чи є текст точним.

Відсутність мітки теж нічого не доводить: уривок міг виявитися закоротким, відредагованим або перекладеним чи згенерованим моделлю, яку детектор не підтримує.

Якість відповідей OpenAI теж перевіряла: на фронтирній моделі OpenAI Astra компанія не зафіксувала суттєвої різниці з увімкненим і вимкненим маркуванням на восьми бенчмарках, серед яких GPQA Diamond, BrowseComp і DeepSWE. Ці результати не показують, як водяний знак впливає на якість письма — питання, яке критики ставили і до водяного знака Claude.

Хто отримає доступ до детектора?

Спочатку доступ до детектора textGrain отримають лише відібрані дослідники та профільні організації. Заявки приймають через форму, і кожен випадок OpenAI розглядає окремо за Кодексом практики ЄС. Anthropic іде шляхом подібного обмеженого доступу до API для детекції.

Інструмент повідомляє лише, чи виявив він водяний знак OpenAI, і не розкриває користувачів, їхні промпти чи листування. Обмеження OpenAI пояснює тим, що детектор може хибно спрацювати або пропустити мітку, і обіцяє розширити доступ, «коли результати можна тлумачити відповідально», без конкретних строк. Для зображень і аудіо перевірка лишається публічною: openai.com/verify і Content Provenance API.

Що робити команді з ЄС уже зараз?

Маркування заплановане на найближчі тижні, але більшість кроків не залежать від доступу до детектора.