Близько третини всіх вебсторінок, опублікованих після запуску ChatGPT у листопаді 2022 року, містять ознаки того, що їх написав або суттєво відредагував штучний інтелект. Це висновок нового дослідження, яке проаналізувало масив нового контенту в інтернеті за останні роки. Дослідники не просто порахували частку — вони показали, наскільки швидко AI-генерований текст став нормою, а не винятком, для видавців, копірайтерів і навіть корпоративних блогів.

За даними TechCrunch, дослідники застосували методи детекції AI-тексту до масштабної вибірки сторінок, опублікованих до та після запуску ChatGPT, і зафіксували різке зростання частки контенту з ознаками машинного авторства. Для SEO-фахівців, контент-маркетологів і власників медіа це не абстрактна статистика — це сигнал про те, що пошукова видача, яку вони бачать щодня, вже суттєво відрізняється від тієї, що була кілька років тому.

Скільки саме контенту вже написав AI?

Ключова цифра дослідження — близько третини нових сторінок, опублікованих з моменту запуску ChatGPT, показують ознаки AI-авторства повністю або частково. Йдеться не лише про очевидний спам чи низькоякісні «content farm» сторінки: до вибірки потрапляли й тексти, які пройшли людське редагування, але базувалися на чернетці, згенерованій моделлю. Дослідники зафіксували, що частка такого контенту зростала поступово, а не одномоментно, що узгоджується з поетапним впровадженням AI-інструментів у редакційні процеси — від окремих фрилансерів до великих видавничих домів.

Чому це змінює довіру до пошукової видачі?

Якщо третина нових сторінок написана або відредагована AI, пошукові системи дедалі частіше ранжують і рекомендують контент, який сам походить від моделі, а не від людини з унікальним досвідом. Дослідники контенту називають цей ефект «гомогенізацією» видачі: різні сайти на один запит починають звучати подібно, бо спираються на той самий тип генерації тексту. Для читача це означає складніший пошук справді оригінальної експертизи серед сторінок, які виглядають компетентно, але фактично переказують одне й те саме.

Кому оригінальність стає конкурентною перевагою?

Коли текст на будь-яку тему може згенерувати кожен за лічені хвилини, рідкісним ресурсом стає не сам текст, а першоджерельні дані, досвід і думка, яких немає в чернетках моделі. Це вигідно виданням і компаніям, які публікують оригінальні дослідження, внутрішню статистику чи прямі інтерв'ю — тобто те, що AI не може синтезувати без первинного джерела. Подібну динаміку можна побачити в тому, як Google відповідає видавцям на падіння трафіку через AI Overviews: платформи вже змушені шукати спосіб відрізняти й винагороджувати первинний контент, а не його похідні.

Ймовірно, у середньостроковій перспективі пошукові системи й AI-агрегатори почнуть явніше знижувати вагу очевидно вторинного AI-контенту без доданої цінності — але це поки що наше припущення, а не факт із самого дослідження.

Що робити контент-командам і SEO-фахівцям зараз?

Найпрактичніший висновок для AI-білдерів і контент-команд: питання «чи текст написаний AI» стає менш важливим за питання «чи текст додає щось, чого немає більше ніде». AiiN вважає, що ринок контенту рухається до розшарування на два шари — масовий AI-згенерований фон і вузький шар перевіреної, атрибутованої експертизи, який тільки й матиме цінність для пошуку, цитування в AI-відповідях і довіри читача. Компаніям варто інвестувати не в обсяг публікацій, а в унікальні дані, кейси та думки, яких немає у тренувальних вибірках моделей.

Що означають «ознаки AI-авторства» у такому дослідженні?

Це текстові патерни й статистичні маркери, типові для великих мовних моделей, — наприклад, специфічна структура речень чи добір слів, які детектори порівнюють із відомими зразками людського та машинного письма. Дослідники наголошують, що йдеться про ймовірнісну оцінку, а не стовідсоткове доведення авторства кожної окремої сторінки.

Чи можна вважати третину інтернету марною?

Ні: дослідження не стверджує, що AI-контент однаково непотрібний, адже частина його все ж відредагована людьми і несе цінність. Але воно показує, що частка справді оригінального, невідредагованого людського тексту в новому вебі скорочується — і саме це варто враховувати, оцінюючи джерела в пошуку чи для навчання власних моделей.