Аналітичний центр Pew Research зафіксував різке зростання частки тексту, згенерованого штучним інтелектом, у публічному вебі — перелом стався одразу після запуску ChatGPT наприкінці листопада 2022 року. Дослідники порівняли масиви веб-сторінок до і після цієї дати та побачили стійку тенденцію: що новіший контент, то вища ймовірність, що він написаний або відредагований генеративною моделлю, а не людиною.

За даними The Decoder, аналіз охоплював великі вибірки текстів із відкритого вебу і використовував методи виявлення ознак машинної генерації — характерну лексику, синтаксичні патерни та стилістичну одноманітність, типову для великих мовних моделей. Різкий стрибок частки такого контенту саме після листопада 2022 року робить причинно-наслідковий зв'язок із запуском ChatGPT доволі очевидним: масовий доступ до генеративного письма змінив те, як мільйони людей і компаній виробляють текст для сайтів, блогів, маркетплейсів і форумів.

Для індустрії, що будує AI-продукти, це не просто цікавий факт про стан інтернету. Це сигнал про якість «сировини», на якій навчаються нові моделі і з якої RAG-системи витягують відповіді в реальному часі.

Що саме показало дослідження Pew?

Головний висновок — частка AI-написаного тексту у свіжому веб-контенті зросла настільки помітно, що дослідники змогли зафіксувати чіткий злам тренду в часі, прив'язаний до запуску ChatGPT. Це означає, що йдеться не про поступовий органічний ріст, а про різку структурну зміну способу виробництва тексту в мережі.

Чому це проблема для тренування AI-моделей?

Проблема в тому, що великі мовні моделі традиційно навчаються на масштабних збірках веб-тексту на кшталт Common Crawl, а зростання частки синтетичного контенту в цих збірках підвищує ризик так званого «model collapse» — поступової деградації якості моделі, коли вона дедалі частіше навчається на виводі інших моделей, а не на оригінальному людському тексті. Кожне наступне «покоління» датасету стає менш різноманітним і потенційно успадковує помилки та шаблонність попередників.

Ймовірно, найбільше це вдарить по нішах із низьким бар'єром входу для генерації контенту — SEO-фарми, агрегатори новин, шаблонні описи товарів — де AI-текст масштабується найшвидше і найдешевше.

Як це впливає на пошук і RAG-системи?

RAG-пайплайни (retrieval-augmented generation) витягують фрагменти веб-сторінок у реальному часі, щоб «заземлити» відповідь моделі на актуальних джерелах. Якщо дедалі більша частка проіндексованих сторінок сама написана іншою моделлю, RAG-система ризикує цитувати не первинне джерело факту, а вже перефразований, можливо спотворений AI-переказ. Це посилює проблему «інформаційного луна-каналу», коли помилка чи галюцинація однієї моделі тиражується іншими через веб-контент, який вони індексують.

Те саме стосується пошукових систем і асистентів на кшталт AI Overviews: якість відповіді прямо залежить від якості та різноманітності джерел у видачі, а не лише від сили самої моделі.

Що робити компаніям, які працюють з даними?

Практичний висновок для AI-білдерів — провенанс даних (походження і історія джерела) стає таким самим важливим критерієм, як обсяг чи свіжість датасету.

Висновок AiiN

Наша теза проста: епоха, коли «більше веб-тексту» автоматично означало «кращий датасет», закінчується. Компанії, що будують LLM чи RAG-продукти, повинні переходити від логіки обсягу до логіки походження даних — інакше вони ризикують тренувати й доповнювати свої системи дедалі більшою мірою на виводі інших моделей, а не на людському знанні. Це не привід панікувати, але привід переглянути пайплайни збору даних уже зараз, поки частка синтетичного тексту тільки зростає.

Що таке model collapse?

Model collapse — це поступова деградація якості мовної моделі, коли вона навчається переважно на тексті, згенерованому іншими моделями, а не на оригінальних людських даних. Через це знижується різноманітність і точність результатів у наступних поколіннях моделей.

Чи можна відрізнити AI-текст від людського напевно?

Повної гарантії немає — детектори AI-тексту працюють на статистичних ознаках (лексика, синтаксис, одноманітність стилю) і дають ймовірнісну, а не бінарну оцінку, тому завжди залишається відсоток помилкових спрацювань в обидва боки.