Аналітичний центр Pew Research зафіксував різке зростання частки тексту, згенерованого штучним інтелектом, у публічному вебі — перелом стався одразу після запуску ChatGPT наприкінці листопада 2022 року. Дослідники порівняли масиви веб-сторінок до і після цієї дати та побачили стійку тенденцію: що новіший контент, то вища ймовірність, що він написаний або відредагований генеративною моделлю, а не людиною.
За даними The Decoder, аналіз охоплював великі вибірки текстів із відкритого вебу і використовував методи виявлення ознак машинної генерації — характерну лексику, синтаксичні патерни та стилістичну одноманітність, типову для великих мовних моделей. Різкий стрибок частки такого контенту саме після листопада 2022 року робить причинно-наслідковий зв'язок із запуском ChatGPT доволі очевидним: масовий доступ до генеративного письма змінив те, як мільйони людей і компаній виробляють текст для сайтів, блогів, маркетплейсів і форумів.
Для індустрії, що будує AI-продукти, це не просто цікавий факт про стан інтернету. Це сигнал про якість «сировини», на якій навчаються нові моделі і з якої RAG-системи витягують відповіді в реальному часі.
Що саме показало дослідження Pew?
Головний висновок — частка AI-написаного тексту у свіжому веб-контенті зросла настільки помітно, що дослідники змогли зафіксувати чіткий злам тренду в часі, прив'язаний до запуску ChatGPT. Це означає, що йдеться не про поступовий органічний ріст, а про різку структурну зміну способу виробництва тексту в мережі.
- Точка перелому збігається з листопадом 2022 року — датою публічного релізу ChatGPT.
- Тренд стосується щойно опублікованого контенту, тобто відображає поточну поведінку авторів і сайтів, а не історичний архів.
- Дослідження зосереджене на факті зростання частки, а не на детальній розбивці за нішами чи мовами.
Чому це проблема для тренування AI-моделей?
Проблема в тому, що великі мовні моделі традиційно навчаються на масштабних збірках веб-тексту на кшталт Common Crawl, а зростання частки синтетичного контенту в цих збірках підвищує ризик так званого «model collapse» — поступової деградації якості моделі, коли вона дедалі частіше навчається на виводі інших моделей, а не на оригінальному людському тексті. Кожне наступне «покоління» датасету стає менш різноманітним і потенційно успадковує помилки та шаблонність попередників.
Ймовірно, найбільше це вдарить по нішах із низьким бар'єром входу для генерації контенту — SEO-фарми, агрегатори новин, шаблонні описи товарів — де AI-текст масштабується найшвидше і найдешевше.
Як це впливає на пошук і RAG-системи?
RAG-пайплайни (retrieval-augmented generation) витягують фрагменти веб-сторінок у реальному часі, щоб «заземлити» відповідь моделі на актуальних джерелах. Якщо дедалі більша частка проіндексованих сторінок сама написана іншою моделлю, RAG-система ризикує цитувати не первинне джерело факту, а вже перефразований, можливо спотворений AI-переказ. Це посилює проблему «інформаційного луна-каналу», коли помилка чи галюцинація однієї моделі тиражується іншими через веб-контент, який вони індексують.
Те саме стосується пошукових систем і асистентів на кшталт AI Overviews: якість відповіді прямо залежить від якості та різноманітності джерел у видачі, а не лише від сили самої моделі.
Що робити компаніям, які працюють з даними?
Практичний висновок для AI-білдерів — провенанс даних (походження і історія джерела) стає таким самим важливим критерієм, як обсяг чи свіжість датасету.
- Для тренування — надавати перевагу курованим, верифікованим корпусам і даним із фіксованою датою збору до масового поширення генеративних інструментів, де це можливо.
- Для RAG — додавати фільтри якості джерел і пріоритизувати сайти з підтвердженою редакційною чи експертною людською перевіркою.
- Для власного контенту — інвестувати у first-party дані (власні опитування, транзакційні дані, експертні інтерв'ю), які неможливо відтворити скрейпінгом чужого AI-тексту.
Висновок AiiN
Наша теза проста: епоха, коли «більше веб-тексту» автоматично означало «кращий датасет», закінчується. Компанії, що будують LLM чи RAG-продукти, повинні переходити від логіки обсягу до логіки походження даних — інакше вони ризикують тренувати й доповнювати свої системи дедалі більшою мірою на виводі інших моделей, а не на людському знанні. Це не привід панікувати, але привід переглянути пайплайни збору даних уже зараз, поки частка синтетичного тексту тільки зростає.
Що таке model collapse?
Model collapse — це поступова деградація якості мовної моделі, коли вона навчається переважно на тексті, згенерованому іншими моделями, а не на оригінальних людських даних. Через це знижується різноманітність і точність результатів у наступних поколіннях моделей.
Чи можна відрізнити AI-текст від людського напевно?
Повної гарантії немає — детектори AI-тексту працюють на статистичних ознаках (лексика, синтаксис, одноманітність стилю) і дають ймовірнісну, а не бінарну оцінку, тому завжди залишається відсоток помилкових спрацювань в обидва боки.