Щомісяця AI-краулери від великих лабораторій і десятків менш відомих стартапів обходять мільйони сайтів, забираючи текст для навчання моделей і для RAG-систем, які відповідають користувачам напряму, не спрямовуючи їх на оригінальну сторінку. Трафік від таких ботів давно вимірюється мільярдами запитів на день, а видавці роками намагалися це зупинити — і роками програвали, бо дотримання robots.txt для краулера є справою добровільною: хочеш — ігноруй.
Cloudflare вирішила змінити правила гри не через суди чи лобіювання, а через інфраструктуру, яку контролює сама компанія. За даними TechCrunch, нова політика змушує AI-компанії або платити видавцям за доступ до їхнього контенту, або залишатися поза межами інфраструктури, крізь яку проходить значна частка світового вебтрафіку.
Для AI-білдерів це не абстрактна новина про видавничий бізнес. Це зміна вартості й доступності даних, на яких будуються моделі, агенти та пошукові асистенти — і зміна, яку окремий видавець ніколи не міг би провести самотужки, оскільки в нього просто немає технічних важелів впливу на трафік чужих компаній.
Чому саме Cloudflare здатна це продавити
Cloudflare обслуговує величезну частку HTTP-трафіку у світі: за різними оцінками, через мережу компанії щодня проходить значна частина всіх запитів в інтернеті — від звичайних сайтів до API. Це дає їй важіль, недоступний окремому видавцю з файлом robots.txt, і саме тому нова політика має шанс реально змінити поведінку великих AI-компаній, а не залишитися декларацією.
- Окремий сайт може прописати правило в robots.txt, але не має способу перевірити, чи AI-краулер його дотримується.
- Cloudflare натомість ідентифікує бота на мережевому рівні — за TLS-фінгерпринтом, поведінкою запитів і заголовками — і може заблокувати чи пропустити трафік ще до того, як він дійде до сервера видавця, тобто рішення ухвалюється на рівні мережі, а не окремого сайту.
- Це перетворює добровільну домовленість на технічно застосовуване правило, яке боту складно обійти без прямої домовленості з Cloudflare — принципово інша модель порівняно з роками ігнорованих текстових файлів.
У чому суть нової політики
Технічно нова модель складається з двох частин, які працюють разом.
- За замовчуванням трафік, який Cloudflare класифікує як AI-краулер, блокується на сайтах клієнтів, якщо власник ресурсу не дав явного дозволу.
- Видавці отримують інструмент монетизації доступу: краулер або домовляється про ліцензію, або платить за кожен обхід — модель, яку Cloudflare називає pay-per-crawl і яка по суті перетворює кожен обхід сторінки на транзакцію.
- Сигнали дозволу стають машинозчитуваними: видавець може окремо дозволити індексацію для пошуку й окремо заборонити використання тексту для навчання моделей, і це розрізнення тепер технічно виконується, а не лишається декларацією, яку боти могли просто проігнорувати.
Що це означає для AI-білдерів на практиці
Наслідки виходять далеко за межі видавничого ринку і стосуються будь-кого, хто будує продукти на основі відкритих веб-даних.
- Команди, що збирають дані масовим скрапінгом для fine-tuning чи RAG, ризикують отримати блокування на інфраструктурному рівні, а не просто ігнороване правило в robots.txt.
- Ліцензування контенту перетворюється на постійну статтю операційних витрат, подібну до рахунків за API-квоти, а не на разову юридичну формальність.
- Стартапи й дослідницькі команди без бюджету на такі угоди опиняються у гіршому становищі порівняно з великими лабораторіями, які вже підписують прямі контракти з видавцями.
- Альтернативні джерела даних — публічні датасети, партнерські API, ліцензовані корпуси — зростають у цінності, бо відкритий веб перестає бути безкоштовним ресурсом за замовчуванням.
- Компаніям, які будують пошукові чи RAG-продукти на базі Cloudflare-захищених сайтів, доведеться прописувати договірні відносини з видавцями ще на етапі дизайну пайплайна, а не постфактум.
- Провенанс даних у пайплайні перетворюється на технічний ризик, який варто аудитувати так само уважно, як залежності в коді.
Висновок AiiN
Це продовження старого конфлікту між видавцями та платформами, що індексують їхній контент, — конфлікту, який раніше вели Google News та Facebook. Тільки цього разу правила встановлює не суд чи регулятор, а інфраструктурна компанія, яка технічно здатна їх виконати без жодного судового рішення. Очікуємо, що інші CDN- та bot-management-провайдери підуть за цим прикладом, а постачання даних для моделей перетвориться на такий самий контрактний ланцюжок постачання, як хмарні сервіси чи GPU-потужності. Практичний висновок для AI-білдерів: ставтеся до доступу до контенту як до окремої статті бюджету й ризику постачання, а не як до безкоштовного побічного продукту відкритого вебу — і закладайте це в економіку продукту вже зараз, а не тоді, коли краулер вперше отримає HTTP 402.