Anthropic погодилася заплатити 1,5 мільярда доларів у вересні 2025 року, щоб закрити колективний позов авторів, які звинуватили компанію в тренуванні Claude на піратських копіях книг. Це одна з найбільших виплат в історії авторського права в США — і водночас доказ того, що юридична картина довкола тренувальних даних для AI лишається фрагментованою: одні суди визнають саме тренування "добросовісним використанням" (fair use), інші карають за спосіб отримання даних.
За даними TechCrunch, практика тренування великих мовних моделей на захищених копірайтом книгах поширена по всій індустрії, але судова практика в США досі непослідовна. Видання оглядає ключові позови проти OpenAI, Meta та Anthropic — і жодна з компаній поки не отримала однозначного "зеленого світла" на весь цикл роботи з даними: від збору до використання результату.
Для будь-якого продукту, що будується на базі GPT, Llama чи Claude, це не абстрактна юридична дискусія. Якщо модель, яку ви інтегруєте в продукт, тренувалася на спірних даних, ризик судового позову і потенційного вилучення моделі з ринку частково лягає і на вас як на користувача API.
Чому суди досі не дали однозначної відповіді?
Тому що американське право розділяє два питання, які на перший погляд здаються одним: чи законно аналізувати текст книги для навчання моделі, і чи законно було цю книгу спершу здобути. Суддя Вільям Олсап у справі Bartz v. Anthropic визнав, що саме тренування моделі на легально придбаних книгах підпадає під доктрину fair use — трансформативне використання, яке не конкурує напряму з оригіналом. Але водночас він встановив, що завантаження мільйонів книг із піратських бібліотек для формування тренувального корпусу — це окреме порушення, яке fair use не покриває.
Такий поділ означає, що результат кожної справи залежить не лише від того, що робить модель, а й від того, звідки саме компанія взяла вихідні дані. Дві компанії можуть тренувати схожі моделі на схожих текстах — і отримати протилежні вердикти залежно від того, купували вони ліцензії на легально придбані книги чи брали контент із торент-трекерів.
Що вже відомо зі справ проти OpenAI, Meta та Anthropic?
Кожна з трьох компаній опинилася в іншій точці цього спектра. Anthropic обрала шлях мирової угоди на 1,5 мільярда доларів саме тому, що ризик програшу по епізоду з піратськими копіями був надто високим після попереднього рішення судді Олсапа. Позови проти OpenAI (зокрема від The New York Times) і проти Meta (Kadrey та інші автори) розглядають подібні звинувачення, але поки не мали настільки ж однозначного результату — саме цю розбіжність і фіксує TechCrunch, називаючи ситуацію "заплутаною".
- Тренування на легально придбаному контенті має шанси підпадати під fair use;
- Спосіб отримання даних (піратські бібліотеки, скрапінг без дозволу) — окрема юридична проблема, яка може призвести до мільярдних виплат;
- Єдиного федерального стандарту, що охоплював би всі AI-компанії однаково, поки немає — рішення ухвалюють окремі судді в окремих округах.
Кому і чим це загрожує у практиці?
Найбільше під ударом опиняються самі розробники моделей, але непрямий ризик відчують і компанії, що будують продукти поверх чужих API. Якщо провайдер моделі програє позов і суд накладе обмеження на використання моделі або зобов'язає видалити певні дані з ваг, це може вплинути на доступність або поведінку моделі, якою ви вже користуєтесь у продакшені.
Ймовірно, у найближчі роки це підштовхне більше вендорів до публічного розкриття джерел тренувальних даних і до ліцензійних угод з видавцями — за нашою оцінкою, подібно до того, як після справи Anthropic вже зростає кількість комерційних data-ліцензійних контрактів між AI-компаніями та медіагрупами.
Висновок AiiN
Наша теза: юридична невизначеність навколо тренувальних даних — це вже не тема для юристів, а фактор ризику, який варто закладати в due diligence будь-якого продукту на базі LLM, поряд із ціною токена і латентністю. Компанія, що обирає модель постачальника, фактично успадковує його судову історію: якщо завтра суд визнає спосіб збору даних незаконним, наслідки можуть торкнутися і тих, хто просто підключив API.
Чи законно взагалі тренувати AI на книгах під копірайтом?
Однозначної відповіді немає: суди в США розрізняють саме тренування (може підпадати під fair use за певних умов) і спосіб отримання книг — нелегальне завантаження є окремим порушенням, навіть якщо саме тренування визнане правомірним.
Чи вплинула справа Anthropic на інші AI-компанії?
Виплата 1,5 мільярда доларів створила прецедент фінансового ризику для всієї індустрії, але напряму не зобов'язує OpenAI чи Meta до аналогічних виплат — кожна справа розглядається судом окремо, з власними фактами про джерела даних.
Що робити компаніям, які будують продукти на LLM?
Варто відстежувати судову практику навколо конкретної моделі, яку ви використовуєте, і закладати в контракт із постачальником API пункт про відповідальність за юридичні ризики тренувальних даних.