Seattle Times та Newsday подали новий позов проти OpenAI і Microsoft, звинувативши обидві компанії у порушенні авторських прав під час тренування мовних моделей. Це вже не перший подібний позов проти пари OpenAI-Microsoft, але кожен новий учасник змінює математику ризику для компаній, що будують бізнес на великих мовних моделях.
Обидва видавці стверджують, що їхні статті використовувалися для навчання моделей без ліцензії та компенсації — той самий аргумент, який раніше висували The New York Times та десятки інших медіа, що подали позови з кінця 2023 року. За даними Engadget, позов додається до вже наявного портфеля судових справ проти OpenAI та Microsoft за схожими звинуваченнями.
Для AI-білдерів це не просто новина про юристів — це сигнал про те, що вартість тренувальних даних більше не нульова, і рано чи пізно вона позначиться на ціні API та умовах ліцензування.
Що саме сталося?
Seattle Times і Newsday подали позови проти OpenAI та Microsoft, доєднавшись до групи видавців, які через суд вимагають визнати використання їхнього контенту для тренування моделей порушенням копірайту. Обидва видання — регіональні газети з довгою редакційною історією, і для них позов — спосіб або отримати компенсацію, або змусити OpenAI укласти ліцензійну угоду, як це вже зробили деякі інші видавці.
Ключова юридична теза стандартна для цієї хвилі позовів: компанії масово скрейпили тексти статей для тренувальних датасетів, не питаючи дозволу і не платячи роялті, а тепер моделі здатні відтворювати або переказувати цей контент у відповідях користувачам.
Чому видавці судяться саме зараз?
Хвиля позовів проти OpenAI триває вже понад два роки, і кожен новий учасник підключається в момент, коли юридична стратегія позивачів стає дедалі чіткішою. Ранні справи виробили прецедентну базу і показали видавцям, які аргументи працюють у суді, а які — ні.
Паралельно частина індустрії пішла іншим шляхом — переговорами замість суду. Anthropic, наприклад, погодилася виплатити авторам і видавцям $1,5 млрд компенсації, що стало орієнтиром для розміру потенційних виплат у подібних справах. Це підвищило ставки: видавці бачать, що суди готові визнавати їхню правоту, а компанії — платити, тож черга нових позовів логічна.
Що це означає для AI-компаній і розробників?
Юридичний тиск на постачальників LLM зростає, і це напряму впливає на те, як формуються тренувальні датасети наступного покоління моделей. Компанії, що будують продукти поверх чужих API, варто розуміти кілька практичних наслідків:
- Вартість ліцензованих даних закладається в собівартість моделей — і рано чи пізно перекладається на ціну підписок і API-викликів.
- Компанії, що самі збирають дані для fine-tuning, мають дедалі більше стимулів документувати джерела й права на контент, аби не повторити долю OpenAI.
- Ринок ліцензійних угод між видавцями і AI-компаніями продовжує рости — це створює нову категорію B2B-контрактів, вигідну саме тим, хто має якісний, добре структурований контент.
Для стартапів, які тренують або дотренюють власні моделі на скрейпнутих даних, це привід переглянути практики збору даних, поки регуляторна й судова практика остаточно не встановила правила гри.
Висновок AiiN
Наша теза проста: індустрія LLM рухається від епохи «спочатку скрейп, потім розбирайся» до епохи ліцензійних угод як стандартної статті витрат — так само, як музична індустрія свого часу перейшла від піратства до Spotify-моделі роялті. Кожен новий позов на кшталт справи Seattle Times і Newsday не просто загроза для OpenAI — це тиск, що прискорює формування прозорого ринку даних для тренування моделей. AI-білдерам варто вже зараз закладати бюджет на ліцензування контенту в юніт-економіку продукту, а не сподіватися, що судова практика обійде їх стороною.
Скільки позовів вже подано проти OpenAI за копірайт?
Точна кількість постійно змінюється, оскільки нові видавці й автори приєднуються регулярно з кінця 2023 року, коли перший великий позов подала The New York Times. Seattle Times і Newsday — лише останні у довгому списку медіаорганізацій, що судяться з OpenAI та Microsoft.
Чи вплине це на доступність ChatGPT для звичайних користувачів?
Прямого впливу на роботу ChatGPT ці позови поки не мають — сервіс продовжує працювати як зазвичай. Ймовірно, довгостроковий ефект проявиться радше в ціні підписок та API, якщо компанії почнуть закладати вартість ліцензійних угод із видавцями у собівартість моделей.