Shutterstock перетворила ліцензування свого фотоархіву для тренування генеративних моделей на окремий і публічно визнаний напрям бізнесу — замість того, щоб судитися з розробниками ШІ за неавторизоване використання знімків, компанія системно продає їм легальний доступ на власних умовах.
Це принципово інший підхід, ніж обрала, наприклад, Getty Images, яка позивається проти Stability AI за скрейпінг зображень без дозволу. Shutterstock ще у 2023 році відкрила комерційний канал постачання даних для тренування моделей і відтоді підписала угоди з кількома великими розробниками ШІ, серед яких згадувалися OpenAI, Meta, Google, Amazon, LG AI Research та Databricks. За даними AI Business, компанія продовжує розширювати цей портфель угод.
Для індустрії, де провенанс тренувальних даних став юридичним мінним полем після позовів The New York Times проти OpenAI та Getty проти Stability AI, готове й ліцензоване джерело зображень — це не другорядна деталь, а спосіб знизити ризик судового позову для тих, хто будує комерційні генеративні продукти.
Що саме означає «ліцензування зображень для ШІ»?
Йдеться не про звичайну стокову підписку, за якою бізнес купує право показати фото в рекламі чи на сайті. Data-ліцензування — окремий продукт: розробник моделі отримує структурований доступ до мільйонів пар «зображення плюс опис» із бібліотеки Shutterstock, які за прямим призначенням йдуть на тренування або донавчання ШІ-моделей. Це принципово інший тип прав, ніж стандартна ліцензія для комерційного використання одного зображення.
Чому Shutterstock обрала угоди, а не судові позови?
Розробники генеративних моделей роками навчали системи на зображеннях, зібраних скрейпінгом відкритого вебу, без згоди правовласників — саме це стало підставою для позовів Getty Images, а також групових позовів художників проти Stability AI та Midjourney. Shutterstock натомість перетворила легальність походження даних на конкурентну перевагу: компанія володіє великим каталогом ліцензованого контенту з чіткими правами і може продавати доступ до нього напряму, без ризику судових претензій для покупця.
Такий підхід дає розробникам ШІ те, чого не гарантує відкритий скрейпінг, — юридичну чистоту походження даних і, у частині угод, індемнізацію від претензій третіх осіб.
Що це означає для фотографів і для тих, хто будує ШІ-продукти?
Для контриб'юторів Shutterstock — фотографів і відеографів, чиї роботи потрапляють у ліцензійні пакети для тренування ШІ, — компанія з 2023 року виплачує частку доходу через окремий Contributor Fund, розподіляючи виплати пропорційно до використання їхнього контенту в датасетах. Це не усуває суперечки про те, чи достатня така компенсація порівняно з доходом, який генерує на її основі модель вартістю мільярди доларів, але формує прецедент оплатної, а не безоплатної моделі використання авторського контенту для навчання ШІ.
- Стокова ліцензія на одне зображення не дає права використовувати його для тренування моделі — потрібна окрема угода про дата-ліцензування.
- Ліцензований датасет знижує юридичний ризик порівняно зі скрейпінгом відкритого вебу, але коштує суттєво дорожче.
- Для стартапів без бюджету на такі угоди залишаються відкриті датасети з невизначеним статусом прав — і зростаючий ризик позовів у міру того, як індустрія рухається до ліцензійної норми.
Що це означає для ринку тренувальних даних?
Наша теза: угоди на кшталт тих, що укладає Shutterstock, поступово перетворюють ліцензійний доступ до чистих даних на бар'єр входу для нових гравців генеративного ШІ. Великі лабораторії можуть дозволити собі мільйонні контракти з постачальниками стокового контенту; менші команди — ні, і змушені або ризикувати судовими позовами, або обмежуватися відкритими датасетами гіршої якості й меншого обсягу. У середньостроковій перспективі це, ймовірно, консолідує ринок тренувальних даних навколо кількох великих постачальників на кшталт Shutterstock, Getty (через власну ліцензійну програму) та Adobe.
Чи можна використовувати куплене на Shutterstock фото для тренування власної моделі?
Ні, якщо йдеться про стандартну стокову ліцензію для комерційного використання. Право на тренування ШІ-моделей Shutterstock продає окремо, через угоди дата-ліцензування з розробниками моделей, а не через звичайну підписку для дизайнерів і маркетологів.
Хто отримує гроші від таких угод — сама компанія чи автори фото?
Обидва. Shutterstock отримує оплату від розробника моделі за доступ до датасету, а частину цього доходу розподіляє між контриб'юторами через Contributor Fund пропорційно до використання їхніх робіт у тренувальних наборах.
Чим підхід Shutterstock відрізняється від судової тяжби Getty Images проти Stability AI?
Обидві компанії реагують на одну проблему — неврегульований статус зображень у тренувальних даних, — але обрали протилежні стратегії. Getty судиться за компенсацію збитків від уже сталого використання без дозволу. Shutterstock натомість монетизує майбутній доступ наперед, продаючи легальні права до того, як контент потрапить у датасет.