Amazon увімкнула на Twitch для мільйонів стримерів опцію, якої ніхто не просив: тепер компанія за замовчуванням використовує відеотрансляції користувачів для тренування власних моделей штучного інтелекту. Це означає, що ігровий стрім, кулінарний влог чи звичайна розмова у прямому ефірі автоматично стають навчальним матеріалом для алгоритмів Amazon — доки автор контенту сам не вимкне цю функцію в налаштуваннях приватності. За даними Speka, відмовитися технічно можна, але зробити це доведеться вручну — і саме тут ховається головна претензія до нового підходу.

Amazon купила Twitch у 2014 році за $970 млн, і сьогодні платформа щомісяця приймає мільйони годин прямих ефірів. Для компанії, яка одночасно розвиває власну лінійку моделей Amazon Nova, голосового асистента Alexa+ і шопінг-агента Rufus, доступ до такого масиву «живого» відео — з голосом, мімікою та реакціями в реальному часі — це не побічний ефект, а стратегічний актив.

Що саме змінилося на Twitch?

Ключова зміна — перехід від згоди, яку користувач мав би дати активно, до згоди «за замовчуванням», яку потрібно активно відкликати. Раніше використання контенту стримерів для машинного навчання або взагалі не обговорювалося прямо в умовах використання, або вимагало окремого дозволу. Тепер трансляція автоматично потрапляє у процес тренування ШІ-моделей Amazon одразу після публікації, а керувати цим можна лише через перемикач у налаштуваннях приватності облікового запису.

Для окремого стримера це виглядає як дрібниця — один перемикач. Але помножене на мільйони акаунтів, саме це рішення визначає, яка частка контенту платформи потрапить у тренувальний датасет: за моделі opt-out це практично 100% нового контенту, тоді як за моделі opt-in — лише ті одиниці відсотків користувачів, які свідомо погодяться.

Чому Amazon обрала модель «за замовчуванням», а не запит згоди?

Відповідь проста: економіка даних. Якісне мультимодальне відео з синхронним звуком і реакціями аудиторії в реальному часі — дефіцитний ресурс, який дорого купувати на відкритому ринку. Компанії платять за ліцензування контенту для тренування ШІ десятки й сотні мільйонів доларів: Reddit підписав багаторічну угоду з Google на постачання даних для тренування моделей, Shutterstock і Getty Images ліцензують зображення для OpenAI та інших розробників. Twitch дає Amazon той самий тип активу, тільки безкоштовно й одразу у промисловому масштабі — за умови, що користувач не завадить цьому вручну.

Той самий патерн уже проходили інші великі платформи — спершу вмикали використання даних користувачів для тренування ШІ за замовчуванням, і лише після публічного невдоволення робили перемикач відмови помітнішим:

Twitch поки що не змінював підхід під тиском — перемикач одразу існує, але за замовчуванням увімкнений.

Кого це стосується і чому це важливо для ринку тренувальних даних?

Найбільше це стосується професійних і напівпрофесійних стримерів, чий голос, стиль мовлення й манера реагування на аудиторію — по суті, унікальний виступ, а не випадковий контент. Для індустрії ШІ це важливо ширше: текстові дані для тренування великих мовних моделей вже вичерпуються, тоді як синхронізоване відео з голосом і живою взаємодією — один з небагатьох залишкових масивів даних, ще недостатньо використаних розробниками мультимодальних систем.

Практичний наслідок для команд, що будують AI-продукти: власники платформ з великою базою користувацького відео та аудіо (стрімінгові сервіси, месенджери, сервіси відеозв'язку) отримують конкурентну перевагу саме через дефолтний доступ до даних, а не через якість моделі. Це, ймовірно, прискорить схожі рішення в інших відеосервісах, якщо регулятори не втрутяться першими.

Висновок AiiN

Головне тут не сам перемикач у налаштуваннях Twitch, а те, що великі платформи одна за одною перекладають тягар згоди на користувача: мовчання трактується як дозвіл, а не як його відсутність. За нашою оцінкою, це стане стандартною практикою для будь-якого сервісу, що сидить на масиві унікальних мультимодальних даних, доки регулятори на кшталт тих, хто впроваджує AI Act у ЄС, чітко не заборонять таку конструкцію. Для AI-білдерів це сигнал: наступна хвиля конкурентної переваги в мультимодальних моделях прийде не від архітектури, а від того, хто першим і найдешевше отримає доступ до живих аудіо-відео даних користувачів — і хто встигне це зробити до того, як регулювання наздожене індустрію.

Чи можна повністю видалити свої стріми з тренувальних даних Amazon?

Перемикач у налаштуваннях приватності зупиняє використання нових трансляцій, але не гарантує «забування» вже засвоєних моделлю даних. Технологія надійного видалення конкретного фрагмента з уже натренованої нейромережі (так зване machine unlearning) залишається незрілою в усій індустрії, тож найнадійніший спосіб захисту — відмовитися до публікації нового контенту, а не після.

Чи це унікальна історія лише для Twitch?

Ні. За останні два роки схожі зміни умов використання впроваджували LinkedIn, Meta, Slack і Adobe — щоразу з дефолтним доступом до даних користувачів і перемикачем відмови, який доводилося шукати самостійно. Twitch — черговий, а не перший і не останній випадок цього тренду серед великих платформ.