Amazon використовуватиме відео, чат і голосовий супровід трансляцій на Twitch для тренування власних ШІ-моделей — про це повідомило видання AIN.ua. Платформу для лайв-стрімінгу Amazon придбала ще у 2014 році за 970 мільйонів доларів, і тепер накопичений за понад десятиліття відеоконтент перетворюється на актив для розробки моделей.

Для індустрії це черговий сигнал зміщення пріоритетів: гонка за тренувальні дані переходить від текстових корпусів до відео, аудіо та живої взаємодії, яку неможливо просто зібрати відкритим скрейпінгом сайтів. Twitch дає те, чого немає в більшості відкритих відеоархівів, — необроблене, синхронне поєднання зображення, мовлення й миттєвої реакції аудиторії в чаті.

За даними AIN.ua, рішення стосується саме контенту стримерів — тобто творців, які ведуть трансляції на платформі, а не лише службових чи маркетингових матеріалів самого Amazon.

Що саме означає ця новина для стримерів Twitch?

Для творців контенту це означає, що їхні трансляції — включно з голосом, зображенням із камери, ігровим процесом і повідомленнями глядачів у чаті — можуть стати матеріалом для тренування моделей, які не мають прямого стосунку до самого Twitch. Подібні рішення платформ зазвичай спираються на умови користування, які творець приймає ще під час реєстрації каналу і які, як правило, дають власнику сервісу широкі права на використання завантаженого контенту.

Класична для індустрії напруга: стример погоджується транслювати гру чи розмову з аудиторією, а не брати участь у тренуванні мовної або відеомоделі. Чи передбачив Amazon окремий механізм відмови (opt-out) для тих, хто не хоче потрапляти у навчальну вибірку, у відкритих матеріалах поки не деталізовано.

Навіщо компанії дані стрімінгової платформи, якщо відео в інтернеті й так багато?

Публічне відео на YouTube чи інших відкритих майданчиках здебільшого змонтоване, відредаговане й статичне за форматом. Стрім — інший тип сигналу: тривала, необроблена послідовність відео, звуку й тексту в реальному часі, синхронізована з живою реакцією глядачів. Саме такий формат потрібен моделям, які мають розпізнавати мовлення в шумі, стежити за діалогом кількох учасників і повʼязувати репліки чату з тим, що відбувається на екрані.

Це узгоджується із загальним напрямом Amazon в AI останніх двох років: власна лінійка моделей Amazon Nova в Amazon Bedrock і генеративний асистент Alexa+ потребують саме мультимодальних навчальних сигналів — відео, мовлення й текст одночасно. Ймовірно, дані Twitch підуть саме на підсилення цих напрямів, хоча відкриті матеріали прямо цього не підтверджують.

Хто ще тренує моделі на контенті власних користувачів?

Amazon тут не піонер. Meta вже тренує Llama на публічних постах Facebook та Instagram і після тиску регуляторів у Євросоюзі додала користувачам механізм відмови. X Corp використовує публікації користувачів платформи X для тренування моделі Grok. Google має структурну перевагу у вигляді власного каталогу YouTube для моделей родини Gemini. У кожному випадку повторюється той самий сюжет: компанія, що володіє і платформою, і моделлю, перетворює контент користувачів на актив без окремої оплати за нього.

Різниця між компаніями — у тому, наскільки прозоро вони повідомляють користувачів і чи дають реальний вибір відмовитися. Саме на цьому зазвичай і фокусується подальша регуляторна та публічна реакція.

Що з цього випливає для AI-білдерів?

За нашою оцінкою AiiN, ця новина — не стільки про Twitch, скільки про напрям усієї індустрії: якісний текст із відкритого вебу вичерпується швидше, ніж зростають апетити моделей, тож великі гравці з власними платформами-екосистемами — Meta, Google, X, тепер і Amazon — отримують структурну перевагу: доступ до унікальних даних, які неможливо зібрати ззовні. Для команд, що будують продукти на чужих API, висновок практичний: варто уважніше читати, звідки постачальник моделі бере тренувальні дані, і чи не потраплять туди дані ваших власних користувачів, якщо продукт інтегрується зі стрімінговими чи відеосервісами. Питання контролю над джерелом даних для тренування — не абстрактне; підходи на кшталт Optima, яка дає командам тестувати AI-моделі на власних даних, показують альтернативу, де вибір джерела лишається на боці команди, а не платформи.

Чи можуть стримери Twitch відмовитися від використання їхнього контенту для тренування ШІ?

У відкритих матеріалах про це поки не йдеться прямо. У подібних кейсах — наприклад, у Meta — механізм відмови зʼявився лише під тиском регуляторів у Євросоюзі, тож остаточна відповідь залежатиме від подальших офіційних заяв Amazon чи Twitch.

Чи зміниться сам сервіс Twitch для глядачів і стримерів?

Пряма зміна інтерфейсу чи функціоналу платформи наразі не заявлена — йдеться про використання вже накопиченого контенту для тренування моделей, а не про зміну самого стрімінгового сервісу.