LAION, некомерційна дослідницька організація з Німеччини, відома датасетом LAION-5B, що ліг в основу Stable Diffusion, оприлюднила новий відкритий відеодатасет обсягом 10 мільйонів годин відзнятого матеріалу. За обсягом це один із найбільших публічних ресурсів такого типу, доступний будь-якій команді для тренування власних відеомоделей — без потреби домовлятися про ліцензії чи платити за доступ до чужих бібліотек контенту.
За даними The Decoder, реліз покликаний дати дослідникам і розробникам відкриту альтернативу закритим датасетам, на яких тренують комерційні відеогенератори. До цього часу масштабні відеоколекції такого рівня лишалися фактично виключно у розпорядженні OpenAI, Google DeepMind та інших великих лабораторій із мільярдними бюджетами.
Для індустрії, де тренування якісної відеомоделі впирається насамперед у брак розмаїтого відеоматеріалу, а не лише в обчислювальні потужності, поява такого ресурсу — подія, здатна змінити баланс сил між закритими і відкритими розробниками.
Що саме випустила LAION?
Організація оприлюднила колекцію з 10 мільйонів годин відеоматеріалу — за традицією LAION, найімовірніше, масив розповсюджується як набір метаданих і посилань на джерела, а не як готові до завантаження файли, саме так організація публікувала попередній датасет LAION-5B для зображень. Такий підхід дозволяє обходити частину проблем з авторським правом, перекладаючи фактичне завантаження контенту на плечі команди, що використовує датасет.
За масштабом реліз істотно перевершує все, що раніше було доступно відкритій спільноті розробників відеомоделей, і позиціонується LAION як ресурс саме для AI-досліджень, а не для комерційного використання без додаткової перевірки прав.
Чому обсяг у 10 мільйонів годин має значення?
Якість відеомоделі напряму залежить від різноманітності й кількості відзнятого матеріалу, на якому вона вчиться передбачати рух, фізику об'єктів і зв'язність кадрів у часі. Комерційні лабораторії — OpenAI із Sora та Google DeepMind із Veo — не розкривають розміри своїх тренувальних наборів, але, ймовірно, вони вимірюються мільйонами годин ліцензованого або зібраного вебскрейпінгом відео, недоступного стороннім командам.
До появи датасету LAION відкриті розробники фактично не мали ресурсу порівнянного масштабу — це змушувало їх або тренувати моделі на значно менших наборах, або домовлятися про точковий доступ до приватних бібліотек контенту.
Кому це відкриває шлях — і які тут ризики?
Найбільше від релізу виграють команди, що розвивають відкриті відеомоделі: тепер вони отримують сировину, порівнянну за масштабом із тим, на чому тренуються комерційні продукти. Це знижує один із головних бар'єрів входу в розробку відеогенераторів — брак доступних даних.
Водночас у LAION є прецедент, який варто тримати в голові: у грудні 2023 року дослідники Стенфордського інтернет-обсерваторію знайшли в LAION-5B посилання на матеріали з сексуальним насильством над дітьми, і організація тимчасово відкликала датасет для очищення. Це не означає, що новий відеодатасет має ті самі проблеми, але масштабний вебскрейпінг завжди несе ризик потрапляння небажаного або захищеного авторським правом контенту — і командам, які тренуватимуться на цьому масиві, варто закладати час і ресурси на власну фільтрацію.
Що з цим робити AI-білдерам зараз?
- Для дослідницьких команд і стартапів це шанс тренувати чи файнтюнити відеомоделі без бюджету на ліцензування контенту з нуля.
- Перед використанням перевірте формат розповсюдження (посилання чи готові файли) та власні юридичні зобов'язання щодо авторського права в конкретній юрисдикції.
- Варто очікувати появи похідних відкритих відеомоделей і чистих субсетів датасету на майданчиках на кшталт Hugging Face протягом наступних місяців — тим паче, що саме зараз навколо платформи точаться перемовини про купівлю (детальніше про угоду Nvidia і Hugging Face).
Висновок AiiN
Головний ефект від релізу LAION з'явиться не одразу у вигляді готової відкритої альтернативи Sora чи Veo, а за 6–12 місяців — коли дослідницькі команди встигнуть очистити, розмітити і навчитися працювати з масивом такого розміру. За нашою оцінкою, цінність цього кроку не в тому, хто швидше зробить клон комерційного продукту, а в тому, що сировина для відеогенерації перестає бути монополією трьох-чотирьох лабораторій із мільярдними бюджетами.
Чи можна одразу тренувати відеомодель на цьому датасеті?
Технічно так, але обробка 10 мільйонів годин відео вимагає значних обчислювальних і дискових ресурсів ще до початку тренування: фільтрація, розмітка та дедуплікація масиву такого розміру самі по собі є окремим інженерним проєктом, а не підготовчим кроком на кілька днів.
Чим цей реліз відрізняється від LAION-5B?
LAION-5B — це колекція приблизно з 5,85 мільярда пар «зображення-текст», яка стала основою для Stable Diffusion. Новий відеодатасет вперше переносить той самий відкритий підхід у відеоформат, де ресурсу порівнянного масштабу раніше просто не існувало у публічному доступі.