Alibaba випустила модель генерації відео Wan3.0, яка створює ролики тривалістю до 30 секунд на основі тексту, зображень або документів. Для індустрії text-to-video це помітний стрибок: більшість актуальних моделей досі впевнено тримають якість лише на коротких кліпах у кілька секунд, а довші сцени доводиться нарізати і склеювати вручну.
За даними The Decoder, Wan3.0 — це наступне покоління лінійки Wan від Alibaba, і компанія позиціонує реліз як крок вперед одразу за двома параметрами: якістю картинки та тривалістю відео порівняно з попередніми версіями моделі.
Для команд, які будують контент-пайплайни на базі генеративного відео, ключова новина не в самому факті релізу, а в тому, що китайський гравець знову скорочує дистанцію до лідерів ринку — і робить це на трьох вхідних форматах одразу: текстовому промпті, зображенні та документі.
Що саме вміє Wan3.0?
Модель приймає три типи вхідних даних — текстовий опис, зображення або документ — і на їхній основі генерує відео тривалістю до 30 секунд. Це помітно ширший діапазон, ніж у попередніх ітерацій Wan, де тривалість і стабільність картинки на довгих сценах були слабким місцем.
- Text-to-video: генерація ролика з текстового промпту.
- Image-to-video: анімація статичного зображення в динамічну сцену.
- Document-to-video: перетворення вмісту документа у відеоряд — фактично автоматизація сценарію «текст на слайдах → відео».
Саме document-to-video виділяє Wan3.0 на фоні типових text-to-video інструментів: замість того щоб вручну писати промпт для кожної сцени, можна віддати моделі готовий документ (звіт, статтю, презентацію) і отримати чернетку відео на виході.
Чим це відрізняється від того, що вже є на ринку?
Головна проблема сучасних відеогенераторів — не якість окремого кадру, а узгодженість довгої сцени: персонажі «пливуть», фон змінюється, рух втрачає фізичну логіку вже на п'ятій-десятій секунді. Більшість flagship-моделей тримають прийнятну якість на короткому вікні, а довші ролики збирають зі стиків кількох окремих генерацій.
Тридцять секунд суцільної генерації — це, ймовірно, найпомітніший аргумент Wan3.0 у конкуренції з Sora, Veo та Kling: якщо консистентність на цьому вікні справді витримується, модель закриває один із головних больових пунктів AI-відео для рекламних роликів, коротких пояснювальних відео та соцмережевого контенту, де 20–30 секунд — типова тривалість формату.
Кому це реально здешевить контент-пайплайн?
Найбільший практичний виграш отримають команди, які вже сьогодні виробляють короткий відеоконтент у великому обсязі:
- Маркетинг і перформанс-реклама — швидкі варіації креативів під A/B-тести без зйомки.
- Контент-студії та YouTube Shorts/Reels-канали — чернетки роликів із готового тексту сценарію.
- Продуктові команди — демо-відео з наявних скріншотів чи документації без відеографа.
- Локалізація — швидка адаптація одного сценарію під різні ринки без повторної зйомки.
Для складнішого продакшену — брендованого контенту з жорсткими вимогами до консистентності персонажа в кадрі — модель поки варто розглядати як інструмент для чернеток і препродакшену, а не для фінального рендеру без ручної правки.
Що з цим робити зараз AI-білдерам?
Перший крок — протестувати Wan3.0 саме на document-to-video сценарії, оскільки це найменш поширена функція серед конкурентів і найбільш пряма економія часу для контент-команд: замість промпт-інжинірингу під кожен кадр модель бере вже готовий текст.
Другий крок — порівняти консистентність на повних 30 секундах, а не на демо-кліпах з реліз-анонсу: саме на довгій дистанції зазвичай і ламаються обіцянки відеомоделей. Якщо плануєте вбудовувати генерацію відео в продукт чи внутрішній пайплайн, варто закласти час на пілот із реальними промптами вашої ніші, а не орієнтуватися на маркетингові приклади з анонсу.
Висновок AiiN
Wan3.0 — це не просто чергове оновлення китайської моделі, а сигнал того, що поріг «довгого» AI-відео зсувається з кількох секунд до півхвилини швидше, ніж очікувала індустрія. За нашою оцінкою, найбільший ефект від цього релізу відчують не студії преміального контенту, а масовий сегмент — перформанс-маркетинг і соцмережевий контент, де формат 20–30 секунд і так є стандартом, а не творчим обмеженням. Якщо Alibaba втримає темп релізів на рівні західних конкурентів, гонка text-to-video цього року вирішуватиметься не тільки якістю кадру, а тим, хто першим зробить довгу сцену справді стабільною.
Чи можна вже використовувати Wan3.0 у комерційних проєктах?
Це залежить від умов ліцензування конкретного релізу та доступності API чи ваг моделі, які варто перевірити безпосередньо перед інтеграцією в продукт — деталі доступу в новині The Decoder не деталізуються.
Чим document-to-video відрізняється від звичайного text-to-video?
Text-to-video працює з коротким промптом для однієї сцени, тоді як document-to-video бере структурований текст — статтю, звіт, сценарій — і перетворює його на послідовність сцен, фактично автоматизуючи розкадровку.
Чим Wan3.0 відрізняється від попередніх версій Wan?
Головна заявлена відмінність — тривалість генерації: попередні версії Wan, за даними The Decoder, поступалися Wan3.0 і в якості картинки, і в довжині відео, тоді як нова модель дотягує суцільну сцену до 30 секунд без склеювання окремих кліпів.