Alibaba випустила модель генерації відео Wan3.0, яка створює ролики тривалістю до 30 секунд на основі тексту, зображень або документів. Для індустрії text-to-video це помітний стрибок: більшість актуальних моделей досі впевнено тримають якість лише на коротких кліпах у кілька секунд, а довші сцени доводиться нарізати і склеювати вручну.

За даними The Decoder, Wan3.0 — це наступне покоління лінійки Wan від Alibaba, і компанія позиціонує реліз як крок вперед одразу за двома параметрами: якістю картинки та тривалістю відео порівняно з попередніми версіями моделі.

Для команд, які будують контент-пайплайни на базі генеративного відео, ключова новина не в самому факті релізу, а в тому, що китайський гравець знову скорочує дистанцію до лідерів ринку — і робить це на трьох вхідних форматах одразу: текстовому промпті, зображенні та документі.

Що саме вміє Wan3.0?

Модель приймає три типи вхідних даних — текстовий опис, зображення або документ — і на їхній основі генерує відео тривалістю до 30 секунд. Це помітно ширший діапазон, ніж у попередніх ітерацій Wan, де тривалість і стабільність картинки на довгих сценах були слабким місцем.

Саме document-to-video виділяє Wan3.0 на фоні типових text-to-video інструментів: замість того щоб вручну писати промпт для кожної сцени, можна віддати моделі готовий документ (звіт, статтю, презентацію) і отримати чернетку відео на виході.

Чим це відрізняється від того, що вже є на ринку?

Головна проблема сучасних відеогенераторів — не якість окремого кадру, а узгодженість довгої сцени: персонажі «пливуть», фон змінюється, рух втрачає фізичну логіку вже на п'ятій-десятій секунді. Більшість flagship-моделей тримають прийнятну якість на короткому вікні, а довші ролики збирають зі стиків кількох окремих генерацій.

Тридцять секунд суцільної генерації — це, ймовірно, найпомітніший аргумент Wan3.0 у конкуренції з Sora, Veo та Kling: якщо консистентність на цьому вікні справді витримується, модель закриває один із головних больових пунктів AI-відео для рекламних роликів, коротких пояснювальних відео та соцмережевого контенту, де 20–30 секунд — типова тривалість формату.

Кому це реально здешевить контент-пайплайн?

Найбільший практичний виграш отримають команди, які вже сьогодні виробляють короткий відеоконтент у великому обсязі:

Для складнішого продакшену — брендованого контенту з жорсткими вимогами до консистентності персонажа в кадрі — модель поки варто розглядати як інструмент для чернеток і препродакшену, а не для фінального рендеру без ручної правки.

Що з цим робити зараз AI-білдерам?

Перший крок — протестувати Wan3.0 саме на document-to-video сценарії, оскільки це найменш поширена функція серед конкурентів і найбільш пряма економія часу для контент-команд: замість промпт-інжинірингу під кожен кадр модель бере вже готовий текст.

Другий крок — порівняти консистентність на повних 30 секундах, а не на демо-кліпах з реліз-анонсу: саме на довгій дистанції зазвичай і ламаються обіцянки відеомоделей. Якщо плануєте вбудовувати генерацію відео в продукт чи внутрішній пайплайн, варто закласти час на пілот із реальними промптами вашої ніші, а не орієнтуватися на маркетингові приклади з анонсу.

Висновок AiiN

Wan3.0 — це не просто чергове оновлення китайської моделі, а сигнал того, що поріг «довгого» AI-відео зсувається з кількох секунд до півхвилини швидше, ніж очікувала індустрія. За нашою оцінкою, найбільший ефект від цього релізу відчують не студії преміального контенту, а масовий сегмент — перформанс-маркетинг і соцмережевий контент, де формат 20–30 секунд і так є стандартом, а не творчим обмеженням. Якщо Alibaba втримає темп релізів на рівні західних конкурентів, гонка text-to-video цього року вирішуватиметься не тільки якістю кадру, а тим, хто першим зробить довгу сцену справді стабільною.

Чи можна вже використовувати Wan3.0 у комерційних проєктах?

Це залежить від умов ліцензування конкретного релізу та доступності API чи ваг моделі, які варто перевірити безпосередньо перед інтеграцією в продукт — деталі доступу в новині The Decoder не деталізуються.

Чим document-to-video відрізняється від звичайного text-to-video?

Text-to-video працює з коротким промптом для однієї сцени, тоді як document-to-video бере структурований текст — статтю, звіт, сценарій — і перетворює його на послідовність сцен, фактично автоматизуючи розкадровку.

Чим Wan3.0 відрізняється від попередніх версій Wan?

Головна заявлена відмінність — тривалість генерації: попередні версії Wan, за даними The Decoder, поступалися Wan3.0 і в якості картинки, і в довжині відео, тоді як нова модель дотягує суцільну сцену до 30 секунд без склеювання окремих кліпів.