Alibaba випустила модель Wan3.0, яка генерує до 30 секунд відео безпосередньо з документів, таблиць, презентацій та вебсторінок — без проміжного кроку через текстовий промпт. Це відрізняє її від класичних text-to-video систем, де користувач описує сцену словами, а модель домальовує все інше.
За фактом, Wan3.0 перетворює структуровані джерела — Excel-таблицю з даними, PDF зі слайдами, HTML-сторінку продукту — на готовий відеоряд. За даними Techmeme, це суттєво розширює можливості document-to-video генерації порівняно з попередніми версіями лінійки Wan.
Для команд, що щодня клепають рекламні ролики з прайс-листів чи презентаційні відео з піч-деків, це не косметичне оновлення, а зміна робочого процесу: вхідною точкою стає файл, який і так вже існує в компанії, а не окремий текстовий промпт, який ще треба написати і відшліфувати.
Що саме змінилося у Wan3.0?
Головна відмінність — вхідні дані. Попередні версії Wan, як і Sora від OpenAI чи Veo від Google DeepMind, працюють переважно за принципом «текст або зображення → відео». Wan3.0 додає document-to-video як окремий режим: модель приймає документ, таблицю, презентацію чи вебсторінку і сама вирішує, як розкласти вміст у 30-секундну відеооповідь — які дані показати текстом на екрані, де вставити перехід, що анімувати.
Практично це означає менше ручної роботи на етапі «опиши, що ти хочеш побачити». Модель бере готову структуру документа — заголовки, списки, цифри в таблиці — і сама перекладає її у візуальну послідовність.
Чим це небезпечно для Sora та Veo?
Пряма конкуренція тут у тому, що Sora та Veo сильні саме в кінематографічній якості генерації за текстовим або графічним промптом, а не в перетворенні «офісних» файлів на відео. Wan3.0 займає нішу, яку жодна з двох великих моделей поки не закриває напряму: масове перетворення вже наявного контенту — каталогів, звітів, лендінгів — у відеоформат.
- Sora (OpenAI) — фокус на художній і кінематографічній генерації за промптом.
- Veo (Google DeepMind) — інтеграція з екосистемою Google, акцент на якості руху і фізики сцени.
- Wan3.0 (Alibaba) — вхід через готові документи, а не текстовий промпт.
За нашою оцінкою, швидкість поширення Wan3.0 у реальних контент-пайплайнах залежатиме передусім від того, наскільки просто Alibaba відкриє до неї доступ через API чи партнерства — компаніям, яким потрібен масовий, а не штучний відеоконтент, доступність важливіша за саму технологію.
Кому і навіщо це знадобиться вже зараз?
Найочевидніший сценарій використання — маркетинг і e-commerce: перетворення карток товару, прайс-листів чи презентацій на відеорекламу без окремого продакшена. Другий сценарій — корпоративні комунікації, де квартальний звіт чи піч-дек можна одразу перетворити на короткий відеосамарі для внутрішньої розсилки чи соцмереж.
Найшвидше document-to-video приживеться саме в контент-пайплайнах з високим об'ємом і низькою творчою планкою — де раніше відео просто не робили через дорожнечу продакшена, а не там, де конкурують за художню якість із Sora.
На що звернути увагу перед впровадженням?
Найбільший практичний ризик document-to-video — це точність передачі даних. Якщо модель бере цифри з таблиці й переносить їх у відеоряд, будь-яка помилка інтерпретації — переплутана колонка, невірно зчитана одиниця виміру — одразу стає видимою в готовому ролику, а не ховається в тексті. Ймовірно, перші команди, що впроваджуватимуть Wan3.0, будуть перевіряти згенероване вручну — принаймні доки не накопичиться статистика точності на реальних документах.
Другий момент — бренд-консистентність: чи вміє Wan3.0 витримувати корпоративний стиль (кольори, шрифти, тон) при масовій генерації з різних вхідних файлів, чи кожне відео виглядатиме по-своєму. Для контент-пайплайну це критичніше, ніж художня якість окремого кадру.
Висновок AiiN
Wan3.0 показує напрямок, у якому відеогенерація рухається паралельно з «класичним» text-to-video: не кращий промпт, а менше промпту взагалі. Якщо модель справді вміє осмислено читати структуру документа — таблицю, ієрархію заголовків, послідовність слайдів — це знижує поріг входу для команд без досвіду в prompt-інжинірингу відео і зміщує конкуренцію в бік того, хто краще інтегрується з наявними інструментами, а не хто малює кінематографічніші кадри.
Що таке document-to-video генерація?
Document-to-video — це режим генерації, де вхідними даними є структурований файл: документ, таблиця, презентація чи вебсторінка, а не текстовий опис сцени. Модель сама визначає, які елементи документа показати, в якій послідовності й з якою анімацією, скорочуючи шлях від готового контенту до відео.
Чи означає це, що Sora і Veo відстають?
Ні — йдеться про різні ніші всередині одного ринку. Sora і Veo лишаються сильнішими у творчій, кінематографічній генерації за промптом, тоді як Wan3.0 конкурує в масовому перетворенні наявного контенту на відео, де швидкість і об'єм важливіші за художню довершеність кадру.