Runway показала GWM Worlds 2 — research preview, що перетворює генерацію відео й аудіо на інтерактивну симуляцію в реальному часі з потоком 720p на 24 fps і аудіо на 48 000 Гц.
Для білдера це спосіб швидко перевірити гіпотезу: зафіксувати перший кадр, додати події з мітками часу і подивитися, як світ реагує на підказки в реальному часі. За даними Latent Space команда називає модель autoregressive diffusion і генерує світ кадр за кадром, а не кліпом цілком.
Що таке WorldPrompt і чим він керує?
WorldPrompt — це шар керування персонажами, камерою та середовищем, який задає світ і дії в ньому.
Ви фіксуєте частину світу, зокрема перший кадр, і додаєте серію подій із мітками часу. Події можна задавати навіть у реальному часі, як репліки NPC, що підходить і говорить до гравця. Як описав Principal Research Scientist Робін Каллов, це спосіб «контролювати всіх суб’єктів у світі» на кшталт комп’ютерної гри.
На відміну від Minecraft чи Roblox, WorldPrompt — це механізм підказок, а не мова програмування: скриптів і прямого керування станом немає. СТО Каміл Сінді наголошує, що це дає змогу створювати світи на вимогу з синхронним відео та аудіо в різних доменах, і це вже не гіпотетичне майбутнє.
Надійність залежить від складності дії. За словами Каллова, рух працює доволі стабільно, а закон гравітації чи нова здатність персонажа вдаються нерівно, бо це research preview. Сінді додає, що більше тренування та масштабування даних і моделей покращує слідування інструкціям.
Як відеомодель стає рантаймом у реальному часі?
Перетворити генерацію кліпів на рантайм — це дві окремі задачі: генерувати кадр за кадром, поки глядач дивиться, і робити це досить швидко.
Runway спершу донавчила базову аудіо-відео модель на формат WorldPrompt, щоб вона його розуміла, а потім посттренувала її для авторегресивної генерації. Далі команда прискорює інференс методами дистиляції. Співзасновник і спів-СЕО Анастасіс Германідіс пояснив логіку в подкасті: стартують із двонаправленої дифузії, яка генерує все відео одразу, і роблять її авторегресивною, щоб видавати один або кілька кадрів за раз.
Дистиляція йде двома шляхами: стисненням більшої моделі в меншу або скороченням кроків дифузії. Як приклад Германідіс навів перехід з приблизно 50 кроків шумозаглушення до чотирьох — з певною втратою якості, але зі співмірним результатом.
Runway, за повідомленнями, коштує $5,3 млрд після залучення $315 млн у лютому, першу GWM Worlds компанія випустила в грудні. Поруч — Google DeepMind Genie 3 (також 720p на 24 fps), Odyssey-2 Pro та RTFM (Real-Time Frame Model) від World Labs, але всі проєкти поки обмежені тривалістю сесії: у Google прямо вказують, що Genie 3 тримає кілька хвилин безперервної взаємодії, а не години.
Де модель ламається: пам’ять і накопичення помилок?
Найбільший виклик авторегресії — накопичення помилок, бо модель подає власні згенеровані кадри назад на вхід.
Дрібні артефакти з часом підсилюються, тож довга сцена пливе. Друга проблема — «нескінченна» генерація: треба вирішувати, який контекст зберігати, а який відкидати, щоб не вибухнула пам’ять GPU. За словами Сінді, це окремі оптимізації керування контекстом.
Довготривала пам’ять залишається відкритою дослідницькою задачею: модель не пам’ятає все ідеально, нагадав Каллов. Ймовірно, причинність і коректність фізики доведеться перевіряти окремо, а не покладатися на промпт як на код.
Що протестувати вже зараз?
Якщо потрібна симуляція швидко, дійте так:
- Зафіксуйте перший кадр і додайте кілька подій з мітками часу, потім перевірте рух і зміну камери, перш ніж ускладнювати фізику.
- Проганяйте один сценарій з різними підказками NPC і камери, фіксуйте дрейф і відсіюйте епізоди з артефактами.
- Тримайте сесії короткими: плануйте взаємодію на хвилини, а не години, і логуйте контекст.
- Перевіряйте закони світу кодом або окремим верифікатором, а WorldPrompt використовуйте для варіативності.