Runway показала GWM Worlds 2 — research preview, що перетворює генерацію відео й аудіо на інтерактивну симуляцію в реальному часі з потоком 720p на 24 fps і аудіо на 48 000 Гц.

Для білдера це спосіб швидко перевірити гіпотезу: зафіксувати перший кадр, додати події з мітками часу і подивитися, як світ реагує на підказки в реальному часі. За даними Latent Space команда називає модель autoregressive diffusion і генерує світ кадр за кадром, а не кліпом цілком.

Що таке WorldPrompt і чим він керує?

WorldPrompt — це шар керування персонажами, камерою та середовищем, який задає світ і дії в ньому.

Ви фіксуєте частину світу, зокрема перший кадр, і додаєте серію подій із мітками часу. Події можна задавати навіть у реальному часі, як репліки NPC, що підходить і говорить до гравця. Як описав Principal Research Scientist Робін Каллов, це спосіб «контролювати всіх суб’єктів у світі» на кшталт комп’ютерної гри.

На відміну від Minecraft чи Roblox, WorldPrompt — це механізм підказок, а не мова програмування: скриптів і прямого керування станом немає. СТО Каміл Сінді наголошує, що це дає змогу створювати світи на вимогу з синхронним відео та аудіо в різних доменах, і це вже не гіпотетичне майбутнє.

Надійність залежить від складності дії. За словами Каллова, рух працює доволі стабільно, а закон гравітації чи нова здатність персонажа вдаються нерівно, бо це research preview. Сінді додає, що більше тренування та масштабування даних і моделей покращує слідування інструкціям.

Як відеомодель стає рантаймом у реальному часі?

Перетворити генерацію кліпів на рантайм — це дві окремі задачі: генерувати кадр за кадром, поки глядач дивиться, і робити це досить швидко.

Runway спершу донавчила базову аудіо-відео модель на формат WorldPrompt, щоб вона його розуміла, а потім посттренувала її для авторегресивної генерації. Далі команда прискорює інференс методами дистиляції. Співзасновник і спів-СЕО Анастасіс Германідіс пояснив логіку в подкасті: стартують із двонаправленої дифузії, яка генерує все відео одразу, і роблять її авторегресивною, щоб видавати один або кілька кадрів за раз.

Дистиляція йде двома шляхами: стисненням більшої моделі в меншу або скороченням кроків дифузії. Як приклад Германідіс навів перехід з приблизно 50 кроків шумозаглушення до чотирьох — з певною втратою якості, але зі співмірним результатом.

Runway, за повідомленнями, коштує $5,3 млрд після залучення $315 млн у лютому, першу GWM Worlds компанія випустила в грудні. Поруч — Google DeepMind Genie 3 (також 720p на 24 fps), Odyssey-2 Pro та RTFM (Real-Time Frame Model) від World Labs, але всі проєкти поки обмежені тривалістю сесії: у Google прямо вказують, що Genie 3 тримає кілька хвилин безперервної взаємодії, а не години.

Де модель ламається: пам’ять і накопичення помилок?

Найбільший виклик авторегресії — накопичення помилок, бо модель подає власні згенеровані кадри назад на вхід.

Дрібні артефакти з часом підсилюються, тож довга сцена пливе. Друга проблема — «нескінченна» генерація: треба вирішувати, який контекст зберігати, а який відкидати, щоб не вибухнула пам’ять GPU. За словами Сінді, це окремі оптимізації керування контекстом.

Довготривала пам’ять залишається відкритою дослідницькою задачею: модель не пам’ятає все ідеально, нагадав Каллов. Ймовірно, причинність і коректність фізики доведеться перевіряти окремо, а не покладатися на промпт як на код.

Що протестувати вже зараз?

Якщо потрібна симуляція швидко, дійте так: