Fei-Fei Li, співзасновниця стартапу World Labs, представила мультимодальну модель Atlas — систему, яка генерує кадри зображень і відео з точним керуванням віртуальною камерою, а потім відтворює отриману сцену у повноцінному 3D-просторі. За даними Techmeme, реліз позиціонується компанією як черговий крок у розвитку так званих «world models» — моделей світу, що претендують на статус окремого класу поряд із великими мовними моделями.
World Labs заснували 2024 року дослідники з бекграундом у computer vision, і компанія від самого початку будує позиціонування навколо ідеї «просторового інтелекту»: здатності системи розуміти тривимірну геометрію сцени, а не лише оперувати текстом чи плоскими пікселями. Atlas — не перший публічний продукт компанії в цьому напрямку, але це перша модель, яка прямо поєднує генерацію зображень і відео з керуванням камерою та наступною 3D-реконструкцією в одному пайплайні.
Для індустрії, що останні три роки була одержима масштабуванням мовних моделей, це помітний сигнал: частина капіталу й дослідницької уваги зараз перетікає в напрямок, де текст — не головна модальність.
Що саме зробила World Labs?
Atlas — мультимодальна модель, яка на вхід приймає зображення чи текстовий опис сцени, а на вихід видає послідовність кадрів (зображення або відео) з можливістю точно задавати рух камери — панораму, обліт, зміну ракурсу — і при цьому зберігати геометричну узгодженість сцени між кадрами.
Ключова відмінність від типового відеогенератора — те, що результат не обмежується плоским відеорядом. Згенеровані кадри конвертуються у тривимірне представлення сцени, яке можна досліджувати з довільних точок огляду, а не лише переглядати як лінійний ролик. Це принципово інша задача, ніж «намалювати гарну картинку»: модель має тримати в узгодженому стані геометрію, освітлення й об’єкти сцени під час зміни ракурсу камери.
Чим world models відрізняються від LLM під капотом?
Мовна модель передбачає наступний токен тексту; world model передбачає наступний стан сцени — як вона виглядатиме, якщо камера чи об’єкт у ній зрушаться. World models — це клас моделей, натренованих не на текстових корпусах, а на просторово-часових даних (відео, 3D-сцени, траєкторії руху), із метою навчитися внутрішньому уявленню про фізичний світ: геометрію, причинність, сталість об’єктів при зміні ракурсу.
Практична різниця для розробника відчутна одразу:
- LLM оцінюється на зв’язності тексту й логіці міркувань; world model — на геометричній консистентності сцени між кадрами.
- Вихід LLM — послідовність токенів; вихід моделі на кшталт Atlas — кадри плюс тривимірне представлення, придатне для рендерингу під іншим кутом.
- Керування відбувається не промптом-текстом, а явним параметром камери — траєкторією руху в просторі.
Кому це реально знадобиться найближчим часом?
Найочевидніші користувачі Atlas — команди, що працюють із синтетичними середовищами: розробники ігор та інтерактивних 3D-сцен, студії, які генерують preview-локації без ручного моделювання, і дослідники робототехніки та автономних систем, яким потрібні реалістичні симуляційні середовища для тренування агентів.
Ймовірно, найбільший практичний ефект Atlas дасть саме там, де досі 3D-сцену доводилося будувати вручну в редакторі: попередня візуалізація локацій, швидкі концепт-прототипи ігрових рівнів, генерація тренувальних середовищ для robotics-симуляторів. Для класичних задач AI-білдера — чат-боти, RAG, агенти на базі LLM — Atlas прямого застосування не має: це інша модальність і інший стек.
Висновок AiiN: що це означає для індустрії
За нашою оцінкою, головна цінність Atlas не в конкретній демці, а в підтвердженні того, що world models остаточно стають окремою інженерною дисципліною зі своїм стеком — даними, метриками якості й API, — а не побічним експериментом при відеогенераторах. Для AI-білдера практичний висновок простий: якщо продукт передбачає 3D-контент, симуляційні середовища чи керовану камерою генерацію відео, варто закладати архітектуру під окрему модальність world model, а не намагатися дотягнути до цього LLM або звичайний text-to-video пайплайн.
Що таке world model простими словами?
World model — це модель, натренована передбачати, як змінюється сцена або середовище в часі й просторі, а не яке слово йде наступним у тексті. Вона будує внутрішнє уявлення про геометрію, фізику та причинність світу, тому може генерувати узгоджені кадри при зміні ракурсу камери чи русі об’єктів.
Чи замінить Atlas інструменти 3D-моделювання?
Найближчим часом — ні. Atlas генерує сцени та їхнє 3D-представлення з зображень чи відео, але контроль над точною геометрією, топологією об’єктів і виробничими вимогами, які дають професійні 3D-редактори, поки залишається за традиційними інструментами. Радше йдеться про швидке прототипування та preview, а не про заміну production-пайплайну.
Чим Atlas відрізняється від попередніх продуктів World Labs?
Головна відмінність — поєднання в одній моделі генерації кадрів із явним керуванням камерою та автоматичною 3D-реконструкцією сцени в одному пайплайні, тоді як попередні розробки компанії фокусувалися вужче на окремих етапах цього процесу.