Infinite-Dreamer синтезує переходи екранів для тренування GUI-агентів: донавчений на цих даних Infinite-Actor-8B додає +4,45 до Pass@1 на AndroidWorld.
Щоб зібрати траєкторії «натиснув — бачу результат», команді потрібні або люди-оператори, або симулятори. Обидва шляхи дорогі. За даними arXiv, роботу «Imagine to Act» подали 5 жовтня 2026 року: у ній пропонують відмовитися від симуляції й синтезувати переходи екранів як редагування зображень.
Чого не передають описи екрана текстом?
Наявні світові моделі для GUI-агентів описують екран словами або рендерять його з HTML, а піксельні деталі на кшталт іконок і стилів компонування при цьому зникають. Infinite-Dreamer будує синтез на піксельному рівні, щоб ці деталі залишалися в згенерованому екрані.
Людські демонстрації дають реальні траєкторії, але їх не масштабувати на величезну кількість застосунків і станів екрана. Саме ця обмеженість і робить тренування сильних агентів дорогим.
Як Infinite-Dreamer домальовує наступний екран?
Infinite-Dreamer трактує перехід інтерфейсу як задачу редагування зображення. Спочатку візіально-мовна модель (VLM) описує зміну, яку має викликати дія, у вигляді структурованого тексту описів — delta-тексту. Потім навчена на цих описах модель редагування зображень синтезує наступний скриншот.
Згенеровані дані Infinite-Dreamer бувають двох типів: однокадрові приклади для візуальної стійкості та багатокрокові уявні траєкторії.
Що показали тести на трьох бенчмарках?
Infinite-Actor — це Qwen3-VL, донавчений лише на синтезованих даних. Версія Infinite-Actor-8B покращує Pass@1 на AndroidWorld на +4,45, а на MobileWorld майже подвоює показник успішності Pass@3.
Infinite-Actor-2B додає +9,05 до Pass@1 порівняно з базовою Qwen3-VL. Обидві моделі перевіряли на AndroidWorld, MobileWorld і AndroidControl-Curated.
Найімовірніше, найбільший виграш дадуть продукти з нестандартними іконками й частими редизайнами, де HTML-рендер помиляється найчастіше. Такий синтез варто поєднувати з незалежною перевіркою результату — як у підході перевірка заяви агента даними з бази.
Що робити зараз
Почати варто з короткого пілота на екранах, де агент помиляється найчастіше.
- Відберіть екрани, де агент плутає іконки чи елементи компонування, і згенеруйте для них варіації вигляду.
- Донавчіть копію Qwen3-VL лише на синтезованих переходах і заміряйте Pass@1 на AndroidWorld або на власному наборі завдань.
- Додайте незалежну перевірку дії в базі або API перед тим, як показувати результат користувачеві.








