# Infinite-Dreamer тренує GUI-агентів на домальованих екранах

> Infinite-Dreamer генерує переходи екранів як редагування зображень: Infinite-Actor-2B додає +9,05 до Pass@1 на AndroidWorld, а 8B-модель — +4,45.

- Опубліковано: 6 жовтня 2026 р. (2026-10-06T02:20:32.452907+00:00)
- Розділ: Агенти
- На основі публікації: [arXiv](http://arxiv.org/abs/2610.05861v1)
- Видання: AiiN (https://aiin.news)
- URL: https://aiin.news/article?slug=infinite-dreamer-%D1%82%D1%80%D0%B5%D0%BD%D1%83%D1%94-gui-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82%D1%96%D0%B2-%D0%BD%D0%B0-%D0%B4%D0%BE%D0%BC%D0%B0%D0%BB%D1%8C%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D1%85-%D0%B5%D0%BA%D1%80%D0%B0%D0%BD%D0%B0%D1%85

---

Infinite-Dreamer синтезує переходи екранів для тренування GUI-агентів: донавчений на цих даних Infinite-Actor-8B додає +4,45 до Pass@1 на AndroidWorld.

Щоб зібрати траєкторії «натиснув — бачу результат», команді потрібні або люди-оператори, або симулятори. Обидва шляхи дорогі. [За даними arXiv](http://arxiv.org/abs/2610.05861v1), роботу «Imagine to Act» подали 5 жовтня 2026 року: у ній пропонують відмовитися від симуляції й синтезувати переходи екранів як редагування зображень.

## Чого не передають описи екрана текстом?

Наявні світові моделі для GUI-агентів описують екран словами або рендерять його з HTML, а піксельні деталі на кшталт іконок і стилів компонування при цьому зникають. Infinite-Dreamer будує синтез на піксельному рівні, щоб ці деталі залишалися в згенерованому екрані.

Людські демонстрації дають реальні траєкторії, але їх не масштабувати на величезну кількість застосунків і станів екрана. Саме ця обмеженість і робить тренування сильних агентів дорогим.

## Як Infinite-Dreamer домальовує наступний екран?

Infinite-Dreamer трактує перехід інтерфейсу як задачу редагування зображення. Спочатку візіально-мовна модель (VLM) описує зміну, яку має викликати дія, у вигляді структурованого тексту описів — delta-тексту. Потім навчена на цих описах модель редагування зображень синтезує наступний скриншот.

Згенеровані дані Infinite-Dreamer бувають двох типів: однокадрові приклади для візуальної стійкості та багатокрокові уявні траєкторії.

## Що показали тести на трьох бенчмарках?

Infinite-Actor — це Qwen3-VL, донавчений лише на синтезованих даних. Версія Infinite-Actor-8B покращує Pass@1 на AndroidWorld на +4,45, а на MobileWorld майже подвоює показник успішності Pass@3.

Infinite-Actor-2B додає **+9,05** до Pass@1 порівняно з базовою Qwen3-VL. Обидві моделі перевіряли на AndroidWorld, MobileWorld і AndroidControl-Curated.

Найімовірніше, найбільший виграш дадуть продукти з нестандартними іконками й частими редизайнами, де HTML-рендер помиляється найчастіше. Такий синтез варто поєднувати з незалежною перевіркою результату — як у підході [перевірка заяви агента даними з бази](https://aiin.news/article?slug=thinkingbox-агент-сказав-готово-база-заперечила).

## Що робити зараз

Почати варто з короткого пілота на екранах, де агент помиляється найчастіше.

- Відберіть екрани, де агент плутає іконки чи елементи компонування, і згенеруйте для них варіації вигляду.
- Донавчіть копію Qwen3-VL лише на синтезованих переходах і заміряйте Pass@1 на AndroidWorld або на власному наборі завдань.
- Додайте незалежну перевірку дії в базі або API перед тим, як показувати результат користувачеві.

---

Теги: GUIагенти, InfiniteDreamer, Qwen3VL, AI, Агенти

Джерело: AiiN — https://aiin.news/article?slug=infinite-dreamer-%D1%82%D1%80%D0%B5%D0%BD%D1%83%D1%94-gui-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82%D1%96%D0%B2-%D0%BD%D0%B0-%D0%B4%D0%BE%D0%BC%D0%B0%D0%BB%D1%8C%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D1%85-%D0%B5%D0%BA%D1%80%D0%B0%D0%BD%D0%B0%D1%85. Цитуючи, посилайтесь на канонічний URL.
