Black Forest Labs випустила FLUX 3 Action — відкриту модель для робототехніки на 7 млрд параметрів, яка встановила рекорд успішності на RoboLab-120.

За даними The Decoder, ваги моделі вже доступні на Hugging Face. Для білдерів це відкрита база для прототипів роботів і embodied-агентів з можливістю роботи прямо на пристрої.

Що вміє FLUX 3 Action?

FLUX 3 Action прогнозує наступну дію агента й те, як зміниться середовище, на основі багатокамерного відео з робочого простору робота.

Модель побудована на мультимодальній FLUX 3, яку тренували переважно на відео, а також на зображеннях і аудіо. Як world-action модель вона бере на вхід потоки з кількох камер і видає одразу два прогнози: що робити далі та який буде ефект у світі.

Такий підхід обʼєднує розуміння сцени й планування дії в одній моделі. Ймовірно, саме це дає економію параметрів без втрати якості на RoboLab-120.

Наскільки вона ефективніша за попередників?

Вона ставить рекорд на RoboLab-120 з 7 млрд параметрів — це менш ніж половина розміру попередньої найкращої відкритої моделі.

За даними Black Forest Labs, модель працює до 3,95 раза швидше. Компанія прямо вказує на компроміс великих reasoning-моделей: вони добре планують, але завеликі й повільні для роботів. Така ефективність критична для on-device розгортання, де важлива кожна мілісекунда й ват. Схожу логіку економії ресурсів на пристроях розбирали в матеріалі про як Hugging Face здешевлює vision-моделі на пристроях.

Де це стане в пригоді крім цеху?

Black Forest Labs бачить застосування й у цифрових середовищах.

Відеоігри в компанії називають полігоном для навігації та швидких агентів, а наступний крок — агенти, що керують компʼютером. Контекст для агентних сценаріїв дивіться також у тексті про те, як Ando будує Slack для команд з людей і агентів.

Що робити зараз?

Модель відкрита, тож перевірити гіпотезу можна без переговорів про доступ. Почніть з офлайн-прогону на власних записах, щоб не ризикувати залізом.