Facet-0 — так називається нова foundation-модель для роботів, яку дослідники представили в препринті на arXiv у вересні 2026 року. На відміну від більшості великих мультимодальних моделей, орієнтованих на текст і зображення, Facet-0 спеціалізується на точних контактних маніпуляціях: рухах, де робот фізично взаємодіє з об'єктом і мусить контролювати силу, кут дотику й траєкторію з високою точністю.

За даними arXiv, це черговий приклад того, як foundation-моделі — архітектури, натреновані на великих масивах даних для перенесення знань на безліч задач, — переходять із суто цифрового домену у фізичний світ роботів. Раніше цей підхід довів силу в мовних моделях і генерації зображень; тепер той самий принцип «одна велика модель — багато задач» перевіряють на фізичних маніпуляціях об'єктами.

Для індустрії роботів це не косметична новина. Точні контактні маніпуляції — вставити штекер у розетку, повернути ключ, зібрати деталь із заданим зусиллям затиску — залишаються одним із найслабших місць сучасних моделей для роботів, навіть тих, які вже впевнено справляються з простим захопленням об'єктів.

Чим контактні маніпуляції відрізняються від «просто взяти предмет»?

У робототехніці задачі маніпуляції прийнято ділити на дві категорії за складністю фізичної взаємодії. Перша — вільний рух і захоплення (pick-and-place): робот бере об'єкт, переносить і кладе, майже не контролюючи силу контакту. Друга — контактні (contact-rich) маніпуляції, де результат залежить від точного контролю сили, моменту й траєкторії протягом усього руху, а не лише в момент захоплення.

Типові приклади другої категорії:

Саме на цьому класі задач, згідно з описом публікації, і сфокусована Facet-0 — модель, орієнтована на точність дотику, а не на універсальне розпізнавання сцен чи виконання мовних інструкцій.

Чому це складно навіть для великих foundation-моделей?

Мовні та image-моделі тренують на мільярдах текстових і візуальних прикладів із відкритого інтернету. У робототехніці такого масштабу даних не існує: кожен приклад фізичної взаємодії — це запис із реального робота або симулятора, а не скачаний із мережі текст чи фото. Це фундаментальне обмеження, через яке foundation-моделі для роботів відстають від мовних і візуальних аналогів на кілька років розвитку.

Додатково контактні задачі чутливі до розриву між симуляцією і реальністю (sim-to-real gap): модель, натренована у фізичному симуляторі, часто не переносить точність контролю сили на реального робота, бо тертя, пружність матеріалів і затримки сенсорів у симуляції завжди спрощені порівняно з реальністю. Ймовірно, саме тому дослідники виділяють контактні маніпуляції в окремий напрям, а не намагаються «дотренувати» наявні generalist-моделі.

Наскільки конкурентний зараз цей напрям?

Facet-0 з'являється не у вакуумі. Останні кілька років foundation-моделі для роботів рухаються від вузьких single-task контролерів до universal policy-моделей, здатних виконувати десятки задач без перенавчання з нуля для кожної. Facet-0 вписується в цей рух, але обирає вужчу спеціалізацію — не «все й одразу», а саме точність контакту, де generalist-моделі поки поступаються спеціалізованим системам промислової автоматизації.

Що це означає для AI-білдерів?

Наша теза в AiiN проста: робототехніка проходить той самий шлях, що текстові й image-моделі кілька років тому, — від вузькоспеціалізованих систем до foundation-моделей, які переносять знання між задачами. Але, за нашою оцінкою, цей шлях у робототехніці навряд буде лінійним «більша модель — краще на всьому»: поруч із generalist-моделями, ймовірно, зростатиме клас спеціалізованих foundation-моделей під конкретні класи фізичної взаємодії — так само, як Facet-0 спеціалізується під контактні маніпуляції.

Для тих, хто будує AI-продукти навколо роботів чи автоматизації, практичний висновок такий: не варто чекати на одну «GPT для роботів», яка закриє всі задачі одразу. Радше варто стежити за спеціалізованими препринтами на кшталт Facet-0 — саме вони найшвидше показують, де зараз реальна межа можливостей індустрії.

Чи можна вже використати Facet-0 у своєму продукті?

Наразі Facet-0 — це дослідницька публікація на arXiv, а не готовий продукт чи публічний API. Інформації про відкриття коду або ваг моделі в короткому описі публікації немає, тож для комерційного застосування варто стежити за оновленнями від авторів.

Чим Facet-0 відрізняється від «generalist» моделей для роботів?

Ключова відмінність — фокус. Generalist-моделі намагаються охопити широкий спектр задач, від навігації до виконання мовних інструкцій; Facet-0, за описом, спеціалізується вужче — на точних контактних маніпуляціях, де потрібен контроль сили й траєкторії, а не лише розпізнавання сцени.

Чому контактні маніпуляції взагалі проблема для роботів?

Бо результат тут залежить не від того, чи торкнувся робот об'єкта, а від того, наскільки точно він контролює силу й момент протягом усього руху — а даних про такі фізичні взаємодії з реального світу на порядки менше, ніж текстів чи фотографій в інтернеті.