Голова Unitree Ван Сінсін заявляє, що фізичний ШІ отримає свій «ChatGPT-момент» за 2-3 роки: за його словами, найближчим часом зʼявляться масові рішення, які дозволять роботам виконувати завдання в реальному світі без окремого тренування під кожну конкретну задачу.

Unitree — китайський виробник гуманоїдних і чотириногих роботів, один із найпомітніших брендів цього сегмента, тож заяви її керівництва традиційно сприймають як орієнтир для галузі. За даними Mezha, компанія розраховує, що прорив станеться не в лабораторних демо, а у практичних, масово тиражованих продуктах.

Формулювання «ChatGPT-момент» тут не випадкове: воно натякає на різкий перехід від вузькоспеціалізованих моделей до системи загального призначення, яку не треба переналаштовувати під кожен новий сценарій. Саме це — головна перешкода, яка досі стримує масове застосування роботів поза складальними лініями та контрольованими демо-майданчиками.

Що саме прогнозує CEO Unitree?

Ван Сінсін прогнозує, що протягом 2-3 років зʼявляться масові рішення у фізичному ШІ — моделі, які керують тілом робота так само узагальнено, як великі мовні моделі керують текстом. Ключова теза — роботи зможуть працювати в реальному світі без спеціального навчання під кожне окреме завдання: сьогодні ж більшість промислових і сервісних роботів усе ще потребують ручного тренування або жорсткого програмування під конкретний сценарій, склад приміщення чи тип об'єкта, з яким вони взаємодіють.

Практично це означає перехід від вузьких policy-моделей, натренованих під один тип маніпуляції (взяти коробку, скласти деталь), до generalist-моделей, здатних адаптуватися на льоту до нового об'єкта чи середовища без окремого циклу дотренування.

Що таке фізичний ШІ і чим він відрізняється від звичайних LLM?

Фізичний ШІ (physical AI) — це клас моделей, які поєднують сприйняття (зір, дотик, пропріоцепцію), планування дій і керування тілом робота в реальному часі, а не лише генерують текст чи зображення. На відміну від мовних моделей, які працюють з дискретними токенами в контрольованому цифровому середовищі, фізичний ШІ має справу з безперервним фізичним простором, шумними сенсорами і незворотними наслідками помилки — впущена деталь чи зіткнення з людиною коштують дорожче, ніж невдала відповідь чат-бота.

Саме тому «момент ChatGPT» тут спрацьовує складніше: мовним моделям вистачило масштабування даних і обчислень на текстовому корпусі інтернету, а даних про фізичну взаємодію зі світом у порівнюваному обсязі просто не існує — їх доводиться збирати через симуляції, телеоперацію та реальні експерименти зі значно вищою вартістю ітерації.

Наскільки реалістичний термін у 2-3 роки?

Термін у 2-3 роки узгоджується з тим, куди зараз рухається індустрія: конкуренти Unitree також публічно говорять про масштабовані рішення для фізичного ШІ в порівнянному горизонті. За нашою оцінкою, реалістичніший сценарій — це не одномоментний «стрибок», а поступове розширення діапазону задач, які роботи виконують без перетренування: спочатку у складських і виробничих сценаріях, а вже потім — у менш контрольованих середовищах на кшталт побуту чи роздрібної торгівлі.

Ризик такого прогнозу класичний для галузі робототехніки: часові рамки від CEO виробника обладнання історично схильні бути оптимістичнішими за фактичні терміни виходу технології на масовий ринок. Про подібний розрив між очікуваннями і реальним темпом автоматизації ми вже писали в матеріалі про те, чому ШІ поки не замінить певні професії — і механіка там схожа: технічна демонстрація можливості не дорівнює готовому, надійному продукту для щоденної експлуатації.

Що з цим робити AI-білдерам вже зараз?

Наша теза в AiiN проста: інтеграцію фізичних AI-моделей варто планувати вже зараз, а не чекати на готовий «ChatGPT-момент» для роботів. Продуктові команди, які працюють із роботизацією, логістикою чи фізичною автоматизацією, отримають перевагу, якщо закладуть архітектуру під генералістичні моделі керування вже на етапі проєктування — так само, як компанії, що рано перейшли на API великих мовних моделей, випередили тих, хто продовжував тренувати вузькі класифікатори під кожен окремий кейс.

Практично це означає три речі:

Що означає «ChatGPT-момент» для роботів?

Це умовна назва моменту, коли вузькоспеціалізовані моделі керування роботами поступаються місцем узагальненим системам, здатним виконувати нові фізичні завдання без окремого перетренування — за аналогією з тим, як великі мовні моделі свого часу замінили десятки вузьких NLP-рішень.

Чи варто стартапам вже зараз інтегрувати physical AI у продукти?

Так, принаймні на рівні пілотів: варто тестувати доступні generalist-моделі керування на власних сценаріях і паралельно збирати дані про фізичну взаємодію вже зараз, оскільки якісний власний датасет стане конкурентною перевагою, коли базові моделі стануть загальнодоступними.