Google DeepMind вивела Gemini 2 за межі чат-вікна: та сама модель, що відповідає на запити в Google Search і Workspace, тепер керує гуманоїдними роботами через окрему лінійку Gemini Robotics. За даними AI Business, компанія презентує Gemini 2 як одну з найпотужніших мультимодальних моделей у світі — з розширеними можливостями обробки тексту, зображень, аудіо та відео в одному запиті.
Для розробників це не чергове оновлення бенчмарків. Gemini 2 із самого початку проєктувалася як «агентна» модель: вона самостійно викликає інструменти — пошук, виконання коду, керування браузером — без додаткового оркестраційного шару поверх API. Саме здатність до нативного виклику інструментів і стала фундаментом, на якому DeepMind побудувала Gemini Robotics — систему класу vision-language-action, що дозволяє гуманоїдним роботам на кшталт Apollo від Apptronik розпізнавати обʼєкти та маніпулювати ними в реальному часі.
Межа між «моделлю для чату» і «моделлю для робота» стирається швидше, ніж очікували навіть у самій індустрії. І саме тому варто вже сьогодні переглянути, як плануєте AI-архітектуру продукту — незалежно від того, робите ви чат-бота чи автономного агента.
Що саме змінилося в Gemini 2 порівняно з Gemini 1.5?
Головна відмінність — нативна мультимодальність одразу на вході й виході. Gemini 1.5 Pro вміла аналізувати текст, зображення, аудіо та відео в контекстному вікні до двох мільйонів токенів, але результат завжди повертався текстом. Gemini 2.0, яку DeepMind представила в грудні 2024 року, уміє генерувати зображення та мовлення просто в межах однієї відповіді, а також викликати зовнішні інструменти без проміжного парсингу JSON вручну. Контекстне вікно базової версії Flash скоротили до одного мільйона токенів заради швидкості — і саме швидкість, а не «розумність», стала головним аргументом продажу.
Як мультимодальна модель перетворюється на мозок робота?
Тут DeepMind пішла далі за конкурентів. У березні 2025 року компанія представила Gemini Robotics і Gemini Robotics-ER (embodied reasoning) — версії Gemini 2, донавчені на даних про фізичну взаємодію з простором: траєкторії руху, захоплення предметів, орієнтацію в приміщенні. Модель не просто «бачить» відео з камери робота — вона генерує послідовність конкретних керівних команд для маніпулятора, оцінюючи фізичні обмеження в реальному часі.
- сортування предметів на конвеєрі за візуальним описом, а не за жорстко заданими координатами;
- адаптація до нового розташування обʼєктів без переналаштування алгоритму;
- виконання багатокрокових інструкцій мовою — «візьми чашку зі столу і постав у мийку».
Перший публічний партнер DeepMind у цьому напрямку — Apptronik, чий гуманоїдний робот Apollo отримав Gemini Robotics-ER як «мозок» для планування дій. Схожий підхід до реальних промислових обʼєктів DeepMind демонструє не вперше — про те, як робот Spot від Boston Dynamics вийшов на промислову зміну на руднику, ми вже писали в матеріалі про індустріальну робототехніку на реальних обʼєктах.
Кому це вигідно і що зміниться для розробників уже зараз?
Найбільше виграють команди, які вже будують агентів на базі Gemini API або Vertex AI: та сама інфраструктура function calling, яку ви використовуєте для чат-бота, підходить і для керування фізичним пристроєм — міняється лише набір інструментів, а не архітектура запиту. Розробникам робототехнічних стартапів це дає можливість не тренувати власну vision-language-action модель з нуля, а ліцензувати готову Gemini Robotics-ER і зосередитися на калібруванні під конкретне залізо.
- для AI-продуктових команд — можливість перевикористати ту саму модель для чат-інтерфейсу і для нового «фізичного» каналу;
- для робототехнічних стартапів — економія місяців на тренуванні власної VLA-моделі;
- для enterprise — ризик прив'язки (vendor lock-in) до однієї екосистеми моделей на кількох рівнях продукту одночасно.
Висновок AiiN: чому межа між чат-ботом і роботом зникає
Наша теза проста: конкурентна перевага в AI-індустрії стрімко зміщується від «якості моделі» до «якості інтеграції з реальним світом». Коли одна й та сама архітектура однаково добре відповідає на запит у чаті й керує маніпулятором робота, вибір моделі перестає бути стратегічним рішенням — ним стає вибір даних, сенсорів і сценаріїв використання, під які ви цю модель адаптуєте. Для AI-білдерів це означає: інвестуйте не в пошук «найрозумнішої» LLM, а в конвеєр збору власних даних про взаємодію користувача чи пристрою з середовищем — саме він стане вашим реальним ровом (moat) уже за рік-два.
Чим Gemini 2 відрізняється від Gemini 1.5?
Головні відмінності — нативна мультимодальність на виході (генерація зображень і мовлення в межах однієї відповіді), вбудований виклик інструментів без окремого оркестратора та фокус на низькій затримці у версії Flash замість максимального контекстного вікна.
Чи можна вже використовувати Gemini Robotics у власному проєкті?
Так, DeepMind відкрила доступ до Gemini Robotics-ER для дослідницьких партнерів і обраних робототехнічних компаній через Vertex AI, тоді як базова текстово-мультимодальна Gemini 2 доступна будь-якому розробнику через Gemini API.
Чи означає це, що Gemini 2 замінить спеціалізовані робототехнічні моделі?
Не повністю: спеціалізовані моделі під конкретне залізо часто досі точніші й дешевші в інференсі для вузької задачі. Gemini 2 виграє там, де потрібна гнучкість — розуміння довільних мовних інструкцій і адаптація до нових обʼєктів без переналаштування.