# Gemini 2 від Google DeepMind тепер керує й гуманоїдними роботами

> Google DeepMind вбудувала модель Gemini 2 у гуманоїдних роботів Apptronik — та сама архітектура, що керує чат-ботами, тепер керує й фізичним залізом.

- Опубліковано: 10 серпня 2026 р. (2026-08-10T16:01:26.486110+00:00)
- Розділ: AI-інструменти
- На основі публікації: [AI Business](https://aibusiness.com/robotics/google-deepmind-gemini-2-humanoid-model)
- Видання: AiiN (https://aiin.news)
- URL: https://aiin.news/article?slug=gemini-2-%D0%B2%D1%96%D0%B4-google-deepmind-%D1%82%D0%B5%D0%BF%D0%B5%D1%80-%D0%BA%D0%B5%D1%80%D1%83%D1%94-%D0%B9-%D0%B3%D1%83%D0%BC%D0%B0%D0%BD%D0%BE%D1%97%D0%B4%D0%BD%D0%B8%D0%BC%D0%B8-%D1%80%D0%BE%D0%B1%D0%BE%D1%82%D0%B0%D0%BC%D0%B8

---

Google DeepMind вивела Gemini 2 за межі чат-вікна: та сама модель, що відповідає на запити в Google Search і Workspace, тепер керує гуманоїдними роботами через окрему лінійку Gemini Robotics. [За даними AI Business](https://aibusiness.com/robotics/google-deepmind-gemini-2-humanoid-model), компанія презентує Gemini 2 як одну з найпотужніших мультимодальних моделей у світі — з розширеними можливостями обробки тексту, зображень, аудіо та відео в одному запиті.

Для розробників це не чергове оновлення бенчмарків. Gemini 2 із самого початку проєктувалася як «агентна» модель: вона самостійно викликає інструменти — пошук, виконання коду, керування браузером — без додаткового оркестраційного шару поверх API. Саме здатність до нативного виклику інструментів і стала фундаментом, на якому DeepMind побудувала Gemini Robotics — систему класу vision-language-action, що дозволяє гуманоїдним роботам на кшталт Apollo від Apptronik розпізнавати обʼєкти та маніпулювати ними в реальному часі.

Межа між «моделлю для чату» і «моделлю для робота» стирається швидше, ніж очікували навіть у самій індустрії. І саме тому варто вже сьогодні переглянути, як плануєте AI-архітектуру продукту — незалежно від того, робите ви чат-бота чи автономного агента.

## Що саме змінилося в Gemini 2 порівняно з Gemini 1.5?

Головна відмінність — нативна мультимодальність одразу на вході й виході. Gemini 1.5 Pro вміла аналізувати текст, зображення, аудіо та відео в контекстному вікні до двох мільйонів токенів, але результат завжди повертався текстом. Gemini 2.0, яку DeepMind представила в грудні 2024 року, уміє генерувати зображення та мовлення просто в межах однієї відповіді, а також викликати зовнішні інструменти без проміжного парсингу JSON вручну. Контекстне вікно базової версії Flash скоротили до одного мільйона токенів заради швидкості — і саме швидкість, а не «розумність», стала головним аргументом продажу.

## Як мультимодальна модель перетворюється на мозок робота?

Тут DeepMind пішла далі за конкурентів. У березні 2025 року компанія представила Gemini Robotics і Gemini Robotics-ER (embodied reasoning) — версії Gemini 2, донавчені на даних про фізичну взаємодію з простором: траєкторії руху, захоплення предметів, орієнтацію в приміщенні. Модель не просто «бачить» відео з камери робота — вона генерує послідовність конкретних керівних команд для маніпулятора, оцінюючи фізичні обмеження в реальному часі.

- сортування предметів на конвеєрі за візуальним описом, а не за жорстко заданими координатами;
- адаптація до нового розташування обʼєктів без переналаштування алгоритму;
- виконання багатокрокових інструкцій мовою — «візьми чашку зі столу і постав у мийку».

Перший публічний партнер DeepMind у цьому напрямку — Apptronik, чий гуманоїдний робот Apollo отримав Gemini Robotics-ER як «мозок» для планування дій. Схожий підхід до реальних промислових обʼєктів DeepMind демонструє не вперше — про те, як робот Spot від Boston Dynamics вийшов на промислову зміну на руднику, ми вже писали в матеріалі [про індустріальну робототехніку на реальних обʼєктах](https://aiin.news/article?slug=чому-boston-dynamics-відправила-робота-spot-на-рудник-у-юті).

## Кому це вигідно і що зміниться для розробників уже зараз?

Найбільше виграють команди, які вже будують агентів на базі Gemini API або Vertex AI: та сама інфраструктура function calling, яку ви використовуєте для чат-бота, підходить і для керування фізичним пристроєм — міняється лише набір інструментів, а не архітектура запиту. Розробникам робототехнічних стартапів це дає можливість не тренувати власну vision-language-action модель з нуля, а ліцензувати готову Gemini Robotics-ER і зосередитися на калібруванні під конкретне залізо.

- для AI-продуктових команд — можливість перевикористати ту саму модель для чат-інтерфейсу і для нового «фізичного» каналу;
- для робототехнічних стартапів — економія місяців на тренуванні власної VLA-моделі;
- для enterprise — ризик прив'язки (vendor lock-in) до однієї екосистеми моделей на кількох рівнях продукту одночасно.

## Висновок AiiN: чому межа між чат-ботом і роботом зникає

Наша теза проста: конкурентна перевага в AI-індустрії стрімко зміщується від «якості моделі» до «якості інтеграції з реальним світом». Коли одна й та сама архітектура однаково добре відповідає на запит у чаті й керує маніпулятором робота, вибір моделі перестає бути стратегічним рішенням — ним стає вибір даних, сенсорів і сценаріїв використання, під які ви цю модель адаптуєте. Для AI-білдерів це означає: інвестуйте не в пошук «найрозумнішої» LLM, а в конвеєр збору власних даних про взаємодію користувача чи пристрою з середовищем — саме він стане вашим реальним ровом (moat) уже за рік-два.

## Чим Gemini 2 відрізняється від Gemini 1.5?

Головні відмінності — нативна мультимодальність на виході (генерація зображень і мовлення в межах однієї відповіді), вбудований виклик інструментів без окремого оркестратора та фокус на низькій затримці у версії Flash замість максимального контекстного вікна.

## Чи можна вже використовувати Gemini Robotics у власному проєкті?

Так, DeepMind відкрила доступ до Gemini Robotics-ER для дослідницьких партнерів і обраних робототехнічних компаній через Vertex AI, тоді як базова текстово-мультимодальна Gemini 2 доступна будь-якому розробнику через Gemini API.

## Чи означає це, що Gemini 2 замінить спеціалізовані робототехнічні моделі?

Не повністю: спеціалізовані моделі під конкретне залізо часто досі точніші й дешевші в інференсі для вузької задачі. Gemini 2 виграє там, де потрібна гнучкість — розуміння довільних мовних інструкцій і адаптація до нових обʼєктів без переналаштування.

---

Теги: Gemini2, GoogleDeepMind, робототехніка, мультимодальність, AI, агенти

Джерело: AiiN — https://aiin.news/article?slug=gemini-2-%D0%B2%D1%96%D0%B4-google-deepmind-%D1%82%D0%B5%D0%BF%D0%B5%D1%80-%D0%BA%D0%B5%D1%80%D1%83%D1%94-%D0%B9-%D0%B3%D1%83%D0%BC%D0%B0%D0%BD%D0%BE%D1%97%D0%B4%D0%BD%D0%B8%D0%BC%D0%B8-%D1%80%D0%BE%D0%B1%D0%BE%D1%82%D0%B0%D0%BC%D0%B8. Цитуючи, посилайтесь на канонічний URL.
