# Gemini 3.5 Transcribe: Google тисне ASR у Gboard і Chrome

> Google запустив Gemini 3.5 Transcribe у публічному прев'ю: модель розпізнавання мовлення вже працює в Gboard і Rambler, скоро прийде в Chrome.

- Опубліковано: 27 серпня 2026 р. (2026-08-26T21:00:25.680755+00:00)
- Розділ: AI-інструменти
- На основі публікації: [Ars Technica AI](https://arstechnica.com/ai/2026/08/google-announces-gemini-3-5-transcribe-for-ai-powered-speech-to-text/)
- Видання: AiiN (https://aiin.news)
- URL: https://aiin.news/article?slug=gemini-3-5-transcribe-google-%D1%82%D0%B8%D1%81%D0%BD%D0%B5-asr-%D1%83-gboard-%D1%96-chrome

---

Google випустив Gemini 3.5 Transcribe — нову модель розпізнавання мовлення, яка вже живить клавіатуру Gboard і сервіс Rambler, а найближчим часом з'явиться в браузері Chrome. Для розробників модель відкрита в публічному прев'ю: її можна тестувати через API поза внутрішніми продуктами компанії.

За даними [Ars Technica AI](https://arstechnica.com/ai/2026/08/google-announces-gemini-3-5-transcribe-for-ai-powered-speech-to-text/), це не разовий експеримент, а частина ширшої стратегії: Google послідовно замінює сторонні або узагальнені механізми розпізнавання мовлення власними спеціалізованими моделями лінійки Gemini прямо на рівні масових продуктів — клавіатури, браузера, пошуку.

Для індустрії ASR (automatic speech recognition, автоматичне розпізнавання мовлення) це помітний сигнал. Ще донедавна розробники за замовчуванням підключали Whisper від OpenAI або сторонні API на кшталт Deepgram чи AssemblyAI. Тепер у гру входить гравець, який одразу постачає модель сотням мільйонів користувачів Android і Chrome — і за фактом перевіряє її якість у бойових умовах ще до того, як віддати розробникам.

## Що саме анонсував Google?

Gemini 3.5 Transcribe — це модель перетворення мовлення на текст, яку Google інтегрував у два конкретні продукти: клавіатуру Gboard і сервіс Rambler. Chrome отримає підтримку моделі найближчим часом, а для зовнішніх розробників вона вже доступна в статусі публічного прев'ю — тобто до стабільного релізу з гарантованим SLA ще далеко, але тестувати інтеграцію можна вже зараз.

Ключова деталь тут не сама модель, а вибір точок впровадження. Gboard — це клавіатура, встановлена на мільярдах Android-пристроїв за замовчуванням, а Chrome — найпопулярніший браузер у світі. Google не запускає ASR як окремий продукт для ентузіастів, а одразу вшиває його в інфраструктуру, якою й так користуються мільярди людей.

## Чим це відрізняється від підходу на кшталт Whisper?

Whisper від OpenAI довгий час був дефолтним вибором для розробників саме тому, що це окрема, відкрита модель, яку можна розгорнути де завгодно — від локального сервера до хмарного API. Gemini 3.5 Transcribe в цьому сенсі йде іншим шляхом: спершу вона з'являється як частина конкретних продуктів Google, і лише потім — як API для зовнішніх розробників.

Ми вже розбирали цю логіку в матеріалі про [вбудовування ASR прямо в LLM](https://aiin.news/article?slug=gemini-3-5-transcribe-google-вбудувала-asr-прямо-в-llm): коли розпізнавання мовлення стає не окремим модулем у пайплайні, а функцією, вшитою в саму мовну модель, зникає потреба склеювати окремі сервіси для транскрипції та розуміння тексту. Для продуктової команди Google це означає нижчу затримку та єдину точку відповідальності за якість; для стороннього розробника — менше контролю над тим, де саме модель фізично виконується.

## Кому і навіщо це важливо для AI-білдерів?

Для команд, що будують голосові інтерфейси, субтитрування чи транскрипцію дзвінків, поява ще одного великого гравця в ASR — привід переглянути бенчмарки, а не одразу мігрувати. Публічне прев'ю означає, що API ще може змінюватися, ліміти й ціноутворення не зафіксовані, а SLA для продакшн-навантажень поки не гарантований.

- Продукти, де ASR критичний для бізнес-логіки (кол-центри, медичні транскрипти), варто тестувати нову модель паралельно з чинним рішенням, а не замінювати його одразу.
- Команди, що вже використовують Whisper локально через міркування приватності чи вартості, отримують додатковий орієнтир для порівняння якості розпізнавання, а не автоматичну причину для міграції.
- Розробники голосових агентів отримують сигнал, що великі платформи (Google, OpenAI, Amazon) продовжують інвестувати саме в мовлення-в-текст як окремий шар, а не лише в текстові LLM.

## Що робити з цим уже зараз?

Практичний крок для AI-білдерів — прогнати власний набір аудіозаписів (з фоновим шумом, акцентами, специфічною термінологією) через Gemini 3.5 Transcribe у прев'ю-режимі та порівняти WER (word error rate, частку помилково розпізнаних слів) з тим, що дає поточний пайплайн. Оскільки модель у прев'ю, будь-яку інтеграцію варто закладати з fallback на перевірений рушій.

## Висновок AiiN

За нашою оцінкою, головна новина тут не в самій моделі, а в маршруті її виходу: Google вперше показує ASR-модель спочатку через власні масові продукти і лише потім — як API. Це відрізняється від логіки OpenAI з Whisper, де модель одразу була відкритою і продуктово-нейтральною. Якщо цей підхід виявиться успішним, варто очікувати, що й інші спеціалізовані можливості Gemini — а не лише розпізнавання мовлення — Google так само буде спершу обкатувати всередині Gboard, Chrome і пошуку, а вже потім віддавати розробникам.

## Що таке Gemini 3.5 Transcribe?

Це модель розпізнавання мовлення (speech-to-text) від Google, яка перетворює аудіо на текст і вже працює всередині Gboard і Rambler, а для розробників доступна в публічному прев'ю.

## Чи можна вже використовувати Gemini 3.5 Transcribe в продакшні?

Формально так, оскільки модель у публічному прев'ю з доступом через API, але статус прев'ю означає відсутність гарантованого SLA, тож для критичних сценаріїв варто тримати fallback на перевірене рішення на кшталт Whisper.

---

Теги: Google, Gemini, ASR, SpeechToText, Whisper, AI

Джерело: AiiN — https://aiin.news/article?slug=gemini-3-5-transcribe-google-%D1%82%D0%B8%D1%81%D0%BD%D0%B5-asr-%D1%83-gboard-%D1%96-chrome. Цитуючи, посилайтесь на канонічний URL.
