Google випустив Gemini 3.5 Transcribe — нову модель розпізнавання мовлення, яка вже живить клавіатуру Gboard і сервіс Rambler, а найближчим часом з'явиться в браузері Chrome. Для розробників модель відкрита в публічному прев'ю: її можна тестувати через API поза внутрішніми продуктами компанії.
За даними Ars Technica AI, це не разовий експеримент, а частина ширшої стратегії: Google послідовно замінює сторонні або узагальнені механізми розпізнавання мовлення власними спеціалізованими моделями лінійки Gemini прямо на рівні масових продуктів — клавіатури, браузера, пошуку.
Для індустрії ASR (automatic speech recognition, автоматичне розпізнавання мовлення) це помітний сигнал. Ще донедавна розробники за замовчуванням підключали Whisper від OpenAI або сторонні API на кшталт Deepgram чи AssemblyAI. Тепер у гру входить гравець, який одразу постачає модель сотням мільйонів користувачів Android і Chrome — і за фактом перевіряє її якість у бойових умовах ще до того, як віддати розробникам.
Що саме анонсував Google?
Gemini 3.5 Transcribe — це модель перетворення мовлення на текст, яку Google інтегрував у два конкретні продукти: клавіатуру Gboard і сервіс Rambler. Chrome отримає підтримку моделі найближчим часом, а для зовнішніх розробників вона вже доступна в статусі публічного прев'ю — тобто до стабільного релізу з гарантованим SLA ще далеко, але тестувати інтеграцію можна вже зараз.
Ключова деталь тут не сама модель, а вибір точок впровадження. Gboard — це клавіатура, встановлена на мільярдах Android-пристроїв за замовчуванням, а Chrome — найпопулярніший браузер у світі. Google не запускає ASR як окремий продукт для ентузіастів, а одразу вшиває його в інфраструктуру, якою й так користуються мільярди людей.
Чим це відрізняється від підходу на кшталт Whisper?
Whisper від OpenAI довгий час був дефолтним вибором для розробників саме тому, що це окрема, відкрита модель, яку можна розгорнути де завгодно — від локального сервера до хмарного API. Gemini 3.5 Transcribe в цьому сенсі йде іншим шляхом: спершу вона з'являється як частина конкретних продуктів Google, і лише потім — як API для зовнішніх розробників.
Ми вже розбирали цю логіку в матеріалі про вбудовування ASR прямо в LLM: коли розпізнавання мовлення стає не окремим модулем у пайплайні, а функцією, вшитою в саму мовну модель, зникає потреба склеювати окремі сервіси для транскрипції та розуміння тексту. Для продуктової команди Google це означає нижчу затримку та єдину точку відповідальності за якість; для стороннього розробника — менше контролю над тим, де саме модель фізично виконується.
Кому і навіщо це важливо для AI-білдерів?
Для команд, що будують голосові інтерфейси, субтитрування чи транскрипцію дзвінків, поява ще одного великого гравця в ASR — привід переглянути бенчмарки, а не одразу мігрувати. Публічне прев'ю означає, що API ще може змінюватися, ліміти й ціноутворення не зафіксовані, а SLA для продакшн-навантажень поки не гарантований.
- Продукти, де ASR критичний для бізнес-логіки (кол-центри, медичні транскрипти), варто тестувати нову модель паралельно з чинним рішенням, а не замінювати його одразу.
- Команди, що вже використовують Whisper локально через міркування приватності чи вартості, отримують додатковий орієнтир для порівняння якості розпізнавання, а не автоматичну причину для міграції.
- Розробники голосових агентів отримують сигнал, що великі платформи (Google, OpenAI, Amazon) продовжують інвестувати саме в мовлення-в-текст як окремий шар, а не лише в текстові LLM.
Що робити з цим уже зараз?
Практичний крок для AI-білдерів — прогнати власний набір аудіозаписів (з фоновим шумом, акцентами, специфічною термінологією) через Gemini 3.5 Transcribe у прев'ю-режимі та порівняти WER (word error rate, частку помилково розпізнаних слів) з тим, що дає поточний пайплайн. Оскільки модель у прев'ю, будь-яку інтеграцію варто закладати з fallback на перевірений рушій.
Висновок AiiN
За нашою оцінкою, головна новина тут не в самій моделі, а в маршруті її виходу: Google вперше показує ASR-модель спочатку через власні масові продукти і лише потім — як API. Це відрізняється від логіки OpenAI з Whisper, де модель одразу була відкритою і продуктово-нейтральною. Якщо цей підхід виявиться успішним, варто очікувати, що й інші спеціалізовані можливості Gemini — а не лише розпізнавання мовлення — Google так само буде спершу обкатувати всередині Gboard, Chrome і пошуку, а вже потім віддавати розробникам.
Що таке Gemini 3.5 Transcribe?
Це модель розпізнавання мовлення (speech-to-text) від Google, яка перетворює аудіо на текст і вже працює всередині Gboard і Rambler, а для розробників доступна в публічному прев'ю.
Чи можна вже використовувати Gemini 3.5 Transcribe в продакшні?
Формально так, оскільки модель у публічному прев'ю з доступом через API, але статус прев'ю означає відсутність гарантованого SLA, тож для критичних сценаріїв варто тримати fallback на перевірене рішення на кшталт Whisper.