Google DeepMind випустила Gemini 3.5 Transcribe — модель транскрибації, яка перетворює хаотичне усне мовлення на структурований текст без додаткового постобробного шару.
Це не чергове оновлення розпізнавання мовлення заради відсотка помилок — DeepMind позиціонує модель як готовий компонент для продуктів, де голос конвертується у нотатки, протоколи зустрічей чи команди для голосових агентів.
За даними DeepMind, ключова відмінність — модель одразу віддає структурований вихід: пунктуацію, форматування, розбиття на смислові блоки — там, де традиційний ASR-рушій видає суцільний потік слів, який потім потрібно чистити окремим кроком обробки.
Що саме випустила Google DeepMind?
Gemini 3.5 Transcribe — це модель транскрибації в лінійці Gemini, орієнтована на перетворення хаотичного мовлення (з паузами, словами-паразитами, перебиванням) у чистий структурований текст. За задумом DeepMind, вона закриває розрив між сирим розпізнаванням мовлення і тим виглядом тексту, який реально можна використати — у нотатці, протоколі зустрічі чи команді для агента.
Чим це відрізняється від типового ASR-пайплайну?
Класична схема голосового продукту виглядає так: ASR-модель розпізнає звук у сирий текст, після чого окремий LLM чистить пунктуацію, прибирає філери, розбиває текст на абзаци, а іноді ще й визначає спікерів. І лише після цього результат іде далі в продукт. Це два, а часто три окремі виклики моделей з накопиченою латентністю та вартістю на кожному кроці.
Gemini 3.5 Transcribe скорочує цей ланцюжок до одного виклику: модель одразу віддає структурований результат, а не сирий потік слів. На практиці це означає:
- менше окремих сервісів у продукційному стеку;
- менше проміжних помилок — кожен додатковий крок пайплайну є точкою, де можна втратити контекст чи сенс фрази;
- нижчу латентність за рахунок одного проходу моделі замість двох-трьох послідовних викликів.
Для команди це означає не лише економію на інфраструктурі, а й менше часу на підтримку prompt-інструкцій для LLM-кроку постобробки — того самого, який зазвичай доводиться раз у раз донастроювати під нові формати вхідного аудіо.
Кому це змінить розробку голосових продуктів?
Найбільше вигравають команди, що будують голосових агентів, застосунки для диктування нотаток і продукти для обробки записів зустрічей — саме там, де раніше доводилося власноруч склеювати ASR і LLM-постобробку в один пайплайн. Подібний принцип — менше окремих сервісів, більше вбудованої логіки в саму модель — ми вже бачили в тому, як Radar перетворює подкасти на пошукову базу для AI-агентів: індустрія в цілому рухається до того, щоб аудіо одразу ставало машинночитаним активом, а не проміжним артефактом, який ще треба довго готувати.
Висновок AiiN: що робити з цим зараз?
Наша теза: Gemini 3.5 Transcribe важливий не як чергове покращення точності розпізнавання мовлення, а як сигнал того, що Google вважає окремий ASR-крок зайвою ланкою в архітектурі голосових продуктів. Для AI-білдерів це практичний привід переглянути власний voice-стек: якщо у продукті окремо стоять ASR-сервіс і LLM-крок для очищення тексту, варто перевірити, чи не закриє обидва завдання одна модель — це економія і на латентності, і на кількості точок відмови в системі. Якщо ж голосовий агент чи продукт для нотаток тільки будується з нуля, логічніше одразу починати з моделі, що видає готовий структурований вихід, а не збирати пайплайн з кількох окремих компонентів.
Чим структурований текст відрізняється від звичайної транскрипції?
Звичайний ASR-рушій видає суцільний потік слів без пунктуації і поділу на смислові блоки — це сирий матеріал, який потрібно додатково обробляти окремим кроком. Структурований текст уже містить пунктуацію та розбиття на абзаци чи репліки і готовий до використання в продукті без додаткової обробки.
Чи замінить Gemini 3.5 Transcribe окремі ASR-сервіси на кшталт Whisper?
Ймовірно, для частини сценаріїв — так, особливо там, де продукту потрібен саме готовий структурований вихід, а не сирий транскрипт для подальшої кастомної обробки. Але це наша оцінка, а не заявлена позиція DeepMind.
Чи означає структурований вихід, що модель також визначає спікерів?
У короткому описі DeepMind цей момент прямо не розкритий, тому стверджувати напевно ми не можемо. Якщо функція діаризації (розпізнавання, хто саме говорить) справді підтримується, це закриє ще один типовий крок постобробки — той, який сьогодні найчастіше вирішують окремим сервісом чи ще одним LLM-викликом.