Google впровадив у Gemini agent-based підхід до аналізу відео, який знижує споживання токенів API до 88% — про це повідомляє The Decoder. Для розробників, що працюють з відео через API, це означає прямий вплив на рахунок: ті самі ролики тепер обходяться в рази дешевше при збереженні можливості детального аналізу вмісту.

За даними The Decoder, зміна стосується саме способу обробки відеовходу моделлю, а не появи нової версії Gemini як такої. Тобто йдеться не про черговий реліз з кращими бенчмарками, а про інженерну оптимізацію того, як модель «дивиться» на відео і скільки токенів контексту на це витрачає.

Для команд, які будують продукти на базі відеоаналізу — від модерації контенту до саммарізації стрімів — вартість токенів на довге відео історично була однією з головних перешкод для масштабування. Якщо зниження на 88% справджується на практиці, а не лише в презентаційних цифрах, це змінює економіку цілого класу застосунків.

Що саме змінилося в обробці відео Gemini?

Google переніс аналіз відео в Gemini API на agent-based модель роботи замість суцільної обробки кожного кадру чи сегмента з однаковою «вагою». The Decoder не наводить повного технічного опису механізму ухвалення рішень агентом, але сама заміна лінійного проходу по відео на агентну логіку натякає на головне: модель, ймовірно, сама визначає, які фрагменти відео потребують детального розбору, а які можна стиснути або пропустити без втрати суті.

Це принципово інший підхід порівняно з класичним семплюванням кадрів, коли модель отримує фіксовану кількість зображень на секунду відео незалежно від того, наскільки динамічним чи інформативним є конкретний фрагмент.

Наскільки суттєва економія у 88%?

88% — це верхня межа скорочення токенів, яку називає The Decoder, і на довгих відео ефект буде помітнішим, ніж на коротких кліпах. Токени на відеовхід традиційно рахуються по кадрах, тому годинний ролик і кількасекундний тизер до оновлення споживали контекст пропорційно тривалості й щільності кадрів. Якщо уявити гіпотетичний приклад: відео, аналіз якого раніше «з'їдав» 100 тисяч токенів контексту, при економії у 88% вкладеться приблизно в 12 тисяч — а це вже інший порядок вартості й інша можливість вміщати відео в лімітований контекст разом з іншими даними запиту.

Для API-продуктів це означає не тільки нижчий рахунок за токени, а й менше тиску на контекстне вікно моделі, коли відео потрібно аналізувати разом з текстовими інструкціями, попередньою історією діалогу чи іншими файлами.

Кому це реально здешевить інференс?

Найбільше виграють продукти, де відео — не разовий інпут, а постійний потік: модерація користувацького контенту на платформах з відео, автоматичні саммарі довгих стрімів чи вебінарів, пошук і індексація відеоархівів за змістом. У кожному з цих кейсів раніше саме вартість токенів на довге відео обмежувала, скільки контенту можна аналізувати без ручного відбору.

Про це прямо каже й позиція нашої редакції: дешевший відео-інпут відкриває нові продуктові кейси саме в цих напрямках, а не лише знижує собівартість уже наявних застосунків.

Висновок AiiN

За нашою оцінкою, найважливіше в цій зміні — не сама цифра 88%, а сигнал напрямку. Google оптимізує не якість відповіді моделі, а вартість інпуту — і робить це через агентну логіку, яка вирішує, куди саме варто «дивитися» уважніше. Якщо цей патерн приживеться, agent-based препроцесинг мультимодальних даних, ймовірно, стане стандартним прийомом не лише для відео, а й для інших важких типів вхідних даних в API великих мовних моделей — аудіо, довгих документів, серій зображень. Для AI-білдерів це практичний сигнал: варто вже зараз рахувати, які продукти на базі відео були економічно недоцільними через вартість токенів рік тому, і перевіряти, чи змінює цей розрахунок нова модель ціноутворення.

Що таке agent-based аналіз відео в Gemini?

Це підхід, за якого Gemini обробляє відеовхід не рівномірним проходом по всіх кадрах, а через агентну логіку, яка визначає, які частини відео варті детальнішого аналізу. Результат — суттєво менше витрачених токенів на той самий відеофайл.

Чи автоматично впаде вартість для всіх, хто вже використовує Gemini API для відео?

Зниження токенів безпосередньо перекладається в нижчу вартість запиту, оскільки Gemini API тарифікується за кількістю використаних токенів. Але реальна економія для конкретного продукту залежатиме від тривалості й типу відео, яке він обробляє.

Чи впливає новий підхід на точність аналізу відео?

The Decoder не наводить окремих даних про якість відповідей після переходу на agent-based обробку. За нашою оцінкою, головний ризик такого підходу — це фрагменти відео, які агент помилково визначить як менш важливі й обробить поверхово, тож варто перевіряти якість на власних сценаріях перед повним переходом.