Середня ціна мільйона токенів провідних LLM-моделей опустилася до 97 центів станом на 1 вересня 2026 року — це на 53% нижче пікових $2,07, зафіксованих 28 травня 2026 року. Падіння сталося менш ніж за чотири місяці, і вперше середня ринкова ціна пробила позначку в один долар за мільйон токенів.
За даними Techmeme, йдеться саме про середню ціну по ринку, а не про тариф якоїсь однієї моделі — тобто про загальний тренд, а не про разову знижку від одного вендора. Для тих, хто рахує unit-економіку AI-продукту, різниця між $2,07 і $0,97 за мільйон токенів — це не косметика: для сервісу, що обробляє мільярди токенів на місяць, це різниця в сотні тисяч доларів операційних витрат.
Питання вже не в тому, чи триватиме тренд на здешевлення — джерело фіксує різке падіння за лічені місяці. Питання радше в тому, хто встигне перебудувати продукт під нову цінову реальність швидше за конкурентів.
Що саме подешевшало і наскільки?
Ідеться про середню ціну інференсу — вартість обробки одного мільйона токенів (вхідних і вихідних) у типовому запиті до LLM. За чотири місяці, з 28 травня по 1 вересня 2026 року, ця середня ціна впала з $2,07 до $0,97 за мільйон токенів.
- Пік: $2,07 за мільйон токенів (28 травня 2026 року)
- Поточний рівень: $0,97 за мільйон токенів (1 вересня 2026 року)
- Падіння: приблизно 53% за чотири місяці
Джерело не деталізує, ціни яких саме провайдерів усереднюються, тож розподіл по вендорах лишається за кадром — важливий сам факт: ринкова планка для token-ціни зсунулася нижче долара.
Чому ціни падають і кому це вигідно найбільше?
Пряму причину падіння Techmeme не називає, тож тут ми переходимо в зону оцінки. Ймовірно, на середню ціну одночасно тиснуть кілька факторів: цінова конкуренція між провайдерами моделей, поява дешевших альтернатив і зростання ефективності інференсу — менші й швидші моделі виконують ті самі завдання за менший обчислювальний бюджет. За нашою оцінкою, саме комбінація цих факторів, а не одноразове рішення одного вендора, пояснює настільки різкий і стійкий спад за короткий період.
Найбільше від здешевлення виграють ті, чия бізнес-модель прив'язана до обсягу токенів, а не до кількості користувачів:
- AI-агенти з довгими циклами міркувань — кожен крок агентного ланцюжка (планування, виклик інструменту, рефлексія) споживає токени, тож чим довший ланцюжок, тим сильніше падіння ціни впливає на собівартість однієї дії агента.
- RAG-системи з великим контекстом — продукти, що передають у промпт великі шматки документів чи історію діалогу, платять за вхідні токени пропорційно обсягу контексту.
- Стартапи на ранній стадії — нижча вартість токена знижує поріг входу для запуску MVP на базі LLM без потреби одразу оптимізувати кожен виклик API.
Менше виграють продукти з невеликим обсягом запитів на користувача — там вартість токенів і так була незначною статтею витрат порівняно з інфраструктурою чи підтримкою користувачів.
Що з цим робити зараз?
Для AI-білдера падіння ціни токена — привід переглянути ROI архітектурних рішень, які раніше здавалися заскладними через вартість. Багатокрокові агентні пайплайни, ширші контекстні вікна, повторні перевірки й self-verification кроки — усе це стає дешевшим у перерахунку на одну дію користувача.
Водночас варто пам'ятати: ціна за токен — лише один параметр unit-економіки. Латентність, надійність API та якість відповідей моделі впливають на юзабіліті продукту не менше, ніж рахунок за інференс. Команди, що вже оптимізували інфраструктуру під локальний або гібридний інференс — як ми писали про гібридні обчислення Perplexity з Opus 5 на Mac — отримають подвійний ефект: і дешевший хмарний токен, і меншу залежність від хмари взагалі.
Висновок AiiN
Наша теза: падіння середньої ціни токена нижче долара — це не тимчасова знижка, а сигнал того, що token-based pricing як бізнес-модель провайдерів LLM входить у фазу жорсткої конкуренції за обсяг, а не за маржу з одного запиту. Для команд, що будують AI-агентів, це означає одне практичне рішення вже зараз: перерахувати собівартість продукту при поточних цінах і закласти в план ще одне зниження на горизонті кількох місяців — тренд явно не одноразовий.
Скільки коштує обробка мільйона токенів сьогодні?
Станом на 1 вересня 2026 року середня ціна становить $0,97 за мільйон токенів — це на 53% менше за пік у $2,07, зафіксований 28 травня 2026 року, за даними Techmeme.
Чи означає падіння ціни токена гіршу якість моделей?
Джерело про це не повідомляє, і напряму такого зв'язку немає: ціна на інференс і якість моделі — різні параметри, які визначаються різними факторами, а не лише «потужністю» моделі.
Як порахувати вплив на бюджет мого AI-продукту?
Помножте середню кількість токенів на запит (вхід плюс вихід) на кількість запитів на місяць і на поточну ціну за мільйон токенів. Різниця між розрахунком за $2,07 і за $0,97 покаже, скільки ви вже заощадили лише завдяки ринковому тренду, без жодних змін у власному коді.