MoE (Mixture of Experts) — не просто черговий архітектурний термін зі світу ML. За останні два роки саме ця технологія зробила найдешевші та найпотужніші моделі реальністю: DeepSeek V3, Mixtral, Gemini 2.0 Flash — усі вони побудовані на MoE. Якщо ти будуєш AI-продукти, розуміти вплив цієї архітектури на вартість і ліміти — вже базова операційна грамотність.

Суть проста: замість того, щоб активувати всі параметри моделі для кожного токена, MoE-система ділить мережу на кілька «експертів» (окремих підмереж) і маршрутизує кожен токен лише через кілька з них. Mixtral 8x7B має вісім блоків по 7B параметрів, але для кожного токена активуються тільки два. Загальний розмір — 56B, активний при інференсі — близько 13B. Саме це і пояснює ціновий феномен: платиш за активні параметри, а не за загальний масштаб.

Як MoE змінює вартість інференсу

Класичні dense-моделі активують усі параметри для кожного токена. MoE — тільки частину. Звідси пряма економія для провайдерів і, відповідно, нижчі ціни для користувачів:

Провайдери типу Groq, Together AI і Fireworks AI ще більше знижують ціну завдяки спеціалізованому залізу, оптимізованому під sparse inference. Система завантажує до GPU лише ваги потрібних експертів, а не всю модель цілком.

Ліміти, які варто знати до старту

MoE — не срібна куля. Є кілька реальних обмежень, які впливають на вибір стратегії розгортання.

Пам'ять для self-hosted варіантів. Попри sparse inference, вся модель має зберігатися в пам'яті або вивантажуватися динамічно. Mixtral 8x7B потребує близько 90 GB VRAM — недоступно на одному A100. Для self-hosted MoE потрібні або multi-GPU setup, або квантизація (GGUF/AWQ).

Rate limits на безкоштовних тарифах:

Latency при routing. Маршрутизація токенів між експертами додає накладні витрати. На Groq це мінімально завдяки ASIC-залізу, на стандартному GPU-кластері — помітно при batch-запитах із великим паралелізмом.

Edge-задачі. На завданнях, що вимагають широкої узагальненої компетентності, MoE іноді програє dense-моделям аналогічного активного розміру. Routing може систематично уникати певних «зон знань» — це треба тестувати на своєму конкретному use case перед вибором моделі.

Де взяти безкоштовний доступ і коли переходити на платний тариф

Для прототипу й дослідження:

Для production із реальним навантаженням:

Важливий нюанс: у DeepSeek і Gemini є context caching — при повторних запитах з однаковим префіксом вартість падає до десяти разів. Якщо твій продукт будує довгі контексти із системними промптами, це суттєва операційна економія.

Висновок AiiN

MoE-архітектура зробила «великі моделі коштують дорого» застарілим стереотипом. DeepSeek V3 і Mixtral довели: 600B+ параметрів може коштувати як 7B-dense модель. Для AI-білдера практичний висновок один: при виборі моделі дивись не на загальний розмір, а на активні параметри та ціну за токен — це і є реальна вартість інференсу.

Безкоштовні тарифи достатньо щедрі для PoC і дослідження, але для серйозного навантаження закладай бюджет із самого початку — MoE-провайдери дешеві, але безліміту ніхто не дає. Варто також стежити за batch inference для MoE: це наступна хвиля здешевлення, яку вже тестують Together AI і Fireworks і яка може знову переписати цінові орієнтири.