MoE (Mixture of Experts) — не просто черговий архітектурний термін зі світу ML. За останні два роки саме ця технологія зробила найдешевші та найпотужніші моделі реальністю: DeepSeek V3, Mixtral, Gemini 2.0 Flash — усі вони побудовані на MoE. Якщо ти будуєш AI-продукти, розуміти вплив цієї архітектури на вартість і ліміти — вже базова операційна грамотність.
Суть проста: замість того, щоб активувати всі параметри моделі для кожного токена, MoE-система ділить мережу на кілька «експертів» (окремих підмереж) і маршрутизує кожен токен лише через кілька з них. Mixtral 8x7B має вісім блоків по 7B параметрів, але для кожного токена активуються тільки два. Загальний розмір — 56B, активний при інференсі — близько 13B. Саме це і пояснює ціновий феномен: платиш за активні параметри, а не за загальний масштаб.
Як MoE змінює вартість інференсу
Класичні dense-моделі активують усі параметри для кожного токена. MoE — тільки частину. Звідси пряма економія для провайдерів і, відповідно, нижчі ціни для користувачів:
- DeepSeek V3: 671B загальних параметрів, ~37B активних — $0.27 за мільйон вхідних токенів. Дешевше за більшість 7B-моделей зразка 2023 року.
- Mixtral Large 2: MoE-архітектура з кількома сотнями мільярдів параметрів — близько $2/1M, тоді як GPT-4o на момент виходу коштував $15/1M.
- Gemini 2.0 Flash: MoE, оптимізований під швидкість і вартість — безкоштовний у Google AI Studio в межах добового ліміту.
Провайдери типу Groq, Together AI і Fireworks AI ще більше знижують ціну завдяки спеціалізованому залізу, оптимізованому під sparse inference. Система завантажує до GPU лише ваги потрібних експертів, а не всю модель цілком.
Ліміти, які варто знати до старту
MoE — не срібна куля. Є кілька реальних обмежень, які впливають на вибір стратегії розгортання.
Пам'ять для self-hosted варіантів. Попри sparse inference, вся модель має зберігатися в пам'яті або вивантажуватися динамічно. Mixtral 8x7B потребує близько 90 GB VRAM — недоступно на одному A100. Для self-hosted MoE потрібні або multi-GPU setup, або квантизація (GGUF/AWQ).
Rate limits на безкоштовних тарифах:
- Groq free tier: 30 RPM, ~14 400 токенів/хв для Mixtral-моделей
- Google AI Studio (Gemini 2.0 Flash): 15 RPM, 1 мільйон токенів на добу
- DeepSeek free: 10 RPM, обмежений доступ до R1
- Mistral La Plateforme free: 1 RPM — практично непридатний для реального навантаження
Latency при routing. Маршрутизація токенів між експертами додає накладні витрати. На Groq це мінімально завдяки ASIC-залізу, на стандартному GPU-кластері — помітно при batch-запитах із великим паралелізмом.
Edge-задачі. На завданнях, що вимагають широкої узагальненої компетентності, MoE іноді програє dense-моделям аналогічного активного розміру. Routing може систематично уникати певних «зон знань» — це треба тестувати на своєму конкретному use case перед вибором моделі.
Де взяти безкоштовний доступ і коли переходити на платний тариф
Для прототипу й дослідження:
- Google AI Studio — Gemini 2.0 Flash безкоштовно, 15 RPM, 1M токенів/добу. Найшвидший старт для більшості задач без введення платіжних даних.
- Groq — безкоштовний tier для Mixtral і Llama із прийнятним throughput для dev-режиму.
- DeepSeek free API — якщо потрібна довга контекстна робота: модель добре тримає великі промпти навіть на безкоштовному тарифі.
Для production із реальним навантаженням:
- Together AI або Fireworks AI — кращий price-per-token для Mixtral і DeepSeek ніж пряме API; добре масштабується горизонтально.
- DeepSeek платний план — від $5 депозиту, $0.27/1M вхідних токенів, без жорстких RPM-обмежень.
- Groq платний — якщо latency критична: live chat, streaming, real-time voice.
Важливий нюанс: у DeepSeek і Gemini є context caching — при повторних запитах з однаковим префіксом вартість падає до десяти разів. Якщо твій продукт будує довгі контексти із системними промптами, це суттєва операційна економія.
Висновок AiiN
MoE-архітектура зробила «великі моделі коштують дорого» застарілим стереотипом. DeepSeek V3 і Mixtral довели: 600B+ параметрів може коштувати як 7B-dense модель. Для AI-білдера практичний висновок один: при виборі моделі дивись не на загальний розмір, а на активні параметри та ціну за токен — це і є реальна вартість інференсу.
Безкоштовні тарифи достатньо щедрі для PoC і дослідження, але для серйозного навантаження закладай бюджет із самого початку — MoE-провайдери дешеві, але безліміту ніхто не дає. Варто також стежити за batch inference для MoE: це наступна хвиля здешевлення, яку вже тестують Together AI і Fireworks і яка може знову переписати цінові орієнтири.