Коли наприкінці 2023 року вийшов Mixtral 8x7B від Mistral, більшість розробників сприйняли його як цікавий, але нішевий експеримент. Модель на 46 мільярдів параметрів поводилася як 12-мільярдна в інференсі — звучало майже як маркетингова гра. Але вже за рік стало зрозуміло: Mixture of Experts (MoE) — не трюк, а структурна зміна у тому, як будуються великі мовні моделі.
Сьогодні MoE-архітектура лежить в основі DeepSeek V3, Grok 3, Qwen2.5-MoE, і, за більшістю оцінок, Gemini 1.5/2.0. Те, що колись було дослідницькою ідеєю з паперів Google Brain 1991 року, стало практичним стандартом для frontier-розробки. У 2026-му ця архітектура вже не потребує виправдання — вона потребує розуміння.
Як MoE влаштований: не вся мережа активується одночасно
Dense-трансформер — GPT-2, LLaMA 2, ранні версії Claude — обробляє кожен токен через усі параметри мережі. MoE розбиває Feed-Forward шар на кілька незалежних «експертів» і активує лише частину з них для кожного токена. Яку саме частину — вирішує router-мережа (gating network), яка навчається разом з основною моделлю.
Типова схема на 2026 рік виглядає так:
- Загальна кількість експертів: 8–256 (у DeepSeek V3 — 256 на шар)
- Кількість активних експертів на токен: 2–8
- Shared-експерти: завжди активні, забезпечують стабільний базовий рівень
- Auxiliary loss: штраф за нерівномірне навантаження, щоб уникнути «колапсу» до 1–2 улюблених експертів
Результат: параметрів у моделі більше, але FLOP-ів на інференс — менше. DeepSeek V3 має 671B параметрів і активує ~37B на кожен токен. На практиці це означає якість 671B-моделі при витратах, близьких до 37B dense-аналога.
Що змінилося у 2025–2026
Якщо 2024-й був роком «великі MoE стали реальністю», то 2025–2026 — це роки оптимізації та демократизації архітектури.
Routing став розумнішим. Перші MoE-моделі страждали від нерівномірного завантаження: деякі експерти отримували більшість токенів, інші простоювали. DeepSeek V2 впровадив допоміжний балансувальний loss, а V3 додав shared experts — це значно стабілізувало навчання і підвищило якість на складних задачах.
Fine-tuning перестав бути болем. До 2025 року тонке налаштування MoE-моделей вимагало спеціальних знань: потрібно було вирішувати, чи навчати router, чи заморожувати його, як зберігати баланс між експертами. Тепер більшість фреймворків — HuggingFace, Axolotl, LLaMA-Factory — підтримують LoRA для MoE без додаткових налаштувань.
Expert parallelism став стандартом. Для великих MoE з'явився окремий вид паралелізму: різні GPU тримають різних експертів і обмінюються активаціями через high-speed interconnect. vLLM та TensorRT-LLM підтримують це нативно починаючи з 2025 року.
Маленькі MoE стали корисними на edge. Qwen2.5-MoE-3B-A800M — модель із 3B параметрів, яка активує лише 800M на токен. На CPU-inference це означає швидкість dense-0.8B при якості dense-3B. Це відкриває нові можливості для локального деплою на обмеженому залізі.
Практичні наслідки для AI-білдерів
Розуміння MoE-архітектури вже не академічне питання — воно впливає на рішення, які розробники приймають щодня.
Вибір базової моделі. Якщо потрібна максимальна якість при обмеженому бюджеті на інференс — MoE-модель часто краща, ніж dense аналогічного «розміру». Але є застереження: MoE потребує більше VRAM для завантаження всіх ваг, навіть якщо активується менша частина. Оцінюйте не кількість параметрів, а VRAM footprint і активні параметри на токен.
Fine-tuning: три правила. При LoRA на MoE важливо:
- Навчати адаптери лише на активних (не на всіх) експертах — це зменшує витрати й зберігає баланс
- Стежити за drift router'а після навчання — перекіс погіршує генералізацію
- Використовувати достатньо великий batch size: MoE нестабільний на малих батчах через рідкісну активацію окремих експертів
RAG та агентні системи. MoE-моделі показують сильніший результат там, де потрібна різнорідна компетентність: код + аналіз документів + структуровані дані в одному запиті. Це робить їх природним вибором для RAG-пайплайнів з гетерогенними джерелами знань.
Оцінка cost/quality. Не порівнюйте MoE з dense за загальною кількістю параметрів — це вводить в оману. Правильна метрика: активні параметри на токен плюс загальний VRAM. DeepSeek V3 в інференсі коштує приблизно як 37B dense-модель — враховуйте це при виборі хмарного провайдера чи власного заліза.
Висновок AiiN
MoE у 2026 році — це вже не «experimental». Це архітектурний вибір, який визначає вартість, якість і можливості масштабування для більшості нових frontier-моделей. Розрив між dense і MoE продовжує зростати на користь останнього — особливо там, де критичний баланс між якістю та ціною інференсу.
Для AI-білдерів ключовий висновок простий: оцінюючи будь-яку нову модель, завжди перевіряйте три речі — чи є вона MoE, скільки параметрів активується на токен, і чи підтримує ваш inference-стек expert parallelism. Ці питання тепер такі ж базові, як розмір контекстного вікна чи умови ліцензії.