Коли наприкінці 2023 року вийшов Mixtral 8x7B від Mistral, більшість розробників сприйняли його як цікавий, але нішевий експеримент. Модель на 46 мільярдів параметрів поводилася як 12-мільярдна в інференсі — звучало майже як маркетингова гра. Але вже за рік стало зрозуміло: Mixture of Experts (MoE) — не трюк, а структурна зміна у тому, як будуються великі мовні моделі.

Сьогодні MoE-архітектура лежить в основі DeepSeek V3, Grok 3, Qwen2.5-MoE, і, за більшістю оцінок, Gemini 1.5/2.0. Те, що колись було дослідницькою ідеєю з паперів Google Brain 1991 року, стало практичним стандартом для frontier-розробки. У 2026-му ця архітектура вже не потребує виправдання — вона потребує розуміння.

Як MoE влаштований: не вся мережа активується одночасно

Dense-трансформер — GPT-2, LLaMA 2, ранні версії Claude — обробляє кожен токен через усі параметри мережі. MoE розбиває Feed-Forward шар на кілька незалежних «експертів» і активує лише частину з них для кожного токена. Яку саме частину — вирішує router-мережа (gating network), яка навчається разом з основною моделлю.

Типова схема на 2026 рік виглядає так:

Результат: параметрів у моделі більше, але FLOP-ів на інференс — менше. DeepSeek V3 має 671B параметрів і активує ~37B на кожен токен. На практиці це означає якість 671B-моделі при витратах, близьких до 37B dense-аналога.

Що змінилося у 2025–2026

Якщо 2024-й був роком «великі MoE стали реальністю», то 2025–2026 — це роки оптимізації та демократизації архітектури.

Routing став розумнішим. Перші MoE-моделі страждали від нерівномірного завантаження: деякі експерти отримували більшість токенів, інші простоювали. DeepSeek V2 впровадив допоміжний балансувальний loss, а V3 додав shared experts — це значно стабілізувало навчання і підвищило якість на складних задачах.

Fine-tuning перестав бути болем. До 2025 року тонке налаштування MoE-моделей вимагало спеціальних знань: потрібно було вирішувати, чи навчати router, чи заморожувати його, як зберігати баланс між експертами. Тепер більшість фреймворків — HuggingFace, Axolotl, LLaMA-Factory — підтримують LoRA для MoE без додаткових налаштувань.

Expert parallelism став стандартом. Для великих MoE з'явився окремий вид паралелізму: різні GPU тримають різних експертів і обмінюються активаціями через high-speed interconnect. vLLM та TensorRT-LLM підтримують це нативно починаючи з 2025 року.

Маленькі MoE стали корисними на edge. Qwen2.5-MoE-3B-A800M — модель із 3B параметрів, яка активує лише 800M на токен. На CPU-inference це означає швидкість dense-0.8B при якості dense-3B. Це відкриває нові можливості для локального деплою на обмеженому залізі.

Практичні наслідки для AI-білдерів

Розуміння MoE-архітектури вже не академічне питання — воно впливає на рішення, які розробники приймають щодня.

Вибір базової моделі. Якщо потрібна максимальна якість при обмеженому бюджеті на інференс — MoE-модель часто краща, ніж dense аналогічного «розміру». Але є застереження: MoE потребує більше VRAM для завантаження всіх ваг, навіть якщо активується менша частина. Оцінюйте не кількість параметрів, а VRAM footprint і активні параметри на токен.

Fine-tuning: три правила. При LoRA на MoE важливо:

RAG та агентні системи. MoE-моделі показують сильніший результат там, де потрібна різнорідна компетентність: код + аналіз документів + структуровані дані в одному запиті. Це робить їх природним вибором для RAG-пайплайнів з гетерогенними джерелами знань.

Оцінка cost/quality. Не порівнюйте MoE з dense за загальною кількістю параметрів — це вводить в оману. Правильна метрика: активні параметри на токен плюс загальний VRAM. DeepSeek V3 в інференсі коштує приблизно як 37B dense-модель — враховуйте це при виборі хмарного провайдера чи власного заліза.

Висновок AiiN

MoE у 2026 році — це вже не «experimental». Це архітектурний вибір, який визначає вартість, якість і можливості масштабування для більшості нових frontier-моделей. Розрив між dense і MoE продовжує зростати на користь останнього — особливо там, де критичний баланс між якістю та ціною інференсу.

Для AI-білдерів ключовий висновок простий: оцінюючи будь-яку нову модель, завжди перевіряйте три речі — чи є вона MoE, скільки параметрів активується на токен, і чи підтримує ваш inference-стек expert parallelism. Ці питання тепер такі ж базові, як розмір контекстного вікна чи умови ліцензії.