Коли DeepSeek-V3 з'явився з результатами, що перевершували GPT-4o на ряді бенчмарків при значно нижчій вартості інференсу, в спільноті AI-білдерів знову заговорили про Mixture of Experts. Але вибір архітектури — це не питання моди. Це інженерне рішення з конкретними компромісами, які напряму впливають на витрати, латентність і складність розгортання.

MoE — не нова ідея. Вона з'явилася ще в 1990-х роках, але промислове застосування отримала лише з появою sparse MoE у масштабних трансформерах. Сьогодні її використовують Mixtral, DeepSeek, Grok-1 і, за численними оцінками, GPT-4.

Альтернативи теж не стояли на місці: щільні трансформери залишаються стандартом для відтворюваних результатів, State Space Models — зокрема Mamba — набирають вагу в задачах із довгим контекстом, а гібридні архітектури намагаються взяти краще від обох підходів.

Як працює MoE — і де ховаються підводні камені

Mixture of Experts замінює щільний feedforward блок у трансформері набором незалежних «експертів» — окремих нейронних підмереж. Router вирішує, які два-чотири експерти з десятків або сотень обробляють кожен конкретний токен. Результат: загальна кількість параметрів величезна, але активних у кожному проході — мала частина.

Звідси і головна перевага: вища якість при нижчому обчислювальному бюджеті за токен. Mixtral 8x7B технічно містить ~46B параметрів, але активує лише ~12B на токен, наближаючись до якості Llama-2 70B при вдвічі меншому обчислювальному навантаженні.

Але є нюанси, про які не завжди говорять відкрито:

Альтернативи: dense-трансформери, SSM і гібриди

Dense-трансформери — Llama 3, Mistral 7B, Qwen 2.5, Gemma — перевірений вибір. Усі параметри активуються на кожен токен: передбачувана поведінка, простіше розгортання, краща підтримка inference-фреймворків. Для більшості продуктових завдань — RAG, агенти, чат-боти — це достатній і менш ризикований вибір.

State Space Models, зокрема Mamba та його варіації, пропонують лінійну складність за довжиною послідовності замість квадратичної в трансформерах. Це критично для задач із дуже довгим контекстом або стрімінгових додатків із низькою латентністю. Проте SSM поки відстають від трансформерів на стандартних NLP-бенчмарках і мають значно меншу екосистему інструментів.

Гібридні архітектури — Jamba від AI21 Labs (Mamba + MoE), Zamba, RWKV-hybrid — намагаються поєднати переваги обох підходів. Поки це дослідницький фронтир, а не production-стек для більшості команд.

Практичний вибір для AI-білдера

Дивіться в бік MoE, якщо:

Залишайтеся з dense-трансформерами, якщо:

Дивіться на SSM і гібриди, якщо:

Висновок AiiN

MoE — потужний інструмент, але не срібна куля. Його перевага найочевидніша на рівні API-доступу до великих моделей або в дослідницькому контексті з достатньою інфраструктурою. Для більшості продуктових команд, особливо тих, хто самостійно розгортає моделі, dense-трансформери залишаються більш прагматичним вибором — з кращою підтримкою, простішим налаштуванням і передбачуваною поведінкою.

Стежте за гібридними архітектурами: ландшафт змінюється швидко, і Jamba, Zamba та нові hybrid SSM вже показують конкурентні результати. Наступні 12–18 місяців, найімовірніше, кардинально змінять уявлення про оптимальну архітектуру для конкретних задач.