Після того як Mixtral 8x7B, DeepSeek-V3 і Grok-1 показали, що Mixture of Experts (MoE) дозволяє масштабувати продуктивність без лінійного зростання вартості inference, здається, ніби відповідь на питання «яку архітектуру обирати» стала очевидною. Але AI-білдери, які переходять на MoE без глибокого аналізу власного сценарію, часто натрапляють на несподівані труднощі: завеликий footprint у пам'яті, нестабільну латентність і складніший процес fine-tuning.

MoE — це не безкоштовний обід. Так, активується лише частина параметрів (у Mixtral 8x7B — два з восьми «експертів» на кожен токен), але загальний розмір моделі залишається величезним. Знати, коли не використовувати MoE — так само важливо для практика, як розуміти переваги цієї архітектури.

Що таке MoE і де ховається пастка

У класичній щільній мережі кожен токен проходить через усі параметри. У MoE є «маршрутизатор» (router), який вирішує, які кілька «експертів» (підмереж у FFN-блоці) обробляють цей токен. Теоретично — нижчі FLOPs на токен, вища ємність моделі при рівному бюджеті inference.

Але саме тут починається пастка для будівників систем. Модель із 47 млрд загальних параметрів (як Mixtral 8x7B) потребує завантаження усіх ваг у VRAM або RAM — навіть якщо активні лише 13 млрд. Тобто для хостингу такої моделі потрібно значно більше ресурсів, ніж для щільної моделі з 13 млрд параметрів, яка дасть порівнянну швидкість inference.

П'ять сценаріїв, де MoE програє

Практичні антипатерни при виборі MoE

Є кілька поширених помилок, які роблять AI-білдери при роботі з MoE:

Висновок AiiN

MoE — правильний вибір, коли є масштаб: high-throughput serving, кластер GPU, різноманітні завдання, де різні «знання» справді потрібні одночасно. Але для більшості команд, які будують перші production-системи або обмежені ресурсами, щільна модель залишається надійнішим і прогнозованішим вибором.

Перш ніж братися за MoE, дайте відповідь на три питання: чи поміщається повний чекпоінт у ваш hardware-бюджет? Чи достатній ваш throughput, щоб паралелізм мав сенс? Чи справді ваш use case виграє від diverse expertise, а не від глибокої спеціалізації? Якщо на будь-яке з них відповідь «ні» — скоріш за все, MoE зараз не для вас.