Что такое Mixture of Experts?
Mixture of Experts (MoE) — это архитектура нейронной сети, в которой модель состоит из множества специализированных подсетей («экспертов») и механизма шлюзования (gating network), который для каждого токена выбирает лишь несколько наиболее подходящих экспертов. Благодаря этому модель может иметь огромное число параметров, но для каждого запроса активирует лишь малую их часть — что резко снижает вычислительную стоимость инференса.
Как работает маршрутизация экспертов?
Сеть шлюзования анализирует входные данные и назначает каждый токен наиболее подходящим экспертам (обычно 2 из 8 или более). Каждый эксперт специализируется на своём типе знаний — например, математическом рассуждении, генерации кода или анализе естественного языка. Механизм балансировки нагрузки (load balancing) предотвращает ситуацию, когда один эксперт перегружен, а другие не используются.
Значение для внедрений AI
Архитектура MoE (используемая, в частности, в Mixtral и GPT-4) особенно важна для организаций, которым нужны модели с широкими компетенциями при ограниченном вычислительном бюджете. Концепция специализации экспертов имеет аналогию в корпоративных мультиагентных системах, где десятки специализированных агентов AI обслуживают разные бизнес-домены, а интеллектуальная маршрутизация направляет каждую задачу наиболее компетентному агенту.