Čo je Mixture of Experts?
Mixture of Experts (MoE) je architektonický vzor, kde model obsahuje viacero špecializovaných podsietí – expertov – a pre každý vstup sa aktivuje len časť z nich. Rozhodnutie, ktorí experti spracujú daný vstup, robí gating network (bránová sieť).
Táto architektúra umožňuje dramaticky zvýšiť celkový počet parametrov modelu bez proporcionálneho nárastu výpočtových nákladov počas inferencie.
Výhody MoE architektúry
Kľúčovou vlastnosťou je conditional computation – každý token aktivuje len malú časť parametrov (napr. 2 z 8 expertov). To umožňuje modelu mať miliardy parametrov, pričom inferenčná rýchlosť zostáva porovnateľná s menšími hustými modelmi.
Špecializácia je ďalšou výhodou: rôzni experti sa naučia špecializovať na rôzne typy vstupov alebo jazykových konštrukcií, čo môže zlepšiť kvalitu na špecifických úlohách.
Praktické použitie
Google GShard a Switch Transformer boli prvé veľké MoE modely. Novšie modely ako Mistral Mixtral a predpokladane GPT-4 využívajú MoE architektúru. Hlavnou výzvou je load balancing – zabezpečenie, že všetci experti sú rovnomerne využívaní a jeden expert sa nestane bottleneckom.