Čo je kvantizácia modelu?
Kvantizácia modelu je technika kompresie, ktorá znižuje presnosť váh a aktivácií neurónovej siete zo štandardnej 32-bitovej alebo 16-bitovej pohyblivej rádovej čiarky (FP32/FP16) na formáty nižšej presnosti ako INT8 (8-bitové celé číslo) alebo INT4 (4-bitové celé číslo). Toto môže zmenšiť veľkosť modelu 2–8x a významne urýchliť inferenciu, často s minimálnym dopadom na kvalitu výstupov.
Prečo kvantizácia záleží pre nasadenie
Spúšťanie veľkých jazykových modelov pri plnej presnosti vyžaduje drahý GPU hardvér so značnou pamäťou. Kvantizácia umožňuje organizáciám nasadiť výkonné modely na skromnejšiu infraštruktúru. Model so 70 miliardami parametrov, ktorý bežne vyžaduje viacero GPU, môže bežať na jednom GPU kvantizovaný na 4-bitovú presnosť.
Kompromisy a osvedčené postupy
Kľúčový kompromis je medzi kompresiou a kvalitou. INT8 kvantizácia typicky zachováva viac ako 99 % kvality modelu. Podnikové nasadenia by mali benchmarkovať kvantizované modely oproti základným hodnotám plnej presnosti na ich špecifických prípadoch použitia.