Časť obsahu tejto stránky bola vytvorená s pomocou AI
Späť na slovník Technológie

Kvantizácia modelu

Technika na zníženie veľkosti AI modelu a výpočtových požiadaviek použitím numerických reprezentácií nižšej presnosti.

Čo je kvantizácia modelu?

Kvantizácia modelu je technika kompresie, ktorá znižuje presnosť váh a aktivácií neurónovej siete zo štandardnej 32-bitovej alebo 16-bitovej pohyblivej rádovej čiarky (FP32/FP16) na formáty nižšej presnosti ako INT8 (8-bitové celé číslo) alebo INT4 (4-bitové celé číslo). Toto môže zmenšiť veľkosť modelu 2–8x a významne urýchliť inferenciu, často s minimálnym dopadom na kvalitu výstupov.

Prečo kvantizácia záleží pre nasadenie

Spúšťanie veľkých jazykových modelov pri plnej presnosti vyžaduje drahý GPU hardvér so značnou pamäťou. Kvantizácia umožňuje organizáciám nasadiť výkonné modely na skromnejšiu infraštruktúru. Model so 70 miliardami parametrov, ktorý bežne vyžaduje viacero GPU, môže bežať na jednom GPU kvantizovaný na 4-bitovú presnosť.

Kompromisy a osvedčené postupy

Kľúčový kompromis je medzi kompresiou a kvalitou. INT8 kvantizácia typicky zachováva viac ako 99 % kvality modelu. Podnikové nasadenia by mali benchmarkovať kvantizované modely oproti základným hodnotám plnej presnosti na ich špecifických prípadoch použitia.

Súvisiace služby a produkty