Part del contingut d'aquest lloc s'ha creat amb assistència d'IA
Tornar al glossari Tecnologia

Cuantització

Una tècnica per reduir la mida del model i accelerar la inferència mitjançant l'ús de formats numèrics de menor precisió.

Què és la cuantització?

La cuantització és una tècnica d'optimització en la qual els pesos i activacions d'una xarxa neuronal es converteixen de nombres de punt flotant d'alta precisió (p. ex., float32) a formats de menor precisió (p. ex., int8, int4). Això redueix els requisits de memòria i accelera significativament la inferència.

Mètodes de cuantització

La cuantització post-entrenament (PTQ) aplica la cuantització després de l'entrenament i és fàcil d'implementar, però pot produir pèrdues de qualitat. L'entrenament conscient de la cuantització (QAT) té en compte els efectes de la cuantització durant l'entrenament i normalment aconsegueix millors resultats. Enfoques moderns com GPTQ i AWQ permeten la cuantització agressiva de 4 bits de grans models de llenguatge amb una pèrdua mínima de qualitat.

Relevància pràctica

La cuantització és crucial per al desplegament eficient de grans models d'IA en maquinari amb recursos limitats. Un LLM cuantitzat pot executar-se amb 4× menys memòria, el que permet el desplegament en maquinari de consumidor, dispositius edge i instàncies cloud més econòmiques.

Serveis i productes relacionats