Деякий контент на цьому сайті був створений з допомогою штучного інтелекту
Повернутися до словника Технологія

Квантитизація моделей

Техніка зменшення розміру моделей AI шляхом зменшення точності числових ваг, що дозволяє запускати великі моделі на слабшому обладнанні.

Що таке квантизація?

Квантизація моделей - це техніка оптимізації, при якій ваги нейронної мережі конвертуються з високої точності (зазвичай 32-бітової з плаваючою комою, FP32) до нижчої - найчастіше INT8 (8-бітової цілої) або INT4 (4-бітової). Це дозволяє значно зменшити розмір моделі та прискорити інференцію, при відносно невеликій втраті якості відповіді.

Методи квантизації

Існують два основних підходи: квантизація після тренування (Post-Training Quantization, PTQ) - застосовується до готової моделі без повторного навчання, та квантизація, усвідомлена тренуванням (Quantization-Aware Training, QAT) - що враховує знижену точність уже на етапі навчання. Популярні формати - GPTQ, GGUF та AWQ, що відрізняються компромісом між якістю та продуктивністю. Модель 70B параметрів у форматі INT4 може займати навіть у чотири рази менше пам'яті, ніж оригінал.

Бізнесове значення

Квантизація є ключовою для корпоративних розгортань, оскільки дозволяє запускати просунуті моделі AI на локальній інфраструктурі - без потреби у дорогих картах GPU класу A100. У багаторівневому маршрутизації LLM квантовані локальні моделі підтримують простіші запити при нульовому кошті API, а більш складні завдання направляються до хмарних моделей повної точності.

Пов'язані послуги та продукти