Що таке квантизація?
Квантизація моделей - це техніка оптимізації, при якій ваги нейронної мережі конвертуються з високої точності (зазвичай 32-бітової з плаваючою комою, FP32) до нижчої - найчастіше INT8 (8-бітової цілої) або INT4 (4-бітової). Це дозволяє значно зменшити розмір моделі та прискорити інференцію, при відносно невеликій втраті якості відповіді.
Методи квантизації
Існують два основних підходи: квантизація після тренування (Post-Training Quantization, PTQ) - застосовується до готової моделі без повторного навчання, та квантизація, усвідомлена тренуванням (Quantization-Aware Training, QAT) - що враховує знижену точність уже на етапі навчання. Популярні формати - GPTQ, GGUF та AWQ, що відрізняються компромісом між якістю та продуктивністю. Модель 70B параметрів у форматі INT4 може займати навіть у чотири рази менше пам'яті, ніж оригінал.
Бізнесове значення
Квантизація є ключовою для корпоративних розгортань, оскільки дозволяє запускати просунуті моделі AI на локальній інфраструктурі - без потреби у дорогих картах GPU класу A100. У багаторівневому маршрутизації LLM квантовані локальні моделі підтримують простіші запити при нульовому кошті API, а більш складні завдання направляються до хмарних моделей повної точності.