Что такое квантование?
Квантование моделей — это техника оптимизации, при которой веса нейронной сети преобразуются из высокой точности (обычно 32-битной с плавающей точкой, FP32) в более низкую — чаще всего INT8 (8-битную целочисленную) или INT4 (4-битную). Это позволяет резко уменьшить размер модели и ускорить инференс при относительно небольшой потере качества ответов.
Методы квантования
Существуют два основных подхода: квантование после обучения (Post-Training Quantization, PTQ) — применяется к готовой модели без повторного обучения, и квантование, учитывающее обучение (Quantization-Aware Training, QAT) — учитывает сниженную точность уже в процессе обучения. Популярные форматы — GPTQ, GGUF и AWQ, различающиеся компромиссом между качеством и производительностью. Модель на 70 млрд параметров в формате INT4 может занимать в четыре раза меньше памяти, чем оригинал.
Значение для бизнеса
Квантование критически важно для корпоративных внедрений, поскольку позволяет запускать продвинутые модели AI на локальной инфраструктуре — без необходимости в дорогостоящих картах GPU класса A100. При многоуровневой маршрутизации LLM квантованные локальные модели обрабатывают более простые запросы при нулевой стоимости API, а более сложные задачи направляются к облачным моделям полной точности.