Некоторый контент на этом сайте был создан с помощью AI
Вернуться к словарю Технологии

Квантование моделей

Техника уменьшения размера моделей AI путём снижения числовой точности весов, позволяющая запускать крупные модели на менее мощном оборудовании.

Что такое квантование?

Квантование моделей — это техника оптимизации, при которой веса нейронной сети преобразуются из высокой точности (обычно 32-битной с плавающей точкой, FP32) в более низкую — чаще всего INT8 (8-битную целочисленную) или INT4 (4-битную). Это позволяет резко уменьшить размер модели и ускорить инференс при относительно небольшой потере качества ответов.

Методы квантования

Существуют два основных подхода: квантование после обучения (Post-Training Quantization, PTQ) — применяется к готовой модели без повторного обучения, и квантование, учитывающее обучение (Quantization-Aware Training, QAT) — учитывает сниженную точность уже в процессе обучения. Популярные форматы — GPTQ, GGUF и AWQ, различающиеся компромиссом между качеством и производительностью. Модель на 70 млрд параметров в формате INT4 может занимать в четыре раза меньше памяти, чем оригинал.

Значение для бизнеса

Квантование критически важно для корпоративных внедрений, поскольку позволяет запускать продвинутые модели AI на локальной инфраструктуре — без необходимости в дорогостоящих картах GPU класса A100. При многоуровневой маршрутизации LLM квантованные локальные модели обрабатывают более простые запросы при нулевой стоимости API, а более сложные задачи направляются к облачным моделям полной точности.

Связанные услуги и продукты