Некоторый контент на этом сайте был создан с помощью AI
Вернуться к словарю Технологии

Дистилляция моделей (Knowledge Distillation)

Процесс передачи знаний от крупной модели AI («учителя») к меньшей («ученику»), сохраняющий большую часть возможностей при значительно меньших затратах.

Что такое дистилляция знаний?

Дистилляция моделей (Knowledge Distillation) — это техника сжатия, при которой меньшая модель («ученик») учится имитировать поведение более крупной модели («учитель»). Вместо обучения малой модели на сырых данных ученик обучается на «мягких» выходах учителя — распределениях вероятностей, содержащих более богатую информацию, чем обычные метки. Благодаря этому малая модель способна уловить нюансы и зависимости, обнаруженные крупной моделью.

Как проходит процесс?

Учитель (например, модель с миллиардами параметров) генерирует предсказания для обучающего набора данных. Ученик — значительно меньшая сеть — обучается так, чтобы его выходы максимально приблизились к выходам учителя. Параметр «температура» контролирует мягкость распределений вероятностей: более высокая температура раскрывает больше информации об отношениях между классами. Процесс можно сочетать с квантованием для дополнительного сжатия.

Применения в enterprise

В корпоративной среде дистилляция позволяет создавать специализированные, лёгкие модели, адаптированные под конкретные задачи — например, классификацию писем, извлечение данных из документов или маршрутизацию запросов. Дистиллированная модель может работать локально, обеспечивая низкие затраты, короткое время ответа и полный контроль над данными без отправки их в сторонние API.