Деякий контент на цьому сайті був створений з допомогою штучного інтелекту
Повернутися до словника Технологія

Дестиляція моделей (Knowledge Distillation)

Процес передачі знань від великої моделі AI ("вчителя") до меншої ("учня"), що зберігає більшу частину можливостей при значно нижчих витратах.

Що таке дистиляція знань?

Дистиляція моделей (Knowledge Distillation) - це техніка стиснення, при якій менша модель ("учень") вчиться наслідувати поведінку більшої моделі ("учитель"). Замість навчання малої моделі на сирих даних, учень навчається на "м'яких" виходах учителя - розподілах ймовірностей, які містять більш багату інформацію, ніж звичайні мітки. Це дозволяє малій моделі впіймати нюанси та залежності, відкриті великою моделлю.

Як проходить процес?

Учитель (наприклад, модель з мільярдами параметрів) генерує передбачення для набору тренувальних даних. Учень - значно менша мережа - тренується так, щоб його виходи були якнайближче до виходів учителя. Параметр "температура" контролює м'якість розподілів ймовірностей: вища температура розкриває більше інформації про відносини між класами. Процес можна поєднувати з квантовацією для додаткового стиснення.

Підприємницькі застосування

У корпоративному середовищі дистиляція дозволяє створювати спеціалізовані, легкі моделі, адаптовані до конкретних завдань - наприклад, класифікації електронної пошти, видобутку даних з документів або маршрутизації запитів. Дистильована модель може працювати локально, забезпечуючи низькі витрати, короткий час відповіді та повний контроль над даними без відправки їх до зовнішніх API ESKOM AI.