Що таке дистиляція знань?
Дистиляція моделей (Knowledge Distillation) - це техніка стиснення, при якій менша модель ("учень") вчиться наслідувати поведінку більшої моделі ("учитель"). Замість навчання малої моделі на сирих даних, учень навчається на "м'яких" виходах учителя - розподілах ймовірностей, які містять більш багату інформацію, ніж звичайні мітки. Це дозволяє малій моделі впіймати нюанси та залежності, відкриті великою моделлю.
Як проходить процес?
Учитель (наприклад, модель з мільярдами параметрів) генерує передбачення для набору тренувальних даних. Учень - значно менша мережа - тренується так, щоб його виходи були якнайближче до виходів учителя. Параметр "температура" контролює м'якість розподілів ймовірностей: вища температура розкриває більше інформації про відносини між класами. Процес можна поєднувати з квантовацією для додаткового стиснення.
Підприємницькі застосування
У корпоративному середовищі дистиляція дозволяє створювати спеціалізовані, легкі моделі, адаптовані до конкретних завдань - наприклад, класифікації електронної пошти, видобутку даних з документів або маршрутизації запитів. Дистильована модель може працювати локально, забезпечуючи низькі витрати, короткий час відповіді та повний контроль над даними без відправки їх до зовнішніх API ESKOM AI.