Деякий контент на цьому сайті був створений з допомогою штучного інтелекту
Повернутися до словника Штучний інтелект

RLHF (Посилення навчання з людської обратної зв'язності)

Метод навчання моделей AI з використанням людської оцінки відповідей, ключовий для безпеки та корисності сучасних асистентів AI.

Що таке RLHF?

RLHF (Reinforcement Learning from Human Feedback) - це техніка налаштування мовних моделей, у якій люди оцінюють якість відповідей, згенерованих моделлю, а ці оцінки використовуються для подальшого тренування. Цей процес робить модель здатною генерувати більш корисні, безпечні та відповідні намірам користувача відповіді. RLHF є ключовим етапом створення сучасних помічників AI, таких як ChatGPT чи Claude.

Як працює RLHF?

Процес складається з трьох етапів: спочатку базова модель налаштовується на прикладах бажаних відповідей (SFT - Supervised Fine-Tuning). Потім люди порівнюють пари відповідей моделі та вказують кращу, що дозволяє тренувати модель нагороди (reward model). На завершення мовна модель оптимізується алгоритмом PPO (Proximal Policy Optimization), щоб максимізувати оцінку моделі нагороди, зберігаючи при цьому близькість до базової моделі.

Значення для бізнесових застосувань

RLHF є причиною, через яку сучасні моделі AI можуть вести природні розмови, дотримуватися інструкцій та відмовляти у виконанні небезпечних команд. У контексті підприємства RLHF забезпечує, що агенти AI поводяться передбачувано та безпечно - що є ключовим у системах автономного прийняття бізнес-рішень.