Časť obsahu tejto stránky bola vytvorená s pomocou AI
Späť na slovník Umelá inteligencia

RLHF (Reinforcement Learning from Human Feedback)

RLHF je technika trénovania AI modelov, kde ľudskí hodnotitelia poskytujú feedback na výstupy modelu, ktorý sa používa na trénovanie reward modelu a následne na doladenie AI pomocou reinforcement learningu.

Čo je RLHF?

Reinforcement Learning from Human Feedback (RLHF) je kľúčová technika, ktorá transformovala LLM od jazykových modelov na užitočných asistentov. ChatGPT, Claude a Gemini by bez RLHF poskytovali technicky presný, ale často neužitočný alebo nealignovaný výstup.

RLHF adresuje fundamentálny problém: ako naučiť model správať sa tak, ako si ľudia želajú, keď je ťažké formalizovať tieto preferencie matematicky.

Trojfázový trénovací proces

RLHF prebieha v troch fázach. Supervised Fine-Tuning (SFT): model sa dolaďuje na kurátorovaných príkladoch žiadaných odpovedí. Reward Model Training: ľudia porovnávajú viacero odpovedí modelu a hodnotia ich kvalitu; tieto hodnotenia trénujú oddelený reward model, ktorý predikuje ľudské preferencie.

RL fáza: pomocou PPO (Proximal Policy Optimization) sa hlavný model dolaďuje tak, aby maximalizoval skóre reward modelu, pričom zostáva blízko pôvodnej distribúcii (KL divergence penalizácia).

Varianty a nasledovníci RLHF

RLHF je náročné na implementáciu a vyžaduje veľa ľudských hodnotiteľov. Direct Preference Optimization (DPO) a Constitutional AI (CAI) sú alternatívne prístupy, ktoré zachovávajú cieľ alignmentu, ale sú jednoduchšie na trénovanie. RLAIF (RLHF s AI feedback namiesto ľudským) znižuje náklady na zber preferencií.