Čo je RLHF?
Reinforcement Learning from Human Feedback (RLHF) je kľúčová technika, ktorá transformovala LLM od jazykových modelov na užitočných asistentov. ChatGPT, Claude a Gemini by bez RLHF poskytovali technicky presný, ale často neužitočný alebo nealignovaný výstup.
RLHF adresuje fundamentálny problém: ako naučiť model správať sa tak, ako si ľudia želajú, keď je ťažké formalizovať tieto preferencie matematicky.
Trojfázový trénovací proces
RLHF prebieha v troch fázach. Supervised Fine-Tuning (SFT): model sa dolaďuje na kurátorovaných príkladoch žiadaných odpovedí. Reward Model Training: ľudia porovnávajú viacero odpovedí modelu a hodnotia ich kvalitu; tieto hodnotenia trénujú oddelený reward model, ktorý predikuje ľudské preferencie.
RL fáza: pomocou PPO (Proximal Policy Optimization) sa hlavný model dolaďuje tak, aby maximalizoval skóre reward modelu, pričom zostáva blízko pôvodnej distribúcii (KL divergence penalizácia).
Varianty a nasledovníci RLHF
RLHF je náročné na implementáciu a vyžaduje veľa ľudských hodnotiteľov. Direct Preference Optimization (DPO) a Constitutional AI (CAI) sú alternatívne prístupy, ktoré zachovávajú cieľ alignmentu, ale sú jednoduchšie na trénovanie. RLAIF (RLHF s AI feedback namiesto ľudským) znižuje náklady na zber preferencií.