Què és el RLHF?
L'aprenentatge per refuerzo amb retroalimentació humana (RLHF) és una tècnica d'entrenament dissenyada per alinear els models d'IA amb els valors i preferències humans. Combina l'ajustament fi supervisat, l'entrenament d'un model de recompensa a partir d'avaluacions humanes i l'aprenentatge per refuerzo per optimitzar el model principal segons aquest model de recompensa.
Proces RLHF
El procés RLHF típic comprèn tres fases: 1) ajustament fi supervisat sobre dades de demostració, 2) entrenament d'un model de recompensa, on avaluadors humans comparen i classifiquen sortides del model, 3) optimització del model principal mitjançant PPO (Proximal Policy Optimization) per maximitzar les recompenses. Variants com DPO (Direct Preference Optimization) simplifiquen aquest procés.
Importància per a la IA segura
El RLHF és la principal raó per la qual els LLMs moderns com GPT-4, Claude i Gemini són més segurs, útils i menys perjudicials que els models de predicció del següent token pur. Fa que els models siguin millors en comprendre les intencions humanes, donar respostes útils en lloc de simplement probables i evitar contingut perjudicial.