Part del contingut d'aquest lloc s'ha creat amb assistència d'IA
Tornar al glossari Intel·ligència Artificial

Aprenentatge per Refuerzo amb Retroalimentació Humana (RLHF)

Una tècnica d'entrenament que utilitza les preferències humanes per fer que els models d'IA siguin més segurs i útils.

Què és el RLHF?

L'aprenentatge per refuerzo amb retroalimentació humana (RLHF) és una tècnica d'entrenament dissenyada per alinear els models d'IA amb els valors i preferències humans. Combina l'ajustament fi supervisat, l'entrenament d'un model de recompensa a partir d'avaluacions humanes i l'aprenentatge per refuerzo per optimitzar el model principal segons aquest model de recompensa.

Proces RLHF

El procés RLHF típic comprèn tres fases: 1) ajustament fi supervisat sobre dades de demostració, 2) entrenament d'un model de recompensa, on avaluadors humans comparen i classifiquen sortides del model, 3) optimització del model principal mitjançant PPO (Proximal Policy Optimization) per maximitzar les recompenses. Variants com DPO (Direct Preference Optimization) simplifiquen aquest procés.

Importància per a la IA segura

El RLHF és la principal raó per la qual els LLMs moderns com GPT-4, Claude i Gemini són més segurs, útils i menys perjudicials que els models de predicció del següent token pur. Fa que els models siguin millors en comprendre les intencions humanes, donar respostes útils en lloc de simplement probables i evitar contingut perjudicial.