¿O que é o RLHF?
O aprendizaxe por reforzamento con retroalimentación humana (RLHF) é unha técnica de adestramento deseñada para alinear os modelos de IA cos valores e preferencias humanos. Combina o axuste fino supervisado, o adestramento dun modelo de recompensa a partir de avaliacións humanas e o aprendizaxe por reforzamento para optimizar o modelo principal segundo este modelo de recompensa.
Proceso RLHF
O proceso RLHF típico comprende tres fases: 1) axuste fino supervisado sobre datos de demostración, 2) adestramento dun modelo de recompensa, onde avaliadores humanos comparan e clasifican saidas do modelo, 3) optimización do modelo principal mediante PPO (Proximal Policy Optimization) para maximizar as recompensas. Variantes como DPO (Direct Preference Optimization) simplifican este proceso.
Importancia para a IA segura
O RLHF é a principal razón pola que os LLMs modernos como GPT-4, Claude e Gemini son máis seguros, útiles e menos daniños que os modelos de predición do seguinte token puro. Fai que os modelos sexan mellores en comprender as intencións humanas, dar respostas útiles en lugar de simplemente probables e evitar contido daniño.