Parte do contido deste sitio creouse con asistencia de IA
Volver ao glosario Intelixencia Artificial

Aprendizaxe por Reforzamento con Retroalimentación Humana (RLHF)

Unha técnica de adestramento que utiliza as preferencias humanas para facer que os modelos de IA sexan máis seguros e útiles.

¿O que é o RLHF?

O aprendizaxe por reforzamento con retroalimentación humana (RLHF) é unha técnica de adestramento deseñada para alinear os modelos de IA cos valores e preferencias humanos. Combina o axuste fino supervisado, o adestramento dun modelo de recompensa a partir de avaliacións humanas e o aprendizaxe por reforzamento para optimizar o modelo principal segundo este modelo de recompensa.

Proceso RLHF

O proceso RLHF típico comprende tres fases: 1) axuste fino supervisado sobre datos de demostración, 2) adestramento dun modelo de recompensa, onde avaliadores humanos comparan e clasifican saidas do modelo, 3) optimización do modelo principal mediante PPO (Proximal Policy Optimization) para maximizar as recompensas. Variantes como DPO (Direct Preference Optimization) simplifican este proceso.

Importancia para a IA segura

O RLHF é a principal razón pola que os LLMs modernos como GPT-4, Claude e Gemini son máis seguros, útiles e menos daniños que os modelos de predición do seguinte token puro. Fai que os modelos sexan mellores en comprender as intencións humanas, dar respostas útiles en lugar de simplemente probables e evitar contido daniño.