Webgune honetako eduki batzuk adimen artifizialaren laguntzaz sortu dira
Glosategiara itzuli Adimen Artifiziala

Giza Irudipenaren Bidezko Indarreko Ikaskuntza (RLHF)

Giza aurreferentziek erabiltzen dituen entrenamendu-teknika bat, IA modeloak seguruagoak eta erabilgarriagoak bihurtzeko.

Zer da RLHF?

Giza irudipenaren bidezko indarreko ikaskuntza (RLHF) giza balio eta aurreferentziekin IA modeloak lerrokatzen dituen entrenamendu-teknika bat da. Zuzeneko doikuntza, sari-modelo bat entrenatzea giza ebaluazioetatik abiatuta eta indarreko ikaskuntza konbinatzen ditu modelo nagusia sari-modelo honen arabera optimizatzeko.

RLHF Prozesua

RLHF prozesu tipikoa hiru fase ditu: 1) zuzeneko doikuntza demostrazio-daturi buruz, 2) sari-modelo bat entrenatzea, non giza ebaluatzaileek modeloaren irteerak konparatzen eta sailkatzen dituzten, 3) modelo nagusia PPO (Proximal Policy Optimization) bidez optimizatzea sariak maximizatzeko. DPO (Zuzeneko Aurreferentzia Optimizazioa) bezalako aldaerak prozesu hau sinplifikatzen dute.

IA Seguruaren Garrantzia

RLHF da arrazoi nagusia zergatik LLM modernoak, hala nola GPT-4, Claude eta Gemini, lehenago token hurrengoa aurreikusteko modeloak baino seguruagoak, erabilgarriagoak eta kaltegarriagoak dira. Giza asmoak ulertzeko, erabilgarriak izateko ordez soilik probabilitateak emateko, eta eduki kaltegarriak saihestea ahalbidetzen du.