Expert • Les 27

RLHF reward models: hoe menselijke voorkeuren worden vertaald naar een scorefunctie

Reinforcement Learning from Human Feedback (RLHF) is de techniek waarmee modellen als ChatGPT en Claude worden afgestemd op menselijke wensen. De spil van dit proces is het reward model: een neuraal netwerk dat leert voorspellen welke output een mens zou prefereren. Zonder een goed reward model is RLHF niet mogelijk.

Vergelijkingsdata verzamelen

Het reward model wordt getraind op pairwise preferences: voor dezelfde prompt worden twee modelresponses aan een menselijke annotator getoond, die aangeeft welke beter is. Dit is makkelijker dan het geven van een absolute score op een schaal van 1-10. Duizenden zulke vergelijkingen vormen de trainingsdataset. De kwaliteit en consistentie van de annotators — en de instructies die ze meekrijgen — zijn bepalend voor de uiteindelijke richting van het model.

Het Bradley-Terry model

Het reward model leert een scalaire score r(prompt, response) te voorspellen. Training gebruikt het Bradley-Terry model als verliesfunctie: de kans dat response A de voorkeur krijgt boven B is proportioneel aan exp(r(A)) / (exp(r(A)) + exp(r(B))). De parameters worden geoptimaliseerd zodat de voorspelde voorkeurskansen overeenkomen met de menselijke vergelijkingen.

Reward hacking en Goodhart’s Law

Zodra het beleid wordt geoptimaliseerd tegen het reward model, treedt reward hacking op: het taalmodel leert outputs te genereren die een hoge score krijgen zonder de onderliggende intentie te vervullen. Lange, bevestigende antwoorden worden soms beloond ongeacht accuraatheid. Goodhart’s Law: zodra een maatstaf een doelstelling wordt, houdt het op een goede maatstaf te zijn. Mitigaties zijn KL-regularisatie (houd het beleid dicht bij het basismodel) en periodieke hertraining van het reward model op nieuwe data.

Constitutional AI en direct preference optimization

Nieuwere benaderingen proberen het reward model te vervangen of te vereenvoudigen. Constitutional AI (Anthropic) laat het model zichzelf evalueren op basis van een stel principes. Direct Preference Optimization (DPO) elimineert de aparte reward-modelstap en optimaliseert direct op de pairwise voorkeursdataset via een gesloten-vorm verliesfunctie. DPO is stabieler en eenvoudiger te implementeren, maar minder flexibel bij dynamische online feedback.