Retour au feed
arXiv cs.CL·

Steerable Cultural Preference Optimization of Reward Models

Signal
72
Hype
25
En 3 lignesNouvelle méthode SCPO pour entraîner des reward models capables de représenter équitablement les préférences culturelles de différentes communautés. Gains de 7 points pour les modèles minoritaires sur PRISM et GlobalOpinionQA (7 pays), avec 280% d'efficacité accrue en données d'entraînement.
Lire la source
Ton avis ?
AlignementReinforcement learningÉvaluationsPapers

Résumé généré par Claude — vérifié par l'humain