Retour au feed
arXiv cs.CL·

Hidden Consensus:Preference-Validity Compression in Human Feedback

Signal
72
Hype
15
En 3 lignesÉtude sur l'agrégation des retours humains en RLHF : réduire les jugements hétérogènes à une seule récompense scalaire masque les désaccords culturels, linguistiques ou normatifs légitimes. Analyse de 321 événements de préférence en Malaisie : 79% des prompts contiennent plusieurs réponses acceptables que l'agrégation par majorité élimine. Propose une approche préservant la pluralité des interprétations valides.
Lire la source
Ton avis ?
Reinforcement learningAlignementÉvaluationsPapers

Résumé généré par Claude — vérifié par l'humain