Retour au feed
arXiv cs.LG·

SHALA-LLM: Smartly Handling Ambiguous Labels in Aligning LLMs

Signal
78
Hype
25
En 3 lignesSHALA-LLM est un framework d'apprentissage par renforcement qui traite l'ambiguïté des labels comme une information utile plutôt que du bruit. Sur NLI et reconnaissance d'émotions, il réduit la distance Jensen-Shannon de 62,1% sur ChaosNLI et améliore le F1 de 16,7% en apprenant directement des distributions d'annotateurs.
Lire la source
Ton avis ?
Reinforcement learningAlignementÉvaluationsPapers

Résumé généré par Claude — vérifié par l'humain