Retour au feed
arXiv cs.LG·

LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training

Signal
75
Hype
15
En 3 lignesLEAF est une méthode RL basée sur des arbres rétrospectifs pour l'entraînement post-training de LLM conscients de la parole. Elle améliore l'attribution de crédit en groupant les réponses par préfixes partagés et assignant des avantages au niveau des spans. LEAF surpasse GRPO sur les benchmarks de question-réponse et traduction vocale.
Lire la source
Ton avis ?
Reinforcement learningRaisonnementVoixPapers

Résumé généré par Claude — vérifié par l'humain