Retour au feed
arXiv cs.AI·

Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning

Signal
72
Hype
18
En 3 lignesSWARR combine l'attention à fenêtre glissante (SWA) avec l'apprentissage par renforcement pour le raisonnement mathématique. Après conversion supervisée d'un modèle SA préentraîné, l'RL adapte les trajectoires générées au contrainte SWA, réduisant l'écart de performance tout en conservant la complexité linéaire. Expériences sur benchmarks de raisonnement mathématique.
Lire la source
Ton avis ?
Reinforcement learningRaisonnementPapers

Résumé généré par Claude — vérifié par l'humain