Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning
Signal
72
Hype
18
En 3 lignesSWARR combine l'attention à fenêtre glissante (SWA) avec l'apprentissage par renforcement pour le raisonnement mathématique. Après conversion supervisée d'un modèle SA préentraîné, l'RL adapte les trajectoires générées au contrainte SWA, réduisant l'écart de performance tout en conservant la complexité linéaire. Expériences sur benchmarks de raisonnement mathématique.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain