Skip a Layer or Loop It? Learning Program-of-Layers in LLMs
Signal
75
Hype
25
En 3 lignesLes LLM exécutent habituellement tous les layers dans un ordre fixe. Cette recherche révèle que des exécutions dynamiques (PoLar) peuvent sauter ou boucler les layers selon chaque input, réduisant la profondeur tout en maintenant ou améliorant la précision. Un réseau de prédiction léger génère des programmes d'exécution personnalisés, améliorant les résultats sur les benchmarks de raisonnement mathématique.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain