Localizing Anchoring Pathways in Language Models
Signal
78
Hype
15
En 3 lignesÉtude des mécanismes internes d'ancrage numérique dans les modèles de langage. Les chercheurs localisent les circuits responsables des biais d'ancrage (où des nombres hors contexte influencent les réponses) dans Qwen et Llama 7B-8B. Les méthodes au niveau des arêtes capturent mieux ce signal que les méthodes au niveau des nœuds.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain