Retour au feed
arXiv cs.LG·

Temporal Preference Concepts and their Functions in a Large Language Model

Signal
75
Hype
15
En 3 lignesÉtude de mécanismes interprétatifs sur Qwen3-4B-Instruct-2507 : localisation causale de circuits de préférence temporelle via attribution de gradients et patching d'activation. Les LLMs encodent l'horizon temporel dans le residual stream et actualisent le futur moins fortement que les humains, mais cette préférence est instable contextuellement. Vecteurs de steering montrent un potentiel de contrôle explicite.
Lire la source
Ton avis ?
QwenRaisonnementAlignement

Résumé généré par Claude — vérifié par l'humain