Localizing Anchoring Pathways in Language Models
Signal
78
Hype
15
In three linesStudy of internal anchoring mechanisms in language models. Researchers localize circuits responsible for anchoring bias (where irrelevant numbers influence answers) in Qwen and Llama 7B-8B models. Edge-level attribution methods recover this signal more faithfully than node-level methods.Read source
Your take?
Summary generated by Claude — human-verified