SAE Interventions are Unreliable: Post-Intervention Recovery of Suppressed Behavior
Signal
78
Hype
25
En 3 lignesLes autoencodeurs creux (SAE) décomposent les activations en features interprétables, mais une étude montre que bloquer une feature « dangereuse » ne supprime pas le comportement : celui-ci peut se rétablir via d'autres chemins résiduels. Même avec intervention active, 95,8% de récupération du comportement est possible en refusal-steering, révélant un écart entre contrôle des features et contrôle comportemental.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain