Retour au feed
arXiv cs.AI·

Refusal Beyond a Single Direction: A Preliminary Comparison of Diff-in-Means and INLP

Signal
72
Hype
15
En 3 lignesComparaison de deux méthodes d'intervention sur les refus de sécurité dans les modèles de chat : Difference-in-Means (DiM) vs Iterative Nullspace Projection (INLP). Sur 5 modèles open-weight, INLP counterfactual flipping égale DiM en suppression des refus, tandis que nullspace projection est plus faible. Les deux approches opèrent différemment dans l'espace d'activation.
Lire la source
Ton avis ?
Sécurité IAAlignementPapersOpen source

Résumé généré par Claude — vérifié par l'humain