When Autoregressive Consistency Hurts Safety Alignment
Signal
78
Hype
15
En 3 lignesDes chercheurs montrent que l'alignement de sécurité des LLM est fragile car concentré sur les premiers tokens. Le mécanisme d'autoregressive consistency permet aux attaques d'insérer des séquences nuisibles à n'importe quelle position et de les prolonger. Ils proposent adversarial safety alignment avec random worst-insertion training pour briser cette cohérence.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain