Retour au feed
arXiv cs.LG·

When Autoregressive Consistency Hurts Safety Alignment

Signal
78
Hype
15
En 3 lignesDes chercheurs montrent que l'alignement de sécurité des LLM est fragile car concentré sur les premiers tokens. Le mécanisme d'autoregressive consistency permet aux attaques d'insérer des séquences nuisibles à n'importe quelle position et de les prolonger. Ils proposent adversarial safety alignment avec random worst-insertion training pour briser cette cohérence.
Lire la source
Ton avis ?
Sécurité IAAlignementRaisonnementPapers

Résumé généré par Claude — vérifié par l'humain