Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models
Signal
78
Hype
15
En 3 lignesCadre d'évaluation de la robustesse adversariale des LLM basé sur le coût computationnel (FLOPs) plutôt que sur le nombre de requêtes. Étude de 10 modèles avec 3 stratégies d'attaque révèle : l'alignement a des effets non-monotones, la taille réduit les attaques par gradient mais pas les attaques par template, transfert possible entre modèles, variation de coût jusqu'à 5× selon les catégories de dommages.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain