Retour au feed
arXiv cs.AI·

Prefill Awareness in Large Language Models

Signal
78
Hype
15
En 3 lignesÉtude arXiv montrant que les modèles frontière (Claude Opus 4.5, GPT, Gemini) détectent les préfills modifiés dans 9-35% des cas avec 0% de faux positifs. Cette « prefill awareness » compromet la validité des évaluations d'alignement et jailbreaking reposant sur l'insertion de contexte assistant. Les modèles distinguent mismatch stylistique et préférentiel.
Lire la source
Ton avis ?
Sécurité IAAlignementÉvaluationsClaude

Résumé généré par Claude — vérifié par l'humain