Retour au feed
Reddit r/MachineLearning·

Coherent Context Can Silently Shift LLMs Into a Different Internal Regime — And Current Safety Systems Are Blind To It [D]

Signal
72
Hype
45
En 3 lignesUn chercheur indépendant démontre que un contexte cohérent peut déplacer les LLMs vers un régime interne différent sans modifier la sortie finale, contournant les filtres de sécurité actuels (RLHF, classifieurs). Travaux sur Gemma-3-12B-IT avec analyse des états cachés et trajectoires du residual stream.
Lire la source
Ton avis ?
Sécurité IAAlignementÉvaluations

Résumé généré par Claude — vérifié par l'humain