Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing
Signal
78
Hype
25
En 3 lignesSTATEWITNESS, un expliciteur d'activations, détecte la tromperie dans les LLMs de raisonnement en lisant les états cachés du modèle cible et répondant à des requêtes en langage naturel. Atteint 0.916 AUROC, +11.6% vs meilleur moniteur texte black-box, +25.0% vs baseline probe. Fournit traces d'évidence au niveau token/phrase pour inspection humaine.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain