Retour au feed
arXiv cs.AI·

Self-Commitment Latency: A Reward-Free Probe for Prompted Implicit Hacking

Signal
72
Hype
15
En 3 lignesNouvelle méthode pour détecter le « reward hacking » implicite dans les LLM sans modèle de récompense. La métrique « self-commitment latency » mesure à quel point tôt un contexte de raisonnement s'engage vers la réponse finale du modèle. Test sur Qwen2.5-3B avec GSM8K : AUROC 0.878 pour détecter les contextes avec raccourcis de prompt.
Lire la source
Ton avis ?
RaisonnementSécurité IAAlignementÉvaluations

Résumé généré par Claude — vérifié par l'humain