Back to feed
arXiv cs.CL·

Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing

Signal
78
Hype
25
In three linesSTATEWITNESS, an activation explainer, detects deception in reasoning LLMs by reading the target model's hidden states and answering natural-language queries. Achieves 0.916 mean AUROC, 11.6% relative gain over best black-box text monitor, 25.0% over best activation-probe baseline. Provides token- and sentence-level evidence traces for human inspection.
Read source
Your take?
ReasoningAI safetyAlignmentEvals

Summary generated by Claude — human-verified