Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing
Signal
78
Hype
25
In three linesSTATEWITNESS, an activation explainer, detects deception in reasoning LLMs by reading the target model's hidden states and answering natural-language queries. Achieves 0.916 mean AUROC, 11.6% relative gain over best black-box text monitor, 25.0% over best activation-probe baseline. Provides token- and sentence-level evidence traces for human inspection.Read source
Your take?
Summary generated by Claude — human-verified