Retour au feed
arXiv cs.AI·

Rethinking Psychometric Evaluation of LLMs: When and Why Self-Reports Predict Behavior

Signal
75
Hype
15
En 3 lignesÉtude arXiv comparant l'autoévaluation (Big 5 vs Theory of Planned Behavior) avec le comportement réel de 11 LLMs frontier sur 4 tâches. TPB atteint la cohérence au niveau humain en conversation partagée, mais échoue entre conversations distinctes. Les cadres de personnalité larges prédisent mal le comportement réel.
Lire la source
Ton avis ?
ÉvaluationsSécurité IAAlignement

Résumé généré par Claude — vérifié par l'humain