Retour au feed
arXiv cs.CL·

Scenario-based Probing and Steering Cultural Values in Large Language Models--Extended Version

Signal
72
Hype
18
En 3 lignesÉtude arXiv sur le sondage des valeurs culturelles dans les LLM via des dilemmes comportementaux basés sur le World Values Survey. Les auteurs appliquent steering d'activation sur trois modèles open-source pour mesurer et modifier les préférences implicites selon deux axes Inglehart-Welzel, révélant un enchevêtrement latent où les interventions sur une dimension culturelle affectent une autre.
Lire la source
Ton avis ?
PapersAlignementÉvaluationsSécurité IA

Résumé généré par Claude — vérifié par l'humain