Retour au feed
arXiv cs.CL·

Localizing Prompt Ambiguity in Large Language Models with Probe-Targeted Attribution

Signal
78
Hype
15
En 3 lignesPRIG, une méthode d'attribution par gradient, localise l'ambiguïté dans les prompts LLM en entraînant une sonde linéaire à distinguer les prompts clairs des ambigus, puis attribue le score de la sonde aux représentations de tokens. Évalué sur des datasets synthétiques (codage, math, écriture) et un benchmark humain, PRIG atteint 0.840 AUROC sur le benchmark synthétique combiné et 0.891 AUROC sur l'ensemble gold.
Lire la source
Ton avis ?
Prompt engineeringÉvaluationsPapers

Résumé généré par Claude — vérifié par l'humain