Retour au feed
arXiv cs.AI·

Zero-Shot Embedding Drift Detection: A Lightweight Defense Against Prompt Injections in LLMs

Signal
78
Hype
25
En 3 lignesZEDD (Zero-Shot Embedding Drift Detection) détecte les injections de prompts en mesurant les décalages sémantiques dans l'espace d'embedding entre entrées bénignes et suspectes. Sans accès aux internals du modèle ni réentraînement, la méthode atteint >93% de précision sur Llama 3, Qwen 2, Mistral avec <3% de faux positifs.
Lire la source
Ton avis ?
Sécurité IAEmbeddingsPrompt engineeringBenchmarks

Résumé généré par Claude — vérifié par l'humain