Retour au feed
arXiv cs.AI·

GuardNet: Ensemble Strategies of Shallow Neural Networks for Robust Prompt Injection and Jailbreak Detection

Signal
72
Hype
25
En 3 lignesGuardNet est un système de garde-fou basé sur un ensemble de réseaux de neurones peu profonds (BiLSTMs, 47M paramètres) pour détecter les attaques par injection de prompt et jailbreak sur LLMs. L'approche privilégie la diversité des exemples et le calibrage des seuils plutôt que la taille du modèle. Performance : AUROC 0.747 sur dataset aveugle (n=200), F1 0.92 sur benchmark propriétaire, latence ~50ms CPU.
Lire la source
Ton avis ?
Sécurité IABenchmarksLlamaMistral

Résumé généré par Claude — vérifié par l'humain