Retour au feed
Reddit r/LocalLLaMA·

Been watching real adversarial input hit my detection API for six months. Here's what's actually landing.

Signal
72
Hype
28
En 3 lignesAnalyse de 6 mois d'attaques réelles contre une API de détection d'injections de prompts (Bordair). Trois patterns dominent : configurations multi-tours invisibles isolément, exploitation du momentum conversationnel, et redéfinition de rôles exploitant l'utilité du modèle. Les classifieurs single-message échouent systématiquement. Défenses stateful recommandées.
Lire la source
Ton avis ?
Prompt engineeringSécurité IAAgents IAOutils

Résumé généré par Claude — vérifié par l'humain