Two to Tango: Coupled Task-Reference Selection for Safe LLM Fine-tuning
Signal
78
Hype
15
En 3 lignesDualSelect, une méthode de fine-tuning pour LLMs, sélectionne conjointement des exemples de sécurité et des tâches compatibles pour préserver l'alignement de sécurité lors de l'adaptation. Testé sur des modèles 1B-8B, elle améliore Safety Avg. de 5.10 points minimum par rapport aux baselines tout en conservant l'utilité des tâches.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain