Retour au feed
arXiv cs.LG·

Two to Tango: Coupled Task-Reference Selection for Safe LLM Fine-tuning

Signal
78
Hype
15
En 3 lignesDualSelect, une méthode de fine-tuning pour LLMs, sélectionne conjointement des exemples de sécurité et des tâches compatibles pour préserver l'alignement de sécurité lors de l'adaptation. Testé sur des modèles 1B-8B, elle améliore Safety Avg. de 5.10 points minimum par rapport aux baselines tout en conservant l'utilité des tâches.
Lire la source
Ton avis ?
Fine-tuningSécurité IAAlignement

Résumé généré par Claude — vérifié par l'humain