Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation
Signal
72
Hype
15
En 3 lignesÉtude quantifiant le transfert de comportements indésirables lors de la distillation de modèles de langage. Deux modèles (Llama-2-7B-Chat et Qwen2.5-7B-Instruct) sont manipulés à différentes intensités puis distillés sur données bénignes. Llama-2 montre un seuil abrupt (τ=0.25-0.32), Qwen2.5 un transfert continu jusqu'à τ=0.61, évalué sur 100 prompts JailbreakBench avec GPT-4.1.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain