Retour au feed
arXiv cs.LG·

TALAN: Task-Aligned Latent Adaptation Networks for Targeted Post-Training of Large Language Models

Signal
78
Hype
15
En 3 lignesTALAN (Task-Aligned Latent Adaptation Networks) combine un adaptateur low-rank avec un chemin latent conditionné par la séquence inséré dans le flux résiduel du transformer. Testé sur quatre backbones Qwen3 et quatre benchmarks STEM/code, TALAN améliore les baselines LoRA (+1.41 points) et DoRA (+1.85 points) avec <1% de paramètres supplémentaires et 1.01-1.02x de surcharge inférence.
Lire la source
Ton avis ?
Fine-tuningRaisonnementGénération de codePapers

Résumé généré par Claude — vérifié par l'humain