Retour au feed
arXiv cs.LG·

Enabling KV Caching of Shared Prefix for Diffusion Language Models

Signal
78
Hype
15
En 3 lignesLes modèles de diffusion de langage (DLMs) utilisent l'attention bidirectionnelle, ce qui invalide les techniques de cache KV classiques pour les préfixes partagés. Les chercheurs proposent bicache, une méthode qui identifie dynamiquement la profondeur de couche sûre pour réutiliser les KVs des préfixes partagés. Résultat : 36–98% d'amélioration du débit sans effondrement d'accuracy.
Lire la source
Ton avis ?
RaisonnementBenchmarksInfrastructure

Résumé généré par Claude — vérifié par l'humain