Retour au feed
arXiv cs.LG·

Efficient On-Device Diffusion LLM Inference with Mobile NPU

Signal
78
Hype
15
En 3 lignesllada.cpp est le premier framework d'inférence optimisé pour les NPU mobiles accélérant les diffusion LLMs sur smartphones. Trois techniques réduisent la latence : Multi-Block Speculative Decoding, Dual-Path Progressive Revision, et Swap-Optimized Memory Runtime. Sur LLaDA-8B, gains de 17x-42x vs CPU baseline.
Lire la source
Ton avis ?
LlamaGénération de codeInfrastructureBenchmarks

Résumé généré par Claude — vérifié par l'humain