Retour au feed
arXiv cs.LG·

Operator Fusion for LLM Inference on the Tensix Architecture

Signal
72
Hype
15
En 3 lignesÉtude d'optimisation d'inférence LLM sur l'architecture Tensix de Tenstorrent. Fusion d'opérateurs (RMSNorm + multiplication matricielle) réduit les accès DRAM et la latence : -37,44% attention, -15,89% MLP sur Qwen2.5-0.5B, Qwen3-0.6B/4B. Mécanisme multicast NoC pour parallélisme multi-cœur.
Lire la source
Ton avis ?
QwenInfrastructureBenchmarksGénération de code

Résumé généré par Claude — vérifié par l'humain