Retour au feed
Reddit r/LocalLLaMA·

Remove padding and multiple D2D copies for MTP by gaugarg-nv · Pull Request #24086 · ggml-org/llama.cpp

Signal
65
Hype
15
En 3 lignesPull request sur llama.cpp optimisant MTP (Multi-Token Prediction) en supprimant le padding et les copies D2D redondantes. Amélioration de performance pour l'inférence multi-token.
Lire la source
Ton avis ?
Open sourceGénération de codeInfrastructure

Résumé généré par Claude — vérifié par l'humain