BeeLlama v0.3.1 – latest llama.cpp with extras! DFlash, MTP, q6_0 cache, TurboQuant. Single RTX 3090: Qwen 3.6 27B & Gemma 4 31B up to 177.8 tps (4.93x over baseline)
Signal
72
Hype
35
En 3 lignesBeeLlama v0.3.1 met à jour llama.cpp avec MTP, support Gemma 4 12B, DFlash multi-GPU et nouvelles options de cache (q6_0, TQ3_1S, TQ4_1S). Sur RTX 3090, Qwen 3.6 27B atteint 177.8 tps (4.93x baseline), Gemma 4 31B aussi optimisé. Binaires précompilés et images Docker fournis.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain