Luce Spark: a 35B MoE on a 16 GB GPU, without the offload tax
Signal
78
Hype
25
En 3 lignesLuce Spark exécute des modèles MoE 33-35B sur GPU 16 GB sans ralentissement. Qwen 35B-A3B : 13,3 GiB (vs 20,5), Laguna XS.2 33B-A3B : 14,6 GiB (vs 18,8). Seuls les experts actifs (~8/256) restent en VRAM ; les autres en RAM système avec swap intelligent. Calibrage auto via profil d'apprentissage. Open-source Apache 2.0.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain