Retour au feed
Reddit r/LocalLLaMA·

Running Qwen3.6-35B-A3B on a laptop RTX 4060 (8GB) — what worked, what didn't, and a surprising speculative-decoding result

Signal
72
Hype
15
En 3 lignesUtilisateur optimise Qwen3.6-35B-A3B (MoE 35B/3B actifs) sur RTX 4060 8GB. Configuration finale : --no-mmap critique (11→43 tok/s), ≥1.5GB VRAM libre obligatoire, CPU bottleneck dominant. Speculative decoding +26% (contradictoire vs benchmarks communautaires). Architecture hybride (10 couches attention + 40 GDN) explique résultats contre-intuitifs.
Lire la source
Ton avis ?
QwenGénération de codeFine-tuning

Résumé généré par Claude — vérifié par l'humain