Retour au feed
Reddit r/LocalLLaMA·

Building a CPU LLM engine in C99 - stuck at 1.90 tok/s on DeepSeek MoE while llama.cpp does 13.79. Potential root cause identified. Implementation is not.

Signal
72
Hype
15
En 3 lignesDéveloppeur construit un moteur d'inférence LLM en C99 pur. Sur DeepSeek-V2-Lite avec i5-11300H : 1.90 tok/s vs 13.79 pour llama.cpp (7.3x gap). Cause identifiée : dequantization Q4K en F32 à la charge (4 bytes/poids) vs lecture directe Q4K (0.5 bytes) chez llama.cpp. IPC : 0.80 vs 2.36. Solution requise : kernel Q4K matvec fusionné.
Lire la source
Ton avis ?
Génération de codeOpen sourceInfrastructureBenchmarks

Résumé généré par Claude — vérifié par l'humain