Retour au feed
Reddit r/LocalLLaMA·

Here are some tips on hitting nearly 200 tok/s for DeepSeek v4 Flash on Hopper

Signal
65
Hype
25
En 3 lignesOptimisation de DeepSeek v4 Flash sur GPU Hopper : atteinte de 193 tok/s via quantification Canada-Quant et patch vLLM. L'auteur documente les gains de performance pour réduire les coûts d'inférence locale face aux tarifs API ($0.1966/M tokens).
Lire la source
Ton avis ?
DeepSeekGénération de codeAgents IAInfrastructureOpen source

Résumé généré par Claude — vérifié par l'humain