Retour au feed
Reddit r/LocalLLaMA·

Step-3.7-Flash on AMD: ROCm corrupts long context past ~94k, and thinking needs a hard token budget

Signal
72
Hype
15
En 3 lignesStep-3.7-Flash sur AMD/ROCm corrompt le contexte long au-delà de ~94k tokens. Le mode reasoning est actif par défaut et consomme 2000+ tokens sans budget défini, causant des réponses vides. Solution : limiter le contexte à 90k, fixer thinking_budget_tokens à 256 via llama.cpp, ignorer enable_thinking:false et reasoning_effort.
Lire la source
Ton avis ?
RaisonnementOpen sourceInfrastructure

Résumé généré par Claude — vérifié par l'humain