When to Think Deeply: Inhibitory Deliberation for LLM Reasoning
Signal
72
Hype
18
En 3 lignesIDPR est un framework qui décide dynamiquement quand invoquer le raisonnement lent dans les LLM. Un contrôleur d'inhibition analyse la réponse rapide (confiance, marge logit, coût) et supprime ou valide avant slow reasoning. Sur 5000 exemples math, IDPR utilise slow reasoning sur 8.20% des cas et améliore la précision de 47.90% à 48.92%.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain