Retour au feed
arXiv cs.CL·

When to Think Deeply: Inhibitory Deliberation for LLM Reasoning

Signal
72
Hype
18
En 3 lignesIDPR est un framework qui décide dynamiquement quand invoquer le raisonnement lent dans les LLM. Un contrôleur d'inhibition analyse la réponse rapide (confiance, marge logit, coût) et supprime ou valide avant slow reasoning. Sur 5000 exemples math, IDPR utilise slow reasoning sur 8.20% des cas et améliore la précision de 47.90% à 48.92%.
Lire la source
Ton avis ?
RaisonnementÉvaluationsReinforcement learning

Résumé généré par Claude — vérifié par l'humain