Retour au feed
arXiv cs.AI·

Closing the Reflection Gap: A Free Calibration Bonus for Agentic RL

Signal
78
Hype
25
En 3 lignesRefGRPO ferme l'écart de réflexion chez les agents LLM : ces derniers mal-évaluent leurs outputs après feedback environnemental. La méthode ajoute un bonus de calibration gratuit (contraste réflexion/résultat réel) aux algorithmes RL standards. Sur text-to-SQL : taux de sous-confiance 44.4%→7.7%, précision 75.1%→76.5%.
Lire la source
Ton avis ?
Agents IAReinforcement learningRaisonnementÉvaluations

Résumé généré par Claude — vérifié par l'humain