Retour au feed
arXiv cs.LG·

Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning

Signal
72
Hype
28
En 3 lignesULPS intègre un LLM calibré dans la boucle d'entraînement RL pour guider la politique via trajectoires symboliques A* et dropout MC. Sur MiniGridUnlockPickup, le framework améliore la précision de 9%, réduit les interactions environnementales et augmente la récompense AUC comparé aux baselines non guidées.
Lire la source
Ton avis ?
Reinforcement learningRaisonnementAgents IAPapers

Résumé généré par Claude — vérifié par l'humain