Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning
Signal
72
Hype
28
En 3 lignesULPS intègre un LLM calibré dans la boucle d'entraînement RL pour guider la politique via trajectoires symboliques A* et dropout MC. Sur MiniGridUnlockPickup, le framework améliore la précision de 9%, réduit les interactions environnementales et augmente la récompense AUC comparé aux baselines non guidées.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain