Seeing Before Colliding: Anticipatory Safe RL with Frozen Vision-Language Models
Signal
72
Hype
28
En 3 lignesVLM-Safe-RL intègre un modèle vision-langage gelé dans l'optimisation constrained-RL pour anticiper les collisions avant qu'elles ne surviennent. Sur Safety-Gymnasium FormulaOne L2, VLMPPOLag+Conf maintient le coût dans le budget (d_lim=25) tout en conservant un rendement substantiel (Jr≈40), surpassant PPOLag, CPO, CPPOPID et CPO-CLG. Généralisation partielle à MetaDrive (41%→26% de catastrophes).Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain