Seeing Before Colliding: Anticipatory Safe RL with Frozen Vision-Language Models
Signal
72
Hype
28
In three linesVLM-Safe-RL integrates a frozen vision-language model into constrained-RL optimization to anticipate collisions before they occur. On Safety-Gymnasium FormulaOne L2, VLMPPOLag+Conf maintains cost within budget (d_lim=25) while retaining substantial return (Jr≈40), outperforming PPOLag, CPO, CPPOPID, and CPO-CLG. Partial generalization to MetaDrive (41%→26% catastrophe rate).Read source
Your take?
Summary generated by Claude — human-verified