RUBAS: Rubric-Based Reinforcement Learning for Agent Safety
Signal
78
Hype
22
En 3 lignesRUBAS est un framework de reinforcement learning basé sur des rubriques pour l'alignement des agents LLM. Il décompose le comportement en quatre dimensions (tool-use safety, argument safety, response safety, helpfulness) et génère des récompenses structurées sur les trajectoires complètes. Expériences montrent amélioration de la sécurité et réduction des hallucinations sans perte d'utilité.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain