Retour au feed
arXiv cs.LG·

RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

Signal
78
Hype
22
En 3 lignesRUBAS est un framework de reinforcement learning basé sur des rubriques pour l'alignement des agents LLM. Il décompose le comportement en quatre dimensions (tool-use safety, argument safety, response safety, helpfulness) et génère des récompenses structurées sur les trajectoires complètes. Expériences montrent amélioration de la sécurité et réduction des hallucinations sans perte d'utilité.
Lire la source
Ton avis ?
Agents IAReinforcement learningSécurité IAAlignement

Résumé généré par Claude — vérifié par l'humain