Retour au feed
arXiv cs.CL·

Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

Signal
78
Hype
15
En 3 lignesMéthode de post-training par reinforcement learning (GRPO) pour améliorer la détection de mèmes haineux et propagandistes dans les MLLMs. Amélioration de +2.1% sur Hateful Memes (79.9%→82.0%) et +7.6 points macro-F1 sur ArMeme (0.536→0.612) avec explications en chaîne de pensée. Code et données publiquement disponibles.
Lire la source
Ton avis ?
Reinforcement learningRaisonnementVisionÉvaluationsSécurité IA

Résumé généré par Claude — vérifié par l'humain