Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO
Signal
72
Hype
18
En 3 lignesÉtude sur l'optimisation de modèles LLM pour le diagnostic cardiaque via GRPO et récompenses basées sur rubrique. Une approche Variance-Aware améliore Qwen3-14B de 0.362 à 0.502 en précision et 0.532 à 0.668 en F1 sur HealthBench, rivalisant avec GPT-OSS-120B.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain