Agentic Retrieval and Reinforcement Learned Equation Chains: A Controlled Generation Framework for Complex and Novel Physics Word Problems
Signal
72
Hype
25
En 3 lignesARVRE combine apprentissage par renforcement hors-ligne, RAG agentic et LLM pour générer des problèmes de physique complexes et solvables. La première étape construit des chaînes d'équations valides via temporal-difference learning ; la seconde convertit ces chaînes en questions naturelles. Évaluations humaines et automatiques montrent une supériorité en complexité, nouveauté et solvabilité.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain