StarOR: Synergizing Tree Search and Test-Time Reinforcement Learning for Optimization Modeling
Signal
75
Hype
25
En 3 lignesStarOR couple la recherche arborescente (MCTS) avec l'apprentissage par renforcement au moment de l'inférence pour la modélisation d'optimisation. Le système décompose le processus en quatre étapes, affine un adaptateur LoRA via GRPO à chaque nœud, et utilise un système de récompense multi-facettes sans labels. Résultats SOTA sur cinq benchmarks avec backbone 4B.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain