Back to feed
arXiv cs.AI·

Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces

Signal
72
Hype
18
In three linesOPT* is a family of optimization tasks for training step-by-step reasoning in LLMs over expanding search spaces. Authors propose two regimes: solver-guided online policy optimization (using value oracles) and search-based offline RL. Training on OPT* improves iterative optimization reasoning.
Read source
Your take?
ReasoningReinforcement learningBenchmarks

Summary generated by Claude — human-verified