Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces
Signal
72
Hype
18
In three linesOPT* is a family of optimization tasks for training step-by-step reasoning in LLMs over expanding search spaces. Authors propose two regimes: solver-guided online policy optimization (using value oracles) and search-based offline RL. Training on OPT* improves iterative optimization reasoning.Read source
Your take?
Summary generated by Claude — human-verified