Retour au feed
arXiv cs.AI·

Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces

Signal
72
Hype
18
En 3 lignesOPT* est une famille de tâches d'optimisation pour entraîner le raisonnement pas-à-pas des LLM sur des espaces de recherche croissants. Les auteurs proposent deux régimes : optimisation en ligne guidée par solveur (utilisant un oracle de valeur) et RL hors ligne basé sur la recherche. L'entraînement améliore le raisonnement d'optimisation itérative.
Lire la source
Ton avis ?
RaisonnementReinforcement learningBenchmarks

Résumé généré par Claude — vérifié par l'humain