Retour au feed
arXiv cs.LG·

Policy Regret for Embedding Model Routing: Contextual Bandits with Low-Rank Experts

Signal
72
Hype
15
En 3 lignesArticle théorique sur le routage dynamique de requêtes vers plusieurs modèles d'embedding. Formalise le problème comme un bandit contextuel linéaire adversarial avec experts low-rank. Propose l'algorithme Hypentropy Policy Gradient (HPG) avec regret Õ(s√MT) sans malédiction de dimensionnalité.
Lire la source
Ton avis ?
BenchmarksRaisonnementReinforcement learning

Résumé généré par Claude — vérifié par l'humain