Policy Regret for Embedding Model Routing: Contextual Bandits with Low-Rank Experts
Signal
72
Hype
15
En 3 lignesArticle théorique sur le routage dynamique de requêtes vers plusieurs modèles d'embedding. Formalise le problème comme un bandit contextuel linéaire adversarial avec experts low-rank. Propose l'algorithme Hypentropy Policy Gradient (HPG) avec regret Õ(s√MT) sans malédiction de dimensionnalité.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain