Online LLM Selection via Constrained Bandits with Time-Varying Demand
Signal
72
Hype
15
En 3 lignesAlgorithme d'apprentissage en ligne pour sélectionner dynamiquement le meilleur LLM dans des systèmes edge-cloud sous contraintes de budget (coût, latence). Formulation en bandit stochastique contraint avec demande variable. Garanties théoriques : regret sublinéaire et violations de contraintes sublinéaires.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain