Retour au feed
arXiv cs.LG·

Online LLM Selection via Constrained Bandits with Time-Varying Demand

Signal
72
Hype
15
En 3 lignesAlgorithme d'apprentissage en ligne pour sélectionner dynamiquement le meilleur LLM dans des systèmes edge-cloud sous contraintes de budget (coût, latence). Formulation en bandit stochastique contraint avec demande variable. Garanties théoriques : regret sublinéaire et violations de contraintes sublinéaires.
Lire la source
Ton avis ?
Agents IAReinforcement learningBenchmarksInfrastructure

Résumé généré par Claude — vérifié par l'humain