Retour au feed
arXiv cs.CL·

Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training

Signal
78
Hype
15
En 3 lignesÉtude arXiv montrant que les hyperparamètres optimaux du continued pre-training suivent des lois d'échelle prévisibles. Framework en deux étapes : découverte empirique via modèles proxy, puis prédiction state-aware basée sur la perte de validation. Réduit la recherche d'hyperparamètres de 90% tout en maintenant les performances.
Lire la source
Ton avis ?
BenchmarksFine-tuningPapers

Résumé généré par Claude — vérifié par l'humain