Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws
Signal
78
Hype
15
En 3 lignesÉtude des lois d'échelle pour le préentraînement de modèles de langage en régime limité en données. Les auteurs proposent MIR (masked-input regularization), une perte auxiliaire de prédiction du token suivant sur entrées masquées aléatoirement, et SoftQ, une loi d'échelle couplant taille du modèle et données répétées. MIR améliore la validation loss sur modèles 72M-1.4B et équivaut à 1.3× plus de données uniques.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain