Retour au feed
arXiv cs.LG·

Repetition Mismatch: Why Data Mixture Experiments Don't Scale and How to Fix Them

Signal
78
Hype
15
En 3 lignesLes expériences de mélange de données pré-entraînement échouent souvent lors du passage à l'échelle car le taux de répétition des données de haute qualité change avec le budget de tokens. Une procédure de sous-échantillonnage contrôlant la répétition permet de récupérer le mélange optimal avec 1/16 des tokens cibles (757M paramètres), réduisant l'erreur de 0.75 à 0.05.
Lire la source
Ton avis ?
BenchmarksPapers

Résumé généré par Claude — vérifié par l'humain