Retour au feed
arXiv cs.CL·

Spokes: Optimizing for Diverse Pretraining Data Selection

Signal
78
Hype
15
En 3 lignesSPOKES optimise la sélection de données de préentraînement via un cadre probabiliste basé sur le score G-Vendi et la descente de gradient exponentiée. Sur FineWeb et DCLM, la méthode améliore les performances en aval de +1.5 et +1.4 points en optimisant conjointement qualité et diversité, surpassant la déduplication sémantique.
Lire la source
Ton avis ?
BenchmarksPapersFine-tuning

Résumé généré par Claude — vérifié par l'humain