Spokes: Optimizing for Diverse Pretraining Data Selection
Signal
78
Hype
15
En 3 lignesSPOKES optimise la sélection de données de préentraînement via un cadre probabiliste basé sur le score G-Vendi et la descente de gradient exponentiée. Sur FineWeb et DCLM, la méthode améliore les performances en aval de +1.5 et +1.4 points en optimisant conjointement qualité et diversité, surpassant la déduplication sémantique.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain