Beyond Perplexity: UTF-8 Validity in Byte-aware Language Models
Signal
75
Hype
15
En 3 lignesÉtude sur la fiabilité UTF-8 dans les modèles byte-level (355M params, 80B tokens multilingues). La validité UTF-8 converge 2× plus lentement que la perplexité (4.2B vs 2.1B tokens). Les caractères rares génèrent du UTF-8 plus valide que les caractères fréquents, révélant une sur-spécialisation.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain