Microsoft Research's Lens proves detailed captions matter more than raw scale for training efficient image generators
Signal
78
Hype
25
En 3 lignesMicrosoft Research présente Lens, un modèle texte-vers-image de 3,8 milliards de paramètres qui égale des rivaux bien plus grands sur les benchmarks, avec un coût d'entraînement réduit. La clé : 800 millions de captions détaillées générées par GPT-4.1 au lieu de textes alt vagues. Code et poids disponibles en open-source.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain