Retour au feed
The Decoder·

Microsoft Research's Lens proves detailed captions matter more than raw scale for training efficient image generators

Signal
78
Hype
25
En 3 lignesMicrosoft Research présente Lens, un modèle texte-vers-image de 3,8 milliards de paramètres qui égale des rivaux bien plus grands sur les benchmarks, avec un coût d'entraînement réduit. La clé : 800 millions de captions détaillées générées par GPT-4.1 au lieu de textes alt vagues. Code et poids disponibles en open-source.
Lire la source
Ton avis ?
Génération d'imagesBenchmarksOpen sourcePapers

Résumé généré par Claude — vérifié par l'humain