POLARIS: Guiding Small Models to Write Long Stories
Signal
78
Hype
25
En 3 lignesPOLARIS est une méthode d'optimisation par renforcement (GRPO) pour améliorer la génération de textes longs par petits modèles. Appliquée à Qwen3.5-9B avec 1.4K paires prompt-histoire et 4 GPU A100, elle utilise un juge LLM frontier et l'injection de références humaines. POLARIS-9B rivalise avec des modèles 3× plus grands et généralise à des histoires 3× plus longues que l'entraînement.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain