Retour au feed
arXiv cs.CL·

POLARIS: Guiding Small Models to Write Long Stories

Signal
78
Hype
25
En 3 lignesPOLARIS est une méthode d'optimisation par renforcement (GRPO) pour améliorer la génération de textes longs par petits modèles. Appliquée à Qwen3.5-9B avec 1.4K paires prompt-histoire et 4 GPU A100, elle utilise un juge LLM frontier et l'injection de références humaines. POLARIS-9B rivalise avec des modèles 3× plus grands et généralise à des histoires 3× plus longues que l'entraînement.
Lire la source
Ton avis ?
QwenReinforcement learningFine-tuningGénération de codeÉvaluations

Résumé généré par Claude — vérifié par l'humain