Multi-Turn Reasoning When Context Arrives in Pieces: Scalable Sharding and Memory-Augmented RL
Signal
78
Hype
15
En 3 lignesLes LLM perdent jusqu'à 65% de précision quand l'information critique arrive par étapes conversationnelles. Une mémoire compacte roulante remplace l'attention croissante à l'historique. Un pipeline de sharding convertit les datasets QA en épisodes multi-tours fragmentés sans annotation manuelle. Entraînement sur GSM8K shardé améliore la précision multi-tours et généralise zéro-shot.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain