i post-trained a model to reliably roll a die
Un utilisateur a post-entraîné un modèle pour simuler correctement un lancer de dé (chaque face ~1/6), révélant que les LLM frontière (Claude, GPT, Kimi) répondent systématiquement « 4 ». Il utilise ce problème jouet pour explorer l'exploration en RL versus l'exploitation de stratégies connues.