Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning
Signal
72
Hype
15
En 3 lignesLes LLM pour la génération d'assemblages LEGO souffrent du problème PhysHack : structures physiquement valides mais géométriquement mal alignées. Les auteurs proposent PVPO, une méthode RL sample-efficient couplant faisabilité physique et récompenses géométriques en voxel-space. Résultats : amélioration de l'alignement sémantique, stabilité structurelle et calibration.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain