From Architecture to Output: Structural Origins of Hallucination in Large Language Models and the Amplifying Role of Data
Signal
72
Hype
15
En 3 lignesÉtude arXiv analysant les hallucinations LLM comme conséquence structurelle de trois décisions architecturales : l'auto-attention confond entités via apprentissage de co-occurrence, l'objectif MLE optimise probabilité sans contrainte factuelle, le décodage autorégressif cascade les erreurs sans révision. Les pathologies de données amplifient mais ne causent pas indépendamment ces défaillances.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain