Lost in a Single Vector: Improving Long-Document Retrieval with Chunk Evidence Aggregation
Signal
78
Hype
15
En 3 lignesDICE améliore la récupération de documents longs en fragmentant le texte, encodant chaque chunk indépendamment, puis agrégant les vecteurs en une seule représentation. Sur LongEmbed, les gains atteignent 90.0 pour Dream Passkey >4k (vs 30.0) et 74.0 pour Needle >4k (vs 23.3). L'approche réduit l'indice de dilution d'évidence (EDI) dans 92.8% des cas.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain