Retour au feed
arXiv cs.CL·

Lost in a Single Vector: Improving Long-Document Retrieval with Chunk Evidence Aggregation

Signal
78
Hype
15
En 3 lignesDICE améliore la récupération de documents longs en fragmentant le texte, encodant chaque chunk indépendamment, puis agrégant les vecteurs en une seule représentation. Sur LongEmbed, les gains atteignent 90.0 pour Dream Passkey >4k (vs 30.0) et 74.0 pour Needle >4k (vs 23.3). L'approche réduit l'indice de dilution d'évidence (EDI) dans 92.8% des cas.
Lire la source
Ton avis ?
RAGEmbeddingsRecherche vectorielleBenchmarks

Résumé généré par Claude — vérifié par l'humain