Topic

#Embeddings

Les embeddings sont des représentations numériques (vecteurs) de données textuelles, visuelles ou audio, capturant leur sens sémantique. Par exemple, le modèle text-embedding-3-small d'OpenAI convertit des phrases en vecteurs pour la recherche ou la similarité.

40Articles
7Sources
69Signal moyen
arXiv cs.CL·

Morpheus: A Morphology-Aware Neural Tokenizer and Word Embedder for Turkish

Morpheus est un tokeniseur neural morphologie-aware pour le turc agglutinant. Le modèle utilise une programmation dynamique Poisson-binomial différentiable pour segmenter les morphèmes avec une compression de 1.425 bits/caractère et un alignement morphologique MorphScore F1 de 0.61 (vs ~0.32 pour les tokeniseurs subword). Lossless par construction : decode(encode(w)) = w.

EmbeddingsPapersOpen source
SIG
82
HYP
00
arXiv cs.CL·

CoreMem: Riemannian Retrieval and Fisher-Guided Distillation for Long-Term Memory in Dialogue Agents

CoreMem propose une architecture mémoire pour agents dialogues personnalisés sur appareils edge (8 GB VRAM). Utilise la métrique Fisher-Rao pour la récupération (remplaçant la similarité cosinus) et la distillation de tokens guidée par Fisher pour la compression. Gains de +4.51 pp en raisonnement open-domain et +4.17 pp en raisonnement temporel sur LOCOMO et LongMemEval-S.

Agents IARAGEmbeddings
SIG
78
HYP
00
arXiv cs.CL·

Lost in a Single Vector: Improving Long-Document Retrieval with Chunk Evidence Aggregation

DICE améliore la récupération de documents longs en fragmentant le texte, encodant chaque chunk indépendamment, puis agrégant les vecteurs en une seule représentation. Sur LongEmbed, les gains atteignent 90.0 pour Dream Passkey >4k (vs 30.0) et 74.0 pour Needle >4k (vs 23.3). L'approche réduit l'indice de dilution d'évidence (EDI) dans 92.8% des cas.

RAGEmbeddingsRecherche vectorielle
SIG
78
HYP
00
arXiv cs.CL·

MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level Retrieval

MCompassRAG améliore les systèmes RAG en utilisant des métadonnées de sujets comme guide sémantique pour la récupération de paragraphes. La méthode enrichit les représentations de chunks avec des signaux au niveau des sujets dans le même espace d'embedding et entraîne un retrieveur léger par distillation LLM. Sur six benchmarks, elle gagne 8,24% en efficacité informationnelle avec 5× moins de latence.

RAGEmbeddingsBenchmarks
SIG
78
HYP
00
arXiv cs.AI·

Fusion is not one-size-fits-all: Cross-Modal Representation Alignment for Time-to-Event Modeling

Framework de fusion multimodale pour prédire le temps jusqu'à un événement clinique (mortalité PE, résultats CVD) en alignant représentations CT et données EHR longitudinales via modèles fondation. Quatre stratégies testées (late fusion, contrastive alignment, cross-attention, co-attention) sur 3,099-2,951 patients. Fusion contrastive améliore l'indice de concordance de 1,5-5,4% vs unimodal.

BenchmarksEmbeddingsVision
SIG
72
HYP
00
arXiv cs.AI·

Hierarchical Modeling of ICD Codes in EHR Foundation Models

Étude sur l'intégration de la hiérarchie ICD-10-CM dans les modèles de fondation EHR. Les auteurs comparent deux approches : augmentation de séquences BERT avec tokens hiérarchiques et injection de hiérarchie dans des représentations graphiques. Expériences sur MIMIC-IV et eICU montrent que l'encodage explicite de la hiérarchie améliore les prédictions en domaine et en transfert cross-dataset.

PapersEmbeddingsRAG
SIG
72
HYP
00
arXiv cs.CL·

Transfer Learning for FHIR Questionnaire Terminology Binding

Étude de retrieval pour lier automatiquement des codes LOINC à des questionnaires FHIR en santé. Six méthodes testées (TF-IDF, MiniLM, BioBERT, BioLORD, fine-tuning contrastif, GPT reranker) sur 97 314 codes. BioLORD (encodeur pré-entraîné sur ontologies biomédicales) atteint R@1=0.185 sans données spécifiques ; fine-tuning contrastif obtient R@5=0.389. Augmentation GPT dégrade les performances.

EmbeddingsFine-tuningRAG
SIG
62
HYP
00
arXiv cs.CL·

Fusing Stylometric and Embedding Systems to Estimate Authorship Likelihood Ratios in Japanese

Première application du cadre de rapport de vraisemblance (likelihood ratio) à l'attribution d'auteur en japonais. Fusion de systèmes stylométriques et d'embeddings de modèles de langage pré-entraînés sur ~1000 caractères de blogs. Le système fusionné améliore la discrimination (log-likelihood-ratio cost: 0.32484) tout en maintenant une bonne calibration.

EmbeddingsBenchmarksPapers
SIG
72
HYP
00
arXiv cs.LG·

Bernstein-Schur Kernels: Random Features by Sketched Modulation and Radial Randomization

Kernels de Bernstein-Schur : construction de random features combinant sketching de modulation finie et randomisation radiale via échelle de Bernstein-Widder. Dimension de features Dm sans coût O(d²) de la modulation exacte. Garanties de variance exacte et bornes d'opérateur contrôlées par dimension intrinsèque, avec applications au kernel ridge regression.

PapersBenchmarksEmbeddings
SIG
72
HYP
00
arXiv cs.LG·

Bernstein-Schur Kernels: Random Features by Sketched Modulation and Radial Randomization

Kernels de Bernstein-Schur : construction de random features combinant sketching de modulation finie et randomisation de facteurs radiaux complètement monotones. Dimension des features = Dm (sketch size m × radial draws D), sans dépendance O(d²). Garanties : non-biais, bornes operator-norm contrôlées par dimensions intrinsèques, stabilité spectrale pour kernel ridge regression.

PapersBenchmarksEmbeddings
SIG
72
HYP
00
arXiv cs.AI·

A Unified Multi-Modal Framework for Intelligent Financial Systems: Integrating Reinforcement Learning, High-Frequency Trading, and Game-Theoretic Approaches with Cross-Modal Sentiment Analysis

Framework unifié intégrant PPO, prédiction time-series, in-context learning, théorie des jeux et analyse de sentiment cross-modal pour systèmes financiers. Résultats : +23.7% optimisation portefeuille, -31.2% erreur trading haute fréquence, +18.9% recommandations, +27.4% convergence Nash, +15.6% sentiment analysis.

Reinforcement learningBenchmarksRaisonnement
SIG
45
HYP
00
Reddit r/LocalLLaMA·

Semantic distance as routing layer: an on-device, serverless alternative to the central-index model

Prototype décentralisé utilisant des embeddings locaux (EmbeddingGemma-300M) pour remplacer les index centralisés. Les appareils communiquent en peer-to-peer, classent les contenus par distance sémantique (cosine similarity) sans serveur ni ranking global. Extension proposée aux agents IA découvrant mutuellement leurs besoins/offres par proximité sémantique.

EmbeddingsAgents IAOpen source
SIG
45
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> chroma-core /</span> chroma

Chroma est une infrastructure de recherche vectorielle pour applications IA. Le projet GitHub trending propose des outils de stockage et requête de vecteurs d'embeddings pour RAG et systèmes basés sur des modèles de langage.

Recherche vectorielleEmbeddingsRAG
SIG
65
HYP
00
Reddit r/MachineLearning·

Why I stopped using semantic embeddings for tool selection and switched back to BM25 [D]

Un développeur d'agents a abandonné les embeddings sémantiques pour la sélection d'outils au profit de BM25. Avec 140 outils MCP en production, la similarité cosinus sur descriptions courtes (<50 tokens) échouait (64% accuracy) : les discriminants clés (noms spécifiques) se diluaient dans l'espace embedding. BM25 sur projection texte plate atteint 81% top-1.

Agents IAMCPRAG
SIG
75
HYP
00
Reddit r/LocalLLaMA·

Used local Ollama (gemma4:e4b + nomic-embed-text) to bulk-generate AI summaries for 4300 arXiv papers and push them to a remote Cloudflare DB — pipeline walkthrough

Développeur a construit ArxivExplorer, moteur de recherche sémantique arXiv avec résumés générés par IA. Pipeline local utilise Ollama : gemma4:e4b (8B) pour résumés structurés JSON, nomic-embed-text (137M) pour embeddings 768-dim. 4300 papiers traités, taux succès ~95%, stockage via Cloudflare D1/Vectorize. REST API 100× plus rapide que wrangler.

RAGEmbeddingsOpen source
SIG
75
HYP
00
arXiv cs.AI·

Trading Engagement for Sustainability: Carbon-Aware Re-ranking for E-commerce Recommendations

Étude sur les systèmes de recommandation e-commerce intégrant l'empreinte carbone des produits. Les chercheurs estiment les PCF manquantes via recherche sémantique et prompting LLM, puis appliquent un re-ranking post-hoc sur BPR, NeuMF et LightGCN. Sur Amazon Reviews (3 catégories), des réductions carbone substantielles sont possibles avec coût d'engagement minimal.

RAGEmbeddings
SIG
72
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> RyanCodrai /</span> turbovec

TurboVec est un index vectoriel construit sur TurboQuant, écrit en Rust avec liaisons Python. Optimisé pour les recherches vectorielles haute performance.

Recherche vectorielleEmbeddingsOpen source
SIG
45
HYP
00
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> RyanCodrai /</span> turbovec

TurboVec est un index vectoriel construit sur TurboQuant, écrit en Rust avec liaisons Python. Optimisé pour la recherche vectorielle haute performance.

Recherche vectorielleEmbeddingsOpen source
SIG
45
HYP
00
arXiv cs.CL·

Predict and Reconstruct: Joint Objectives for Self-Supervised Language Representation Learning

Nouvelle approche de pré-entraînement combinant MLM (Masked Language Modeling) et JEPA (Joint Embedding Predictive Architecture) pour les encodeurs texte. Modèle hybride entraîné sur Wikipedia anglais avec budget identique. Résultats : embeddings plus uniformes (-0.16 vs -0.05), géométrie spectrale riche, meilleur équilibre sémantique-lexical sur benchmarks GLUE.

PapersFine-tuningEmbeddings
SIG
72
HYP
00
arXiv cs.LG·

Training-Free Lexical-Dense Fusion for Conversational-Memory Retrieval

Étude de fusion lexicale-dense sans entraînement pour la récupération en mémoire conversationnelle longue. Fusion score-level de late-interaction dense + BM25 améliore Hit@1 de +8.8 à +17.2 points sur six encodeurs (Hit@1 0.752 avec e5-large-v2). Reranker cross-encoder web dégrade les résultats (-6.9 pp). Analyse montre division du travail : dense excelle sur questions multi-hop/temporelles, BM25 sur adversariales.

RAGEmbeddingsBenchmarks
SIG
78
HYP
00