Page 48 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

SLASH the Sink: Sharpening Structural Attention Inside LLMs

Les LLMs reconstruisent spontanément la topologie des graphes via des patterns d'attention « sawtooth », mais cette compréhension structurelle est diluée par l'attention sink. SLASH, une solution sans entraînement, réamplifie cette compréhension via une redistribution d'attention plug-and-play, montrant des gains significatifs sur tâches graphiques et prédiction moléculaire.

RaisonnementPapersBenchmarks
SIG
75
HYP
25
arXiv cs.AI·

ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion

ECHO est un modèle de diffusion pour la génération de rapports de radiographie thoracique. Il utilise une distillation conditionnelle directe et un entraînement asymétrique pour générer des rapports en une seule étape par bloc, réduisant la latence d'inférence de 8× tout en améliorant RaTE (+64,33%) et SemScore (+60,58%) par rapport aux méthodes autorégressives.

VisionGénération de codeBenchmarks
SIG
75
HYP
25
arXiv cs.AI·

Herding CATs: ALARA for Agent Harness Engineering in Portable Composable Multi-Agent Teams

Papier présentant CAT (Context-Agent-Tool), une couche de données pour gérer les équipes multi-agents. Applique le principe ALARA (exposition minimale raisonnable) au contexte. Évalue 22 modèles (0.6B–35B paramètres) sur 115 tâches pratiques via npcsh, un shell CLI. ~2500 exécutions testent opérations fichiers, recherche web, scripting multi-étapes, chaînage d'outils et délégation inter-agents.

Multi-agentsAgents IAOutils
SIG
75
HYP
15
arXiv cs.AI·

Identifying Latent Actions and Dynamics from Offline Data via Demonstrator Diversity

Article théorique sur la récupération d'actions latentes et de dynamiques d'environnement à partir de trajectoires hors ligne sans observations d'actions. Les auteurs exploitent la diversité des démonstrateurs (chacun suivant une politique distincte) pour identifier les noyaux de transition latents via factorisation matricielle non-négative. Identifiabilité prouvée sous conditions de rang et diversité de politique.

Reinforcement learningPapers
SIG
75
HYP
15
arXiv cs.AI·

CounterRefine: Answer-Conditioned Counterevidence Retrieval for Inference-Time Knowledge Repair in Factual Question Answering

CounterRefine est une couche de réparation légère pour RAG qui traite la première réponse comme une hypothèse à tester. Le système émet des requêtes d'expansion conditionnées par la réponse pour récupérer des preuves spécifiques, puis applique une étape de raffinement KEEP/REVISE validée déterministiquement. Sur SimpleQA, il améliore un baseline RAG de 5,8 points de taux correct.

RAGRaisonnementÉvaluations
SIG
75
HYP
15
arXiv cs.AI·

Spherical VAE with Cluster-Aware Feasible Regions: Guaranteed Prevention of Posterior Collapse

Nouvelle méthode VAE utilisant la géométrie sphérique et des contraintes cluster-aware pour éliminer mathématiquement l'effondrement postérieur. Transforme les données en coque sphérique, applique K-means, définit une région faisable entre variance intra-cluster et perte d'effondrement. Garantit 100% de prévention d'effondrement sans surcharge computationnelle ni restrictions sur le décodeur.

PapersÉvaluations
SIG
75
HYP
25
arXiv cs.CL·

Reducing Credit Assignment Variance via Counterfactual Reasoning Paths

Les chercheurs proposent IBPO (Implicit Behavior Policy Optimization), une méthode de credit assignment pour l'apprentissage par renforcement avec LLM. En comparant plusieurs trajectoires de raisonnement, le framework transforme les récompenses terminales éparses en signaux d'apprentissage sensibles aux étapes, réduisant la variance des gradients et améliorant la stabilité sur les benchmarks mathématiques et de code.

Reinforcement learningRaisonnementGénération de code
SIG
75
HYP
25
arXiv cs.AI·

The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts Models

Une étude arXiv révèle que les modèles Mixture of Experts ne spécialisent pas réellement les experts par domaine comme supposé. Le framework COMMITTEEAUDIT identifie un « Standing Committee » — un groupe compact d'experts qui capture la majorité du routage indépendamment du domaine. Les experts périphériques gèrent seuls la connaissance spécifique au domaine.

BenchmarksPapers
SIG
75
HYP
15
arXiv cs.LG·

A Theory of Training Profit-Optimal LLMs

Modèle économique combinant lois de scaling et théorie microéconomique pour caractériser l'optimisation des profits dans l'entraînement des LLM. Analyse comment la taille du modèle, le budget en tokens et les coûts computationnels interagissent. En régime compute-bound, la dépense optimale suit l'efficacité matérielle (FLOPs/$) quasi-linéairement. En régime data-bound, elle évolue en D²/E.

BenchmarksPapersBusiness
SIG
75
HYP
15
arXiv cs.AI·

Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages

LiRA, un framework de fine-tuning léger, améliore l'adaptation multilingue des LLM pour les langues peu dotées. Il combine Arca (alignement basé sur des ancres vers l'anglais) et LaSR (tête sémantique consciente de la langue) pour stabiliser les représentations et la cohérence cross-linguale. Résultats positifs sur retrieval, ranking, QA et reasoning. Dataset multilingue (7 langues asiatiques) et code en open-source.

Fine-tuningRAGEmbeddings
SIG
75
HYP
20
arXiv cs.AI·

The threat of analytic flexibility in using large language models to simulate human data

Étude arXiv montrant que les choix analytiques (sélection de modèle, paramètres, format de prompt, données démographiques) affectent significativement la fidélité des « silicon samples » (données synthétiques générées par LLM). Sur 252 configurations testées, les corrélations avec les données humaines varient de r=.23 à r=.84, révélant un risque majeur de flexibilité analytique.

LlamaÉvaluationsSécurité IA
SIG
75
HYP
25
arXiv cs.AI·

UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities

UniversalRAG est un framework RAG multi-modal qui récupère et intègre des connaissances de sources hétérogènes (texte, images, vidéos) à granularités variables. Il introduit le routage conscient de la modalité pour éviter le biais intra-modal et organise chaque modalité en niveaux de granularité. Validé sur 10 benchmarks, il surpasse les baselines mono-modales et unifiées.

RAGVisionGénération de vidéos
SIG
75
HYP
25
arXiv cs.AI·

CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark

CrossView Suite introduit CrossViewSet (1.6M échantillons multi-vues), CrossViewBench (benchmark d'évaluation) et CrossViewer (framework trois étapes : Perception → Alignment → Reasoning) pour améliorer le raisonnement spatial multi-vues des MLLMs. Un moteur multi-agent génère des données annotées couvrant 17 types de tâches fine-grained.

VisionBenchmarksPapers
SIG
75
HYP
25
Reddit r/MachineLearning·

Program misleading high school students into paying to perform academic misconduct in ML Research [D]

Un programme payant (Algoverse AI Research) commercialisé auprès de lycéens produit massivement des publications NeurIPS 2025 (289 acceptations revendiquées) contenant des erreurs évidentes : résultats dupliqués, abstracts contradictoires avec les résultats, citations générées par IA, données non relues. Kevin Zhu, affilié au programme, cumule 158 publications et 468 coauteurs sur OpenReview.

PapersÉvaluationsRégulation
SIG
75
HYP
45