Archives

juin 2026

2731 articles

arXiv cs.AI·

LinTree: Improving LLM Reasoning with Explicitly Structured Search Histories

LinTree améliore le raisonnement des LLM en représentant explicitement la structure arborescente des traces de recherche. Les chercheurs montrent que l'accès brut à l'historique de recherche ne suffit pas à surpasser la recherche heuristique guidée par LLM. Ajouter des pointeurs parents pour expliciter la structure arborescente améliore les performances sur Blocks World, Navigation et Sokoban.

RaisonnementPapers
SIG
75
HYP
15
arXiv cs.LG·

The Long-Term Effects of Data Selection in LLM Fine-Tuning

Étude sur les effets long terme de la sélection de données lors du fine-tuning d'LLM sur plusieurs étapes. Les auteurs montrent que les stratégies optimales à court terme (loss-based, gradient-based, diversity-based) peuvent ralentir l'apprentissage futur et augmenter l'oubli catastrophique. Ils proposent LHAS (Long-Horizon Aware Selection) pour évaluer la sélection comme intervention d'entraînement globale.

Fine-tuningBenchmarksPapers
SIG
78
HYP
15
arXiv cs.LG·

SubsurfaceGen: Procedural Generation of Field-Scale Earth Models and Seismic Data

SubsurfaceGen est un générateur GPU pour modèles de vélocité 3D et données sismiques à l'échelle du terrain. Les auteurs publient un dataset de 4 276 tranches 2D, couvrant 6 contextes géologiques (10 km × 10 km × 6,19 km à 10 m de résolution). Évaluation d'opérateurs neuronaux sur prédiction de champs d'ondes et inversion de vélocité end-to-end.

BenchmarksPapersOpen source
SIG
78
HYP
15
arXiv cs.AI·

Answer-Set-Programming-based Abstractions for Reinforcement Learning

Nouvelle approche combinant Answer-Set Programming (ASP) et Reinforcement Learning pour créer des abstractions logiques d'espaces d'états. Les auteurs réimplémentent le framework CARCASS (originellement en Prolog) avec ASP, un langage déclaratif, et l'évaluent sur Blocks World et Minigrid. ASP offre une modélisation plus riche pour les représentations logiques de processus de décision markoviens.

Reinforcement learningRaisonnementPapers
SIG
65
HYP
15
arXiv cs.LG·

Destruction is a General Strategy to Learn Generation; Diffusion's Strength is to Take it Seriously; Exploration is the Future

Article théorique positionnant les modèles de diffusion comme cas particulier d'une famille de techniques d'apprentissage par destruction d'information. L'auteur argue que l'approche destructive offre plus de flexibilité que les techniques classiques, particulièrement en contexte de données limitées. Soulève des enjeux d'exploration et propose des directions de recherche natives aux modèles de diffusion.

PapersRaisonnement
SIG
45
HYP
25
arXiv cs.LG·

Supervised Training Rapidly Degrades Early Visual Cortex Alignment Across Biologically Plausible Learning Rules

Des réseaux de neurones non entraînés correspondent mieux au cortex visuel précoce que des réseaux entraînés. Une étude sur 720 images (THINGS) et données fMRI de 3 sujets montre qu'une époque de training réduit l'alignement V1 de 25-90% selon la règle d'apprentissage. La rétropropagation dégrade le plus (Δr = -0.080), tandis que le codage prédictif et STDP préservent mieux l'alignement (Δr ~ -0.04).

PapersRaisonnementAlignement
SIG
75
HYP
15
arXiv cs.AI·

HypoAgent: An Agentic Framework for Interactive Abductive Hypothesis Generation over Knowledge Graphs

HypoAgent est un framework multi-agent pour générer des hypothèses abductives interactives sur des graphes de connaissances. Trois agents coordonnés (reconnaissance d'intention, génération d'hypothèses, analyse de cause racine) permettent le dialogue multi-tour et le diagnostic fin des hypothèses échouées. SOTA sur graphes commonsense et biomédicaux.

Agents IAMulti-agentsRaisonnement
SIG
78
HYP
15
arXiv cs.AI·

Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration

SCALE est un framework d'auto-amélioration pour agents web basé sur MLLMs. Il utilise trois rôles adversariaux (Selector, Predictor, Judger) pour explorer autonomement les limites de l'agent et élargir ses capacités cognitives. SCALE-Hop optimise la planification globale. Un dataset SCALE-20k de 19 sites réels avec 20k démonstrations structurées valide l'approche sur plusieurs MLLMs.

Agents IAVisionReinforcement learning
SIG
72
HYP
35
arXiv cs.LG·

AMNESIA: A Large Scale Medical Unlearning Benchmark Suite with Disease-Informed Analysis

AMNESIA est le premier benchmark open-source à grande échelle pour l'oubli sélectif dans les LLMs médicaux. Il contient 70 560 paires question-réponse issues de 8 820 dossiers patients couvrant 11 catégories de maladies. Les auteurs évaluent 4 méthodes d'unlearning et révèlent que l'oubli de patients individuels érode la connaissance d'autres patients atteints de la même condition.

BenchmarksPapersSécurité IA
SIG
78
HYP
22
arXiv cs.CL·

Can LLM Teams Play What? Where? When?

Étude sur les équipes d'LLM jouant à ChGK (quiz de raisonnement collectif). Trois stratégies testées : Vote, Silent Team (capitaine observe réponses), Talkative Team (capitaine observe réponses + justifications). Sur 572 questions 2025, les équipes surpassent les modèles seuls (+20 points). Meilleure équipe : 44,23% accuracy, approchant la performance humaine. La communication des justifications réduit les erreurs.

Multi-agentsRaisonnementBenchmarks
SIG
75
HYP
25
arXiv cs.CL·

CanLegalRAGBench: Evaluating Retrieval-Augmented Generation on Canadian Case Law

CanLegalRAGBench est un benchmark d'évaluation pour systèmes RAG appliqués au droit canadien, basé sur des requêtes réalistes et des réponses annotées par des experts. L'étude révèle que les modèles d'embedding open-source rivalisent avec les modèles fermés, mais identifie des hallucinations dans 8-29% des réponses générées, non supportées par les documents récupérés.

RAGEmbeddingsÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

Evaluating using Mock Tool Calls to Quarantine Untrusted Prompt Inputs

Étude arXiv sur la sécurité des LLM face aux entrées non fiables. Les chercheurs testent l'hypothèse que wrapper du contenu non fiable dans des appels d'outils simulés améliore la robustesse. Résultat : sur 7 modèles et 3 tâches de jugement, cette approche échoue et augmente souvent les taux de succès des attaques, inversant la hiérarchie d'instructions attendue.

Sécurité IAPrompt engineeringÉvaluations
SIG
72
HYP
15
arXiv cs.LG·

Functional MRI Time Series Generation via Wavelet-Based Image Transform and Spectral Flow Matching for Brain Disorder Identification

DSFM (Dual-Spectral Flow Matching) génère des séries temporelles fMRI synthétiques en combinant transformée en ondelettes discrète (DWT) et transformée en cosinus discret (DCT) avec flow matching spectral. Le modèle capture la non-stationnarité et la dynamique spatiotemporelle des signaux BOLD pour améliorer la classification de réseaux cérébraux.

PapersBenchmarksVision
SIG
72
HYP
18
arXiv cs.LG·

Unicorn: Scaling High-Dimensional Time Series Forecasting via Universal Correlation Modeling

Unicorn, un framework de préentraînement multi-dataset, résout le compromis entre modèles indépendants par canal (scalables mais ignorant les dépendances) et modèles dépendants (expressifs mais limités en dimensions). Via un codebook de prototypes latents, il projette des canaux hétérogènes dans un espace partagé pour apprendre des patterns de corrélation réutilisables et transférables.

PapersBenchmarksFine-tuning
SIG
72
HYP
28
Reddit r/LocalLLaMA·

I bolted an 8-arm reasoning MoE onto a frozen 1.4B Mamba backbone on a single RTX 3060. Here’s the mechanistic autopsy of what broke and what worked.

Un chercheur a construit Mamba-Titan-1.4B-Reasoning (2.54B params MoE) sur RTX 3060 en gelant un backbone Mamba-1 1.4B et en ajoutant 8 experts entraînables. Entraîné sur traces CoT DeepSeek, le modèle a développé un mécanisme de « vault door » : le token </think> s'isole à la plus petite norme (1.991 vs 4.742 moyenne) pour contrôler la terminaison du raisonnement latent.

RaisonnementFine-tuningOpen source
SIG
78
HYP
35