Archives

juin 2026

2731 articles

arXiv cs.LG·

Uncertainty-aware Multi-fidelity Closure via Conditional Normalizing Flows

Article proposant une approche multi-fidélité basée sur les normalizing flows conditionnels pour améliorer la précision des modèles réduits (ROM). Le framework apprend un mappage probabiliste entre coefficients ROM basse-fidélité et haute-fidélité, avec quantification d'incertitude. Deux stratégies testées sur équations de Navier-Stokes 2D : apprentissage direct et résiduel, ce dernier surpassant le premier.

PapersRaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.LG·

SinkRec: Mitigating Semantic State Sink in Long Sequence Recommendation with Memory-Conditioned Gated Delta Networks

SinkRec propose une architecture hybride pour les recommandations sur longues séquences, combinant attention linéaire et mémoire conditionnelle. Elle résout le problème du « semantic state sink » où les patterns répétitifs dominent l'état récurrent, en externalisant les comportements récurrents via quantization vectorielle et en introduisant TDGD pour purifier les lectures/écritures d'état.

RaisonnementBenchmarksPapers
SIG
72
HYP
18
arXiv cs.LG·

Conformal Risk Prediction for Non-Alcoholic Fatty Liver Disease Using Gradient Boosting with Distribution-Free Coverages

Framework ML couplant gradient boosting et prédiction conforme pour le risque de NAFLD. Évalué sur 2,599 patients (Guangzhou), atteint AUROC 0.912 en interne et 0.891 en validation externe. Couverture conforme 91.3% à niveau nominal 90%. Stratification 3-niveaux : groupe haut-risque montre taux progression 4.7× supérieur au groupe bas-risque.

BenchmarksÉvaluationsSécurité IA
SIG
78
HYP
15
arXiv cs.LG·

QSplitFL: Capability Aware Deep Q-Learning for Optimal Split Point Selection in Split Federated Learning

QSplitFL propose un framework Deep Q-Network pour sélectionner automatiquement le point de division optimal dans le Split Federated Learning. Utilisant des métriques matérielles légères (CPU, mémoire, batterie, latence réseau) plutôt que les poids du modèle, l'approche avec architecture DQN par comité améliore la convergence sur MNIST, Fashion-MNIST, CIFAR-10/100 avec CNN, ResNet50, MobileNetV4, ConvNeXt.

Reinforcement learningPapersBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

SynIB: Informational Bottleneck for Maximizing Synergy in Multimodal Learning

SynIB, une nouvelle fonction objectif basée sur la théorie de l'information, maximise la synergie multimodale en pénalisant la confiance du modèle quand une modalité est masquée. Validé sur XOR synthétique et cinq benchmarks réels (MultiBench, Hateful Memes, CREMA-D), SynIB améliore la précision sur exemples synergiques de jusqu'à 7,8% et la précision globale de 3,8%.

BenchmarksPapers
SIG
72
HYP
28
arXiv cs.AI·

Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimization for Long-Horizon Language Agents

OSL-MR, un framework pour optimiser la rétention mémoire dans les agents IA long-horizon. Formule le problème comme optimisation stochastique contrainte avec budget, utilité des preuves et coûts différés (pénalités d'oubli, délais de réacquisition). Combine apprentissage supervisé et heuristique Mixed-Score. Surpasse les baselines récence et Generative Agents sur LOCOMO et LongMemEval.

Agents IARaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.CL·

The Order Matters: Sequential Fine-Tuning of LLaMA for Coherent Automated Essay Scoring

Étude sur le fine-tuning séquentiel de LLaMA-3.1-8B pour l'évaluation automatique d'essais. Le modèle entraîné progressivement sur les éléments de discours (lead → position → claim → evidence → conclusion) atteint F1=65% (evidence) et 87% (conclusion), surpassant LLaMA-70B. Démontre que l'ordre d'apprentissage aligné à la structure du texte améliore la cohérence.

LlamaFine-tuningBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

AutoPDE: Reliable Agentic PDE Solving via Explicitly Represented Solver Strategies

AutoPDE est un agent IA qui résout les équations aux dérivées partielles (EDP) en maintenant explicitement la stratégie numérique comme objet inspectable. L'approche combine analyse d'EDP, sélection de méthodes numériques et calibrage adaptatif. Sur PDE Agent Bench, AutoPDE atteint 54,5% de réussite, surpassant la meilleure baseline de 14,2 points.

Agents IAGénération de codeRaisonnement
SIG
72
HYP
25
arXiv cs.CL·

PADD: Path-Aligned Decompression Distillation for Non-Router Teacher to Guide MoE Student Learning

PADD est une méthode de distillation de connaissance pour transformer un modèle dense en étudiant MoE sans routeur explicite. Le framework en 4 étapes (initialisation + entraînement) utilise le clustering de neurones du professeur et l'optimisation adaptative pour obtenir des gains sur les benchmarks de raisonnement mathématique, l'étudiant MoE égalant ou surpassant le professeur dense.

Fine-tuningRaisonnementBenchmarks
SIG
75
HYP
15
arXiv cs.AI·

ReflectiChain: Epistemic Grounding in LLM-Driven World Models for Supply Chain Resilience

ReflectiChain combine LLM et apprentissage par renforcement pour les chaînes d'approvisionnement via un modèle monde (SC-WM) en espace latent 6D avec conservation physique. Sur benchmark Semi-Sim (10 nœuds, risque SIR), amélioration de 33% en cohérence rationnelle, 82.3% d'opérabilité sous chocs adversariaux, comportement anti-fragile (+40.2%).

Agents IAReinforcement learningRaisonnement
SIG
72
HYP
25
arXiv cs.CL·

BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts

BenSyc est le premier benchmark pour évaluer la sycophantie conversationnelle dans les contextes sociaux bengalis. Construit à partir de 170k commentaires Reddit, il teste 15+ LLMs sur la classification d'alignement et la génération de réponses. Les meilleurs modèles atteignent seulement 61,8% Macro-F1 en détection binaire, révélant des difficultés à distinguer le soutien empathique de la validation excessive.

BenchmarksAlignementSécurité IA
SIG
78
HYP
15
arXiv cs.CL·

Hidden Consensus:Preference-Validity Compression in Human Feedback

Étude sur l'agrégation des retours humains en RLHF : réduire les jugements hétérogènes à une seule récompense scalaire masque les désaccords culturels, linguistiques ou normatifs légitimes. Analyse de 321 événements de préférence en Malaisie : 79% des prompts contiennent plusieurs réponses acceptables que l'agrégation par majorité élimine. Propose une approche préservant la pluralité des interprétations valides.

Reinforcement learningAlignementÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

CodeAlchemy: Synthetic Code Rewriting at Scale

CodeAlchemy génère 500B+ tokens de données synthétiques via 5 stratégies (CodeEnhance, CodeQA, CodeDev, CodeDialogue, CodeTrace) à partir de code public dans 15 langues. CodeTrace instrumente 1.3M+ fichiers pour capturer flux de contrôle et connaissance de bibliothèques. Les modèles 3B surpassent des modèles 10x plus grands (Gemma-3 27B, Granite-4.0 32B) : 83.5% HumanEval, 63.2% MBPP.

Génération de codeBenchmarksFine-tuning
SIG
82
HYP
25
arXiv cs.AI·

Mobility Anomaly Generation using LLM-Driven Behavior with Kinematic Constraints

Framework génératif pour créer des anomalies de trajectoires humaines annotées. Utilise des agents LLM pour injecter des comportements anormaux sémantiques (check-ins hors-distribution, visites manquées) dans des trajectoires simulées, avec reconstruction de routage contrainte par la carte et modèle de bruit spatial contextuel pour réduire l'écart simulation-réalité.

Agents IAPapers
SIG
72
HYP
18
arXiv cs.LG·

Mitigating Manifold Departure: Uncertainty-Aware Subspace Rectification for Trustworthy MLLM Decoding

Nouvelle méthode MGAP pour réduire les hallucinations dans les MLLMs sans entraînement. Utilise SVD pour construire un sous-espace de priors linguistiques et projette les états cachés multimodaux pour atténuer sélectivement les composantes problématiques tout en préservant la structure sémantique. Améliore les scores POPE et CHAIR.

VisionSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.AI·

What Spatial Memory Must Store: Occlusion as the Test for Language-Agent Memory

Étude sur la mémoire spatiale des agents IA. Les systèmes « memory palace » ancrent chaque souvenir à une coordonnée mondiale. Expérience pré-enregistrée : le mélange linéaire standard (proximité spatiale + récence + importance) échoue (Delta-Hit@5 -0.0375, p=0.306), tandis qu'une pondération basée sur la géométrie gagne (+0.3208, p<0.001). Confirmation que l'occlusion nécessite la géométrie.

Agents IARaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

Which LoRA? An Empirical Study on the Effectiveness of LoRA Techniques During Multilingual Instruction Tuning

Étude empirique comparant LoRA et 4 variantes sur l'instruction tuning multilingue. Résultats : aucun avantage significatif des variantes complexes vs LoRA basique pour équilibrer transfert cross-lingual et rétention de connaissances. Analyse des embeddings : représentations linguistiques similaires indépendamment de la technique LoRA.

Fine-tuningBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Are We Evaluating Knowledge or Phrasing? Mitigating MCQA Sensitivity with ParaEval

ParaEval, un framework d'évaluation, corrige les biais des benchmarks MCQA en testant les modèles avec plusieurs paraphrases par option. Les scores standards confondent familiarité avec une formulation exacte et vraie compréhension. Sur modèles 1B-8B avec connaissances identiques, ParaEval réduit les écarts de performance artificiels de 2 points à moins de 1 point.

ÉvaluationsBenchmarks
SIG
75
HYP
15
arXiv cs.AI·

Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts

Visual-SDPO, un framework d'auto-distillation par retour visuel, améliore la génération de code pour artefacts visuels (graphiques, pages web, slides). La méthode trace les défauts visuels détectés jusqu'aux instructions de code responsables et amplifie le signal de distillation. Sur ChartMimic, Design2Code et AeSlides, elle gagne +10 points absolus vs zéro-shot et +2.4 vs GRPO.

Génération de codeVisionReinforcement learning
SIG
78
HYP
25
arXiv cs.AI·

Predictive Assistance and the Temporal Dynamics of Exploratory Compression

Article théorique sur l'impact de l'assistance prédictive (IA) sur la dynamique cognitive d'exploration. Modèle géométrique montrant que la stabilisation précoce par systèmes prédictifs réduit la réactivité exploratoire, crée de l'hystérésis et retarde la récupération après retrait de l'assistance. Les résultats suggèrent que l'IA prédictive reshape la géométrie même de la cognition exploratoire.

RaisonnementAlignement
SIG
45
HYP
15
arXiv cs.AI·

From Context-Aware to Conflict-Aware: Generalizing Contrastive Decoding for Knowledge Conflict in LLMs

Article arXiv proposant une généralisation des méthodes de décodage contrastif pour gérer les conflits entre contexte externe et priors paramétriques dans les LLM. Introduit le paradigme « conflict-aware » et la méthode Adaptive Regime Routing (ARR) qui route dynamiquement entre régimes selon les signaux de conflit, améliorant la résistance EM de <6% à 16-33% sur TriState-Bench.

RaisonnementRAGÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

Where You Inject Diversity Matters: A Unified Framework for Diverse Generation

Framework unifié pour caractériser les méthodes de génération diverse au test-time. Les auteurs proposent l'injection de diversité au niveau des spécifications intermédiaires, améliorant la diversité de sortie sur 5 tâches et 4 modèles tout en maintenant la qualité. Analyse des facteurs clés : diversité des sources et transmission vers la sortie finale.

Prompt engineeringRaisonnementGénération de code
SIG
72
HYP
18
arXiv cs.AI·

RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning

RealMath-Eval, un benchmark de 224 réponses d'examen réelles, révèle que les juges LLM état-de-l'art échouent à évaluer le raisonnement humain authentique (MSE ~2.96 vs ~1.17 sur solutions synthétiques). L'analyse montre que les erreurs humaines forment un espace d'erreurs plus diversifié que les erreurs synthétiques, avec une surprisal informationnelle plus élevée.

ÉvaluationsBenchmarksRaisonnement
SIG
78
HYP
15
arXiv cs.AI·

Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents

Étude sur l'optimisation du contexte pour agents LLM autonomes en workflows d'entreprise. Test de 4 configurations GPT-5 sur 50 tâches de catégorisation de dépenses (Microsoft Dynamics 365). Pruning du contexte aux 5 derniers appels outils + summarization atteint 91,6% de complétude avec 553k tokens (vs 1,48M en contexte complet), réduisant le runtime de 14,56h à 5,79h.

GPTAgents IAMCP
SIG
78
HYP
15
arXiv cs.CL·

Large Language Models as Modal Models in Linguistics

Article théorique examinant le rôle épistémique des LLM en linguistique via le cadre du modal modeling. Les auteurs argumentent que les LLM fournissent des explications how-possibly (HPE) sur l'acquisition du langage sans correspondance structurelle avec la cognition humaine, mais ne satisfont pas encore les critères des how-actually explanations (HAE). Propose un continuum explicatif entre HPE et HAE.

PapersRaisonnement
SIG
65
HYP
15
arXiv cs.LG·

SocraticPO: Policy Optimization via Interactive Guidance

SocraticPO est un framework de policy optimization pour LLMs qui augmente les rollouts RL avec des guidances en langage naturel de style socratique. Un enseignant diagnostique les erreurs et fournit des corrections concises, associées à une décroissance de récompense pour éviter que le modèle ne dépende de l'aide. Testé sur SciKnowEval, il surpasse les baselines RL et auto-distillation.

Reinforcement learningRaisonnementPapers
SIG
75
HYP
15
arXiv cs.CL·

The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge

Étude de la relation entre confiance interne (log-probabilités), évaluation externe (LLM-as-judge) et exactitude finale dans les débats multi-agents. Framework avec Constructor et Auditor révèle asymétrie de rôle : la confiance du Constructor prédit 2× mieux la qualité du raisonnement jugé et détecte les défaillances critiques (AUROC 0.804 vs 0.634 pour l'Auditor).

Multi-agentsAgents IARaisonnement
SIG
72
HYP
15
arXiv cs.AI·

ComBench: A Benchmark for Rigorous Proof Reasoning and Constructive Realization in Olympiad-Level Combinatorics

ComBench est un benchmark de 100 problèmes de combinatoire niveau Olympiade pour évaluer le raisonnement mathématique des LLM. Il distingue problèmes d'analyse (preuves rigoureuses) et de construction (constructions explicites). Les meilleurs modèles atteignent 65,4% en moyenne et 75,3% en Best@4. Kimi-K2.6 surpasse GPT-4o sur les constructions mais le cède sur les preuves.

BenchmarksRaisonnementÉvaluations
SIG
82
HYP
15
arXiv cs.AI·

Moonshine: An Autonomous Mathematical Research Agent Centered on Conjecture Generation

Moonshine est un agent autonome générant des conjectures mathématiques. Il extrait des structures de problèmes classiques et formule des conjectures significatives. Appliqué à la conjecture jacobienne, il transfère la logique à des réseaux de neurones affines-ridge, formulant la Neural Jacobian Conjecture (NJC). GPT-5.5-pro et DeepSeek-V4-pro ont obtenu des preuves complètes pour N=n+1.

Agents IARaisonnementPapers
SIG
72
HYP
35
arXiv cs.CL·

MIRAGE: A Polarity-Flipping Encoding Subspace in LLM Agents

Des chercheurs découvrent un sous-espace de codage partagé dans le flux résiduel des LLM permettant de détecter quand les agents encodent secrètement des données sensibles (Base64, ROT13, etc.). MIRAGE, un moniteur temps réel exploitant deux signaux mécanistiques, atteint AUC=0.918 sur 126 scénarios d'exfiltration, surpassant largement la détection en sortie (AUC=0.518).

Sécurité IAAlignementRaisonnement
SIG
78
HYP
25
arXiv cs.CL·

Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

Étude arXiv mesurant la dépendance des VLMs aux priors textuels plutôt qu'au contenu visuel. Benchmark de 540 images avec 4 variantes de questions par image. 11 modèles testés : tous dégradent sur la variante la plus difficile, les modèles open-source chutent le plus. Ablation sans image réduit les modèles open à 1-9% de performance. GRPO post-training améliore la dépendance à l'image.

VisionÉvaluationsBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

A Unified Multi-Modal Framework for Intelligent Financial Systems: Integrating Reinforcement Learning, High-Frequency Trading, and Game-Theoretic Approaches with Cross-Modal Sentiment Analysis

Framework unifié intégrant PPO, prédiction time-series, in-context learning, théorie des jeux et analyse de sentiment cross-modal pour systèmes financiers. Résultats : +23.7% optimisation portefeuille, -31.2% erreur trading haute fréquence, +18.9% recommandations, +27.4% convergence Nash, +15.6% sentiment analysis.

Reinforcement learningBenchmarksRaisonnement
SIG
45
HYP
72
arXiv cs.CL·

Less Context, More Accuracy: A Bi-Temporal Memory Engine for LLM Agents Where a Lean Retrieved Context Beats the Full History

Engram, un moteur mémoire open-source pour agents LLM, utilise un modèle bi-temporel avec graphe de connaissances pour dépasser la baseline full-context. Sur LongMemEval_S (500 questions), la configuration lean récupère ~9.6k tokens et atteint 83.6% vs 73.2% pour l'historique complet (+10.4 points, p<10^-6), avec 8x moins de tokens.

Agents IARaisonnementBenchmarks
SIG
82
HYP
15
Reddit r/MachineLearning·

RFE‑Core2 — Current Understanding (June 9th 2026) [R]

RFE-Core2 : analyse complète des goulots d'étranglement après probe arc (juin 2026). Le générateur domine (rang effectif ~1.6–3 à dim 512, collinéarité 0.85–0.96). La boucle réflexive reconstitue vers l'ancre indépendamment du rang. Fix 2 dormant sur tokens réels (+0.024 migration). Solution : entraîner le générateur pour que les différences de régime vivent en directions haute-énergie séparables.

RaisonnementÉvaluationsPapers
SIG
72
HYP
15
Reddit r/LocalLLaMA·

Releasing Apodex-1.0 Smol Models (0.8B, 2B, 4B Open-Weights) optimized for Agentic Verification + AgentHarness Evals

Apodex-1.0 publie des modèles légers open-weights (0.8B, 2B, 4B) optimisés pour les workflows d'agents locaux. Spécialisés en vérification indépendante et fact-checking dans des boucles agentic, ils remplacent les appels répétés à des modèles 70B+. AgentHarness, le framework d'évaluation, est également open-sourcé.

Agents IAOpen sourceÉvaluations
SIG
75
HYP
35
Reddit r/LocalLLaMA·

Fine-tuned Qwen2.5-7B to 96% of Claude Haiku on a domain-specific task using ~$3 of API calls and zero human labelers

Fine-tuning de Qwen2.5-7B atteint 96% des performances de Claude Haiku sur une tâche spécialisée (moteur de décision) avec ~$3 d'appels API et zéro annotateurs humains. Méthode DV-DPO : conseil à 3 voix + contre-examen adversarial génère 1 040 paires d'entraînement. Latence 11s vs 3s (T4 4-bit). Boucle autonome en production avec détection d'erreurs et red-teaming automatique.

QwenFine-tuningReinforcement learning
SIG
78
HYP
25
Reddit r/MachineLearning·

What will be the next breakthrough in ASR? [D]

Discussion sur l'évolution des modèles ASR : Whisper-large-v3 (5M heures) et Nvidia Parakeet v3 (660k heures) dominent via l'apprentissage supervisé. Nouvelles architectures (Transducer, Token-Duration-Transducers, attention encoder-decoder Qwen) remplacent CTC+self-supervised. Question : l'auto-supervision (Data2Vec2.0, WavLM) disparaîtra-t-elle pour l'ASR ou aura-t-on un moment « Dino » en speech ?

VoixBenchmarksOpen source
SIG
35
HYP
25