Page 8 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

PhysAssistBench est un benchmark d'assistance médecale interactive basé sur 1 296 tours validés par des médecins, construits à partir de cas réels MIMIC-IV. Il évalue la capacité des LLMs à coordonner connaissances cliniques, communication patient et interaction EHR dans un même dialogue. Les expériences montrent que les modèles actuels restent peu fiables dans ce contexte.

BenchmarksAgents IAMulti-agents
SIG
78
HYP
25
arXiv cs.LG·

Ghost Attractor Networks: Basin-Structured Dynamical Decoders for Closed-Loop Sequential Generation

Ghost Attractor Networks propose un décodeur dynamique efficace pour la génération séquentielle en robotique. Avec 2,3M paramètres, il égale la précision d'un Diffusion Transformer de 1,07B paramètres (462× moins de paramètres, 32× plus rapide). Sur LIBERO-10, le conditionnement de phase améliore le taux de succès de 13,5 points vs MLP.

Génération de codeRobotiqueRaisonnement
SIG
78
HYP
15
arXiv cs.CL·

ScholarSum: Student-Teacher Abstractive Summarization via Knowledge Graph Reasoning and Reflective Refinement

ScholarSum propose un cadre hiérarchique basé sur graphes de connaissances pour la résumé abstractif scientifique. Le système organise les documents en unités sémantiques cohérentes, génère un brouillon initial, puis l'affine via un processus itératif de vérification et de réécriture pour assurer cohérence logique et fidélité factuelle.

PapersRAGRaisonnement
SIG
78
HYP
22
arXiv cs.CL·

MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level Retrieval

MCompassRAG améliore les systèmes RAG en utilisant des métadonnées de sujets comme guide sémantique pour la récupération de paragraphes. La méthode enrichit les représentations de chunks avec des signaux au niveau des sujets dans le même espace d'embedding et entraîne un retrieveur léger par distillation LLM. Sur six benchmarks, elle gagne 8,24% en efficacité informationnelle avec 5× moins de latence.

RAGEmbeddingsBenchmarks
SIG
78
HYP
25
arXiv cs.LG·

Breaking the Solver Bottleneck: Training Task Generators at the Learnable Frontier

PROPEL est un framework qui entraîne des générateurs de tâches via RL pour créer des problèmes optimaux pour l'apprentissage d'agents. Une sonde légère prédit le taux de résolution sans rollouts répétés du solveur, réduisant l'évaluation à un forward pass. Sur code et SWE, les tâches au « learnable frontier » passent de 10,1% à 20% (Qwen2.5-3B) et de 9,8% à 19,6% (Qwen3.5-27B).

Reinforcement learningAgents IAGénération de code
SIG
78
HYP
15
arXiv cs.CL·

CoreMem: Riemannian Retrieval and Fisher-Guided Distillation for Long-Term Memory in Dialogue Agents

CoreMem propose une architecture mémoire pour agents dialogues personnalisés sur appareils edge (8 GB VRAM). Utilise la métrique Fisher-Rao pour la récupération (remplaçant la similarité cosinus) et la distillation de tokens guidée par Fisher pour la compression. Gains de +4.51 pp en raisonnement open-domain et +4.17 pp en raisonnement temporel sur LOCOMO et LongMemEval-S.

Agents IARAGEmbeddings
SIG
78
HYP
15
arXiv cs.CL·

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

Étude arXiv sur l'amélioration du raisonnement long-contexte via une approche data-centric plutôt que l'ingénierie des récompenses. Recette de données ciblant retrieval, synthèse multi-preuves et raisonnement (~14K exemples). Tests sur Qwen3 (4B/8B/30B) : +7.2/+3.2/+6.4 points sur 7 benchmarks long-contexte, transfert aux tâches agentic (+4.8 GAIA, +7.0 BrowseComp).

Reinforcement learningRaisonnementAgents IA
SIG
78
HYP
25
arXiv cs.LG·

What Does the Weight Norm Control in Grokking? Logit-Scale Mediation under Cross-Entropy

Étude sur le grokking (transition retardée de la mémorisation à la généralisation). Les auteurs montrent que la norme des poids ne contrôle pas directement le délai de grokking, mais agit via l'échelle des logits. En fixant la norme et variant la température de sortie, ils retrouvent 85% du délai en ajustant l'échelle logit. L'effet dépend de la fonction de perte (cross-entropy vs MSE).

PapersRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

Self-CTRL: Self-Consistency Training with Reinforcement Learning

Self-CTRL optimise la cohérence entre les auto-explications et le comportement des modèles de langage via apprentissage par renforcement. Sur un task de raisonnement probabiliste, la méthode améliore la corrélation R² de 0.24 à 0.64. En IA constitutionnelle, elle augmente la prédiction des refus de 36% à 92% et réduit le taux d'échec HarmBench de 15.0% à 0.5%.

Reinforcement learningAlignementSécurité IA
SIG
78
HYP
25
arXiv cs.CL·

Lost in a Single Vector: Improving Long-Document Retrieval with Chunk Evidence Aggregation

DICE améliore la récupération de documents longs en fragmentant le texte, encodant chaque chunk indépendamment, puis agrégant les vecteurs en une seule représentation. Sur LongEmbed, les gains atteignent 90.0 pour Dream Passkey >4k (vs 30.0) et 74.0 pour Needle >4k (vs 23.3). L'approche réduit l'indice de dilution d'évidence (EDI) dans 92.8% des cas.

RAGEmbeddingsRecherche vectorielle
SIG
78
HYP
15
arXiv cs.AI·

ARIADNE: Agnostic Routing for Inference-time Adapter DyNamic sElection

ARIADNE est un framework sans entraînement pour sélectionner dynamiquement des adaptateurs au moment de l'inférence. Il représente chaque adaptateur par des centroïdes calculés à partir des embeddings de son ensemble d'entraînement. Testé sur Llama 3.2 1B avec 23 tâches NLP, il récupère 97,44% des performances optimales et atteint 89,7% de précision sur 44 tâches.

Fine-tuningLlamaBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

SAE Interventions are Unreliable: Post-Intervention Recovery of Suppressed Behavior

Les autoencodeurs creux (SAE) décomposent les activations en features interprétables, mais une étude montre que bloquer une feature « dangereuse » ne supprime pas le comportement : celui-ci peut se rétablir via d'autres chemins résiduels. Même avec intervention active, 95,8% de récupération du comportement est possible en refusal-steering, révélant un écart entre contrôle des features et contrôle comportemental.

Sécurité IAAlignementÉvaluations
SIG
78
HYP
25
arXiv cs.LG·

CODEBLOCK: Learning to Supervise Code at the Right Granularity

CodeBlock est un framework de supervision sparse pour l'entraînement de LLMs de code. Il sélectionne des blocs de code syntaxiquement cohérents plutôt que des tokens isolés, en estimant leur utilité via cross-entropy généralisée et signaux de flux de données. Sur 6 benchmarks, CodeBlock surpasse la SFT full-token en utilisant seulement 1,9% des tokens supervisés.

Génération de codeFine-tuningPapers
SIG
78
HYP
15
arXiv cs.LG·

Measurement noise limits the advantage of nonlinear models over linear models in biomedical prediction

Une étude arXiv montre que sur données biomédicales tabulaires, le bruit de mesure limite l'avantage des modèles non-linéaires (réseaux profonds, gradient boosting) sur la régression linéaire. Les interactions de degré k sont atténuées par la k-ième puissance de la fiabilité des features, tandis que la partie linéaire ne l'est qu'une fois. Analyse de 140 tâches UK Biobank confirmant cette signature du bruit.

BenchmarksÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR

L'étude montre que l'overtraining en SFT peut inverser le classement des modèles lors du fine-tuning RLVR. Sur Qwen2.5-Coder-3B, l'augmentation de la profondeur SFT élève pass@1 pré-RL mais réduit pass@10 GRPO de 0.806 à 0.481. L'entropie pré-RL corrèle positivement avec les résultats RLVR (ρ=+0.69). Un diagnostic deux étapes basé sur l'entropie peut identifier les checkpoints à risque.

Reinforcement learningFine-tuningRaisonnement
SIG
78
HYP
15
arXiv cs.CL·

The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

Les modèles élaguées passent les benchmarks à choix multiples mais échouent en génération ouverte. Étude multilingue montrant que sous élagage haute sparsité (Wanda), les réponses correctes sont démotées plutôt qu'effacées : elles réapparaissent avec beam search ou sampling. Les benchmarks à choix multiples surestiment l'utilisabilité des LLM compressés.

BenchmarksÉvaluationsFine-tuning
SIG
78
HYP
15
arXiv cs.LG·

CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models

CheckMIABench propose un benchmark pour évaluer les attaques d'inférence d'appartenance (MIA) sur les modèles de langage. En exploitant les checkpoints intermédiaires de modèles open-source (Pythia, OLMo, 70M-7B), les auteurs créent des testbeds fiables où les données avant/après un point fixe partagent la même distribution. Ils testent six attaques publiées et ouvrent une librairie modulaire (pandora_llm).

PapersBenchmarksSécurité IA
SIG
78
HYP
15
arXiv cs.LG·

Operator Boosting Produces Pareto-Efficient PDE Surrogates

Operator Boosting construit des surrogates compacts de réseaux de neurones pour résoudre les EDPs via apprentissage résiduel par étapes. Testé sur FNO, DeepONet et CNO sur 30 benchmarks (PDEBench, APEBench), la méthode réduit les paramètres de 72-95% tout en améliorant la précision sur 21 paires dataset-architecture et obtient des gains Pareto sur 7/10 benchmarks EDPs.

PapersBenchmarksGénération de code
SIG
78
HYP
15
arXiv cs.AI·

MemTrace: Probing What Final Accuracy Misses in Long-Term Memory

MemTrace est un benchmark évaluant la mémoire long-terme des agents LLM selon trois dimensions : l'âge de la mémoire, le type de question (état actuel, antérieur, trajectoire) et les conditions de preuve. Sur 13 configurations testées, l'étude révèle que l'utilisation des preuves est le goulot d'étranglement principal (10× plus souvent disponibles que manquantes), non la récupération.

Agents IAÉvaluationsBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

When the Next Step Is Not One Step: Distribution-Aware Execution Modeling for Concurrent Go Programs

Modèle 7B fine-tuné pour prédire l'étape suivante dans des programmes Go concurrents en apprenant une distribution d'événements plutôt qu'une étiquette unique. Sur 798 prédictions issues de bugs réels (CockroachDB, Kubernetes, gRPC, etcd), atteint 36.2% de précision avec <1000 traces, surpassant Gemini 3.5 Flash zéro-shot (34.8%). Dataset, adapters et outils publiés.

Génération de codeBenchmarksFine-tuning
SIG
78
HYP
15
arXiv cs.AI·

SpeechDx: A Multi-Task Benchmark for Clinical Speech AI

SpeechDx est un benchmark multi-tâches pour l'IA clinique basée sur la parole, couvrant 12 datasets et 27 tâches sur diverses conditions de santé. Les tâches sont structurées par étapes de production vocale (conceptualisation, formulation, articulation). L'évaluation de 12 encodeurs audio montre que les modèles de parole à grande échelle surpassent les modèles spécialisés, mais aucun ne généralise fiablement.

BenchmarksVoixÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing

STATEWITNESS, un expliciteur d'activations, détecte la tromperie dans les LLMs de raisonnement en lisant les états cachés du modèle cible et répondant à des requêtes en langage naturel. Atteint 0.916 AUROC, +11.6% vs meilleur moniteur texte black-box, +25.0% vs baseline probe. Fournit traces d'évidence au niveau token/phrase pour inspection humaine.

RaisonnementSécurité IAAlignement
SIG
78
HYP
25
arXiv cs.AI·

Beyond Parallel Sampling: Diverse Query Initialization for Agentic Search

DivInit améliore l'échelle de test pour la recherche agentic en diversifiant les requêtes initiales. Au lieu d'échantillonner k requêtes indépendantes en parallèle, la méthode génère n candidats puis sélectionne k graines diversifiées. Gains de 5-7 points sur QA multi-hop sans coût computationnel supplémentaire, validé sur 5 modèles open-weight et 8 benchmarks.

Agents IARaisonnementBenchmarks
SIG
78
HYP
18
arXiv cs.AI·

DecoSearch: Complexity-Aware Routing and Plan-Level Repair for Text-to-SQL

DecoSearch est un framework sans entraînement pour la traduction texte-vers-SQL qui route les requêtes selon leur complexité. Un sélecteur de schéma élagué la base de données, un jugeur LLM décide si décomposition est nécessaire, et un DAG résout les sous-questions atomiques. Atteint 70,53% sur BIRD et 88,31% sur Spider avec DeepSeek, surpassant les baselines sans entraînement.

Génération de codeRaisonnementRAG
SIG
78
HYP
25
arXiv cs.CL·

An expressivity analysis of hierarchical modelling in deep transformers via bounded-depth grammars

Analyse théorique de l'expressivité des transformers profonds via des grammaires sans contexte de profondeur bornée. Les auteurs construisent explicitement des transformers avec attention positionnelle dont la profondeur croît linéairement avec celle de la grammaire, démontrant que ces architectures peuvent encoder des états grammaticaux abstraits dans des sous-espaces linéairement séparables du flux résiduel.

PapersRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

ChLogic: Evaluating Robustness of Logical Reasoning in Chinese Expressions

ChLogic est un benchmark bilingue anglais-chinois évaluant la robustesse du raisonnement logique dans les LLM. Construit à partir de templates logiques formels, il contient 100 propositions alignées et 15 phénomènes spécifiques au chinois. Les expériences sur Qwen3, Ministral et GLM révèlent un écart de performance persistant anglais-chinois, la rétrotraduction produisant des effets mixtes.

BenchmarksRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models

Les modèles de raisonnement entraînés par RL génèrent souvent du raisonnement inutile après avoir trouvé la bonne réponse (overthinking). Cet article propose Dynamic Rollout Editing (DRE), une intervention au moment de l'entraînement GRPO qui édite les trajectoires réussies continuant après l'émergence de la réponse, préservant le préfixe vérifié et affaiblissant le signal de préférence pour la pensée inutile.

Reinforcement learningRaisonnement
SIG
78
HYP
15
arXiv cs.CL·

The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports

Étude sur 450 rapports de radiologie thoracique montrant que la réécriture par LLM pour standardisation préserve l'alignement image-texte (2,5% de dégradation) mais érode 26,8-29,3% des entités cliniques et 14,9-16,5% du langage d'incertitude. Le paradoxe : les tâches produisant du texte « plus propre » éloignent le contenu de l'image.

VisionRAGÉvaluations
SIG
78
HYP
15