Page 47 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$\Delta$ Integration into Upcycled MoE

Méthode pour étendre les LLM à de nouvelles langues sans phase d'alignement coûteuse. Convertit un modèle dense en architecture Mixture-of-Experts avec experts dédiés par langue, puis transfère les capacités d'alignement via fusion de deltas post-training. Améliore les performances sur les nouvelles langues tout en préservant les capacités originales.

Fine-tuning
SIG
75
HYP
25
arXiv cs.AI·

Barriers for Learning in an Evolving World: Mathematical Understanding of Loss of Plasticity

Étude théorique de la perte de plasticité (LoP) en apprentissage profond dans des environnements non-stationnaires. Les auteurs identifient deux mécanismes principaux : saturation d'activation et redondance représentationnelle, qui créent des pièges dans l'espace des paramètres. Paradoxe : les propriétés favorisant la généralisation statique (représentations bas-rang) aggravent la LoP en apprentissage continu.

Reinforcement learningPapersAlignement
SIG
75
HYP
15
arXiv cs.AI·

OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval

OPERA est une architecture de récupération augmentée par génération (RAG) qui couple planification et exécution via apprentissage par renforcement. Un module de planification d'objectifs décompose les questions complexes en sous-objectifs, exécutés par un module Reason-Execute avec composants spécialisés. L'entraînement utilise MAPGRPO, une variante de GRPO. Résultats supérieurs sur benchmarks multi-hop complexes.

RAGReinforcement learningRaisonnement
SIG
75
HYP
25
arXiv cs.AI·

UniER: A Unified Benchmark for Item-level and Path-level Exercise Recommendation

UniER est un benchmark unifié pour la recommandation d'exercices pédagogiques, comparant deux paradigmes : ILER (recommandation au niveau item) et PLER (recommandation de parcours d'apprentissage). Le framework introduit la métrique Weighted Cognitive Gain (WCG) et évalue 18 méthodes sur 9 datasets. Les résultats montrent la supériorité systématique de PLER et les limites d'ILER en contexte de rareté de données.

BenchmarksÉvaluationsPapers
SIG
75
HYP
15
arXiv cs.AI·

Generative AI and the Productivity Divide: Human-AI Complementarities in Education

Une expérience contrôlée randomisée montre que l'accès aux LLM augmente significativement la performance moyenne, mais les gains sont inégalement distribués. La compétence d'interaction IA (capacité à solliciter, filtrer et vérifier les outputs) prédit les bénéfices, pas le GPA. Une intervention de scaffolding (cartes conceptuelles) réduit la variance des résultats.

Reinforcement learningÉvaluationsAlignement
SIG
75
HYP
15
arXiv cs.AI·

Reducing Credit Assignment Variance via Counterfactual Reasoning Paths

Une nouvelle méthode de credit assignment pour l'apprentissage par renforcement avec LLMs. IBPO (Implicit Behavior Policy Optimization) utilise des trajectoires contrefactuelles pour transformer les récompenses terminales éparses en signaux d'apprentissage sensibles aux étapes, réduisant la variance des gradients et améliorant la stabilité sur les benchmarks de raisonnement mathématique et code.

Reinforcement learningRaisonnementGénération de code
SIG
75
HYP
25
arXiv cs.CL·

D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning

D²Evo est un framework RL pour améliorer le raisonnement des LLM. Il résout la rareté des samples de difficulté moyenne en minant des anchors adaptés à la capacité du modèle et en entraînant un Questioner à générer des questions diversifiées. Résultats : surpasse les méthodes existantes sur benchmarks mathématiques avec <2K samples réels.

Reinforcement learningRaisonnementBenchmarks
SIG
75
HYP
25
arXiv cs.AI·

Scheduling That Speaks: An Interpretable Programmatic Reinforcement Learning Framework

ProRL est un framework de reinforcement learning programmatique pour l'optimisation combinatoire (job shop scheduling). Il génère des politiques interprétables sous forme de programmes lisibles via un DSL spécialisé (DSL-S), explorant l'espace des programmes par recherche locale et optimisation bayésienne. Surpasse les heuristiques classiques et baselines DRL avec peu d'épisodes d'entraînement.

Reinforcement learningRaisonnementBenchmarks
SIG
75
HYP
15
arXiv cs.AI·

QSTRBench: a New Benchmark to Evaluate the Ability of Language Models to Reason with Qualitative Spatial and Temporal Calculi

QSTRBench est un benchmark évaluant la capacité des LLM à raisonner sur le calcul spatial et temporel qualitatif (QSTR). Il couvre 9 calculi (Point Algebra, Allen's Interval Algebra, RCC-5/8/22, etc.) avec composition tables, relations inverses et voisinages conceptuels. Les modèles testés surpassent le hasard mais aucun ne répond correctement à tous les cas. RCC-22 s'avère le plus difficile.

BenchmarksRaisonnementÉvaluations
SIG
75
HYP
15
arXiv cs.CL·

The Unlearnability Phenomenon in RLVR for Language Models

Étude révélant un phénomène d'« inapprenabilité » dans l'apprentissage par renforcement avec récompense vérifiable (RLVR) pour LLM. Certains exemples difficiles restent non-apprenables même avec des trajectoires correctes. L'analyse montre des défauts de représentation fondamentaux : faible similarité de gradient et patterns de raisonnement non-généralisables. L'augmentation de données ne résout pas le problème.

Reinforcement learningRaisonnementPapers
SIG
75
HYP
15
arXiv cs.AI·

EmoMind: Decoding Affective Captions from Human Brain fMRI

EmoMind décode des descriptions affectives directes depuis les signaux fMRI du cerveau. Le système récupère d'abord une description neutre de la scène visuelle, puis la réécrit en utilisant un vecteur émotionnel continu de 34 dimensions extrait du même enregistrement fMRI. Évalué sur deux datasets indépendants, EmoMind surpasse GPT-4 avec étiquettes discrètes sur tous les axes de validation.

VisionRaisonnementÉvaluations
SIG
75
HYP
25
arXiv cs.AI·

OCCAM: Open-set Causal Concept explAnation and Ontology induction for black-box vision Models

OCCAM est un framework pour expliquer les décisions des classifieurs d'images en boîte noire via des concepts visuels causaux. Il découvre des concepts en mode open-set, les localise par segmentation guidée par texte, et mesure leur contribution causale par interventions au niveau objet. OCCAM agrège les preuves interventionnelles pour induire une ontologie structurée révélant dépendances et biais systémiques.

VisionÉvaluationsRaisonnement
SIG
75
HYP
15
arXiv cs.AI·

When Efficiency Backfires: Cascading LLMs Trigger Cascade Failure under Adversarial Attack

Les systèmes en cascade d'LLM, conçus pour optimiser efficacité et performance en routant les requêtes complexes vers des modèles puissants, sont vulnérables aux attaques adversariales ciblées. Une nouvelle attaque exploite les modèles légers et les mécanismes de décision interne pour dégrader simultanément la précision et l'efficacité des coûts.

Sécurité IAAgents IABenchmarks
SIG
75
HYP
25
arXiv cs.AI·

HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents

HINT-SD propose une auto-distillation ciblée pour entraîner des agents LLM sur des horizons longs. La méthode utilise l'historique complet de trajectoire pour identifier les actions pertinentes aux échecs et applique la distillation conditionnée par feedback uniquement sur ces segments. Sur BFCL v3 et AppWorld, elle améliore les baselines de 18,80% tout en réduisant le temps par étape d'entraînement de 2,26×.

Agents IAReinforcement learningRaisonnement
SIG
75
HYP
15
arXiv cs.AI·

HTSC-2025: A Benchmark Dataset of Ambient-Pressure High-Temperature Superconductors for AI-Driven Critical Temperature Prediction

HTSC-2025 est un benchmark open-source de matériaux supraconducteurs à haute température découverts entre 2023-2025 (systèmes X₂YH₆, pérovskites MXH₃, M₃XH₈, structures en cage BCN-dopées, honeycomb 2D). Comble le manque de datasets standardisés pour évaluer équitablement les algorithmes IA de prédiction de température critique.

BenchmarksPapersOpen source
SIG
75
HYP
25
arXiv cs.AI·

Training Infinitely Deep and Wide Transformers

Article théorique sur l'entraînement des transformers en régime champ moyen (profondeur et largeur infinies). Les auteurs modélisent l'entraînement comme contrôle d'une PDE neurale (vs ODE pour ResNets), établissent la bonne posture du passage forward, dérivant formules explicites pour les gradients Wasserstein et prouvant convergence du gradient flow vers minima globaux sous conditions d'injectivité du NTK.

RaisonnementPapersBenchmarks
SIG
75
HYP
15
arXiv cs.AI·

When Marginals Match but Structure Fails: Covariance Fidelity in Generative Models

Article théorique sur l'évaluation des modèles génératifs. Les auteurs montrent que les critères standards (marginal matching) ne garantissent pas la préservation de la structure de covariance. Ils introduisent D_Sigma = ||Sigma_P - Sigma_Q||_F pour mesurer la fidélité des dépendances, avec preuves formelles et validation sur Fashion-MNIST VAE, RNA-seq (TCGA-BRCA, n=1111) et données Alzheimer (n=113).

ÉvaluationsPapersBenchmarks
SIG
75
HYP
15
arXiv cs.AI·

An Amortized Efficiency Threshold for Comparing Neural and Heuristic Solvers in Combinatorial Optimization

Article évaluant l'efficacité énergétique des solveurs de combinatoire neuraux vs heuristiques. Définit le seuil d'amortissement (AET) : volume de déploiement où un réseau de neurones compense son coût d'entraînement GPU. Sur CVRP (n=50), le solveur attention-based de Kool et al. (2019) atteint l'équilibre énergétique à ~4560 instances déployées. Ratio neural/heuristique par instance : 2.29e-3.

BenchmarksRaisonnementOpen source
SIG
75
HYP
15
arXiv cs.AI·

StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video

StreamPro introduit StreamPro-Bench, un benchmark évaluant la compréhension proactive de vidéos en streaming selon trois axes : perception, raisonnement temporel et agentivité. Le framework propose une perte CB-Stream pour équilibrer l'imbalance de supervision et applique GRPO avec récompenses multi-niveaux. Résultats : 41.5 sur StreamPro-Bench vs 10.4 précédemment, 78.9 sur StreamingBench-RTVU.

VisionRaisonnementReinforcement learning
SIG
75
HYP
25
arXiv cs.AI·

AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning

AMARIS introduit un système de mémoire persistante pour améliorer les rubriques d'évaluation dans l'entraînement par RL des LLMs. Le système accumule les diagnostics d'évaluation au fil du temps, utilise la récupération statique et dynamique pour contextualiser les modifications de rubriques, et ajoute ~5% de surcharge temporelle. Les expériences montrent des gains constants sur les domaines fermés et ouverts.

Reinforcement learningFine-tuningÉvaluations
SIG
75
HYP
15
arXiv cs.AI·

Focused Forcing: Content-Aware Per-Frame KV Selection for Efficient Autoregressive Video Diffusion

Focused Forcing optimise les caches KV dans la génération vidéo diffusion autorégressive en sélectionnant par frame et par head les frames historiques pertinents. La méthode combine scores d'attention et scores de diversité, atteignant 1.48× d'accélération sans entraînement tout en améliorant la qualité visuelle et l'alignement textuel.

Génération de vidéosRaisonnementÉvaluations
SIG
75
HYP
15