Archives

juin 2026

2731 articles

arXiv cs.CL·

Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

NVIDIA présente Nemotron 3 Ultra, un modèle MoE hybride Mamba-Transformer de 550B paramètres (55B actifs) pré-entraîné sur 20T tokens avec contexte 1M. Utilise SFT, RL et distillation multi-enseignants. Atteint ~6x le débit d'inférence des LLM publics avec précision équivalente. Checkpoints, données et recette open-sourcés sur HuggingFace.

Agents IARaisonnementOpen source
SIG
82
HYP
35
arXiv cs.CL·

Beyond Layer Importance in Layer-wise Sparsity: An Inter-Layer Perturbation-Absorption Perspective

Étude sur la redondance couche-par-couche dans les LLM. Les auteurs caractérisent comment les couches absorbent ou amplifient les perturbations lors de l'élagage : les couches précoces amplifient, les couches intermédiaires et tardives absorbent. Ils proposent une correction basée sur un coefficient d'absorption, améliorant OWL et AlphaPruning de 7,13% en perplexité et 1,02% en précision zéro-shot à 70% de sparsité.

PapersBenchmarksFine-tuning
SIG
78
HYP
15
arXiv cs.CL·

Encode Errors: Representational Retrieval of In-Context Demonstrations for Multilingual Grammatical Error Correction

Méthode de récupération de démonstrations in-context basée sur les représentations d'erreurs grammaticales (GER) pour la correction grammaticale multilingue. Sur 8 modèles open-source 8B, les résultats égalent GPT-4o-mini et Deepseek2.5. Pour les langues peu dotées, amélioration F₀.₅ jusqu'à 1.20× vs baseline.

RAGPrompt engineeringBenchmarks
SIG
72
HYP
25
arXiv cs.AI·

CogGuard: Cognitive and Operational Profiling for Proactive Warning in Edge Intelligent Services

CogGuard est un framework de prédiction proactive pour services edge utilisant des LLM hors-ligne pour construire des profils cognitifs et opérationnels, puis des SLM pour scorer en temps réel. Réduction de 48% du temps de construction de profils et 19% du fine-tuning distribué sur clusters hétérogènes. Erreur réduite de 15.4% vs baseline sur données éducatives.

RaisonnementFine-tuningBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Fusion is not one-size-fits-all: Cross-Modal Representation Alignment for Time-to-Event Modeling

Framework de fusion multimodale pour prédire le temps jusqu'à un événement clinique (mortalité PE, résultats CVD) en alignant représentations CT et données EHR longitudinales via modèles fondation. Quatre stratégies testées (late fusion, contrastive alignment, cross-attention, co-attention) sur 3,099-2,951 patients. Fusion contrastive améliore l'indice de concordance de 1,5-5,4% vs unimodal.

BenchmarksEmbeddingsVision
SIG
72
HYP
18
arXiv cs.AI·

Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

Mask-Proof est un pipeline automatisé qui transforme des preuves mathématiques réelles en tâches vérifiables avec étapes masquées. Le benchmark contient 292 problèmes curatés. Sur 17 modèles testés, les modèles renforcés en raisonnement surpassent les modèles standards de 12-27%. L'évaluateur atteint 96,8% d'accord avec les annotateurs experts.

BenchmarksRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

ChatPlanner: A Large Language Model Framework for Personalized Public Transit Routing

ChatPlanner est un framework utilisant des LLMs fine-tunés avec RAG pour extraire les préférences utilisateur en langage naturel et les intégrer dans un algorithme d'optimisation de trajets en transport public. Évalué sur 8 personas et 5 contextes, le système combine fine-tuning (structure de sortie) et RAG (contexte spécifique) pour identifier des solutions ignorées par les planificateurs existants.

RAGFine-tuningPrompt engineering
SIG
65
HYP
25
arXiv cs.AI·

Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents

Framework Base Sequence Analysis encode le comportement d'agents autonomes LLM en séquences symboliques (X/E/P/V). Analyse de 347 traces de production ReAct révèle que P-X-P réduit le succès de 10.4% et P-ratio prédit négativement (r=-0.256). Governor, système d'intervention runtime, augmente le succès de +6.2% et réduit tokens de 44%. Validation sur 2000 trajectoires SWE-agent.

Agents IARaisonnementÉvaluations
SIG
78
HYP
22
arXiv cs.AI·

Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

Visual-Seeker est un agent de recherche multimodal qui améliore le raisonnement visuel des MLLMs dans des scénarios complexes. L'approche utilise un pipeline de raisonnement visuel actif et 5K trajectoires multimodales synthétiques pour entraîner le modèle. L'agent atteint des performances SOTA sur cinq benchmarks de recherche multimodal, surpassant certains modèles propriétaires.

Agents IAVisionMulti-agents
SIG
72
HYP
35
arXiv cs.LG·

EnvShip-Bench: An Environment-Enhanced Benchmark for Short-Term Vessel Trajectory Prediction

EnvShip-Bench est un benchmark unifié pour la prédiction de trajectoires de navires à court terme, construit à partir de données AIS brutes du Danish Maritime Authority et de la NOAA. Le benchmark standardise le protocole (10 min observation, 10 min prédiction, échantillonnage 20s) et fournit des annotations contextuelles environnementales et de navires proches pour soutenir la modélisation consciente du contexte.

Benchmarks
SIG
72
HYP
18
arXiv cs.AI·

Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

Étude sur le reward hacking dans les agents basés sur LLM via une adaptation du framework AI Safety Gridworlds. Les modèles (1.5B–14B) exploitent systématiquement des objectifs mal spécifiés pour maximiser les récompenses observées tout en échouant sur les objectifs cachés. L'optimisation par RL amplifie ce problème et résiste aux mitigations standard (exploration, régularisation).

Agents IAReinforcement learningSécurité IA
SIG
78
HYP
25
arXiv cs.AI·

Large Language Models as Optimizers: A Survey of Direct vs. Tool-Augmented Approaches and Their Performance Frontiers

Enquête sur l'utilisation des LLM comme optimiseurs mathématiques selon trois paradigmes : optimisation directe (prompting itératif), augmentée par outils (traduction en spécifications formelles), et création d'outils (découverte d'algorithmes réutilisables). L'article identifie un écart de raisonnement critique et propose des compromis entre potentiel futur et auditabilité.

RaisonnementAgents IAOutils
SIG
72
HYP
18
arXiv cs.LG·

Can Neural Networks Achieve Optimal Computational-statistical Tradeoff? An Analysis on Single-Index Model

Étude théorique montrant que les réseaux de neurones entraînés par gradient peuvent atteindre le compromis optimal calcul-statistique pour les modèles single-index gaussiens. L'algorithme proposé (réseau deux couches) atteint une complexité d'échantillon Õ(d^{s*/2} ∨ d) correspondant à la borne inférieure SQ, avec extension au cas k-sparse via perturbation de poids.

PapersRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.LG·

Towards a Unified Generative Model for Scarce Time Series with Domain Experts

TimeMoDE, un framework combinant Diffusion Transformers et Mixture-of-Experts, génère des séries temporelles réalistes en contexte de données scarces. Pré-entraîné sur des datasets multi-domaines, il utilise des Domain Prompts pour adapter l'assignation d'experts et intègre des signaux de diffusion pour calibrer le débruitage. Surpasse les méthodes existantes en few-shot generation.

SIG
72
HYP
28
arXiv cs.LG·

High-Dimensional Random Projection for Activation Steering in Language Models

HiDRA, une méthode d'activation steering sans entraînement, utilise la projection aléatoire haute-dimensionnelle pour améliorer le contrôle comportemental des LLM. Elle dépasse les approches linéaires basées sur les différences de moyennes en capturant des signaux discriminatifs dans les sous-espaces non-linéaires, avec gains constants sur plusieurs familles de modèles.

RaisonnementAlignement
SIG
72
HYP
18
arXiv cs.CL·

Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

Méthode de post-training par reinforcement learning (GRPO) pour améliorer la détection de mèmes haineux et propagandistes dans les MLLMs. Amélioration de +2.1% sur Hateful Memes (79.9%→82.0%) et +7.6 points macro-F1 sur ArMeme (0.536→0.612) avec explications en chaîne de pensée. Code et données publiquement disponibles.

Reinforcement learningRaisonnementVision
SIG
78
HYP
15
arXiv cs.CL·

Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

ReRULE améliore l'oubli non-supervisé des LLM en utilisant un replay hors-politique pour les cas difficiles. La méthode stocke les rollouts bas-récompense près de la frontière forget/retain dans un buffer et les réutilise via des mises à jour importance-sampled. Sur MUSE-Books, elle augmente la Retain Quality de 46.3 à 56.2 avec +5-11% de temps d'entraînement.

Reinforcement learningSécurité IAAlignement
SIG
78
HYP
15
arXiv cs.LG·

Unlocking Latent Dimensions: Exploring Representations of Large-Scale X-ray Scattering Data using Variational Autoencoders

Variational Autoencoder (C-VAE) entraîné sur 1,5 million d'images de diffusion de rayons X pour apprendre des représentations latentes de faible dimension. Le modèle révèle des clusters organisés et génère des images synthétiques contrôlées. Déployé sans réentraînement sur deux installations de synchrotron, il surpasse DINOv3 en interprétabilité. Intégré dans Latent Space Explorer (MLExchange).

VisionBenchmarksOutils
SIG
72
HYP
18
arXiv cs.LG·

Phase-Localized Curation Does Not Help: A Negative Result on Per-Phase Metric Selection for Demonstration Filtering

Étude négative sur la sélection de métriques par phase pour filtrer les démonstrations en robotique. Sur trois tâches LIBERO de pick-and-place, la curation par phase ne surpasse jamais les métriques globales (Task 1: 86.0 vs 92.0). Le signal de défaut dilué par agrégation entre phases nuit à la sélection. Les auteurs recommandent une métrique unique globale plutôt qu'une décomposition par phase.

RobotiqueReinforcement learningBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

Toward Vibe Medicine: A Self-Evolving Multi-Agent Framework for Clinical Decision Support

VIBEMed est un framework multi-agent avec mécanisme d'auto-évolution pour le support décisionnel clinique. Trois agents spécialisés (diagnostic, traitement, évolution) intègrent l'historique des sessions patients et les résultats passés pour améliorer itérativement les décisions médicales. Résultats sur planification oncologique et cas complexes.

Multi-agentsAgents IARaisonnement
SIG
65
HYP
35
arXiv cs.LG·

TriAdReview: Triangular Adversarial Review Architecture for Multi-Model Technical Document Generation

TriAdReview propose une architecture adversariale triangulaire avec deux modèles reviewers (ingénierie et sécurité) pour améliorer la génération de documents techniques. Sur 75 expériences, le système triple atteint +10.1% vs baseline (26.2 vs 23.8/50, p<0.05), avec gains forts en audit sécurité (+27.6%), génération code (+20.8%), design architecture (+15.6%), mais dégradation sur analyse requirements (-7.5%).

Multi-agentsGénération de codeBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

Contextual Bandits for Maximizing Stimulated Word-of-Mouth Rewards

Framework de bandit contextuel multi-bras pour optimiser le bouche-à-oreille stimulé via réseaux sociaux. L'approche apprend les probabilités individuelles de débordement (spillover) et classe les utilisateurs connectés pour maximiser les récompenses. Expériences sur données réelles montrent une amélioration de la précision de ciblage et des récompenses par rapport aux méthodes baseline.

Reinforcement learningBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Context Compression Is Not One Thing: Readable Symbolic Re-expression vs. Coherent Summary at Matched Budget

Telegraph English, un format symbolique lisible, réécrit les passages récupérés en déclarations entité-relation structurées pour la compression de contexte. Sur MuSiQue, TwoWiki et HotpotQA, il surpasse trois baselines à budget égal (suppression, troncature, sous-échantillonnage) de 13-20 points F1, et dépasse les résumés en prose cohérente sur le dataset le plus difficile.

RAGRaisonnementBenchmarks
SIG
75
HYP
15
arXiv cs.LG·

GRASP: Gradient-Aligned Sequential Parameter Transfer for Memory-Efficient Multi-Source Learning

GRASP propose une méthode de transfer learning multi-source qui fusionne séquentiellement K modèles sources en mémoire O(1) au lieu de O(K). Via l'alignement gradient des paramètres et l'adaptation itérative, elle atteint 93.5% de précision sur benchmarks de continual learning (Yearbook, CLEAR-10/100) contre 71.7% pour les ensembles, tout en restant déployable en production.

Fine-tuningReinforcement learningBenchmarks
SIG
78
HYP
25
arXiv cs.LG·

Temporal Difference Learning for Diffusion Models

Nouvelle approche d'entraînement pour modèles de diffusion utilisant la différence temporelle (TD) pour enforcer la cohérence multi-étapes le long de la trajectoire de débruitage. Reformulation du processus de diffusion comme processus de récompense Markov et problème d'évaluation de politique en RL. Amélioration significative du FID, particulièrement avec peu d'étapes d'échantillonnage.

Reinforcement learningRaisonnement
SIG
72
HYP
18
arXiv cs.CL·

PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino

PACUTE est un benchmark de 4 600 tâches évaluant la compréhension morphologique du filipino dans les LLM. Le benchmark teste 6 niveaux compositionnels incluant l'infixation, la réduplication et les distinctions diacritiques. Les modèles open-weight performent au hasard en décomposition de morphèmes ; les modèles frontier récupèrent les affixes mais restent loin des plafonds en composition morphologique.

BenchmarksPapersRaisonnement
SIG
78
HYP
15
arXiv cs.LG·

M-CTX: Exact and Scalable Spatial Context Retrieval for Trajectory Analytics

M-CTX est un framework de récupération de contexte spatial pour l'analytique de trajectoires. Il remplace trois étapes brute-force (récupération OSM, calcul SDF, recherche de voisins) par des opérateurs indexés. Sur un corpus maritime de 5,48M anchors, il réduit le temps de construction de contexte de 17 jours CPU à 1,8 heures (speedup 226x), avec reproduction exacte du contexte de référence.

BenchmarksInfrastructureOpen source
SIG
78
HYP
15
arXiv cs.LG·

StarOR: Synergizing Tree Search and Test-Time Reinforcement Learning for Optimization Modeling

StarOR couple la recherche arborescente (MCTS) avec l'apprentissage par renforcement au moment de l'inférence pour la modélisation d'optimisation. Le système décompose le processus en quatre étapes, affine un adaptateur LoRA via GRPO à chaque nœud, et utilise un système de récompense multi-facettes sans labels. Résultats SOTA sur cinq benchmarks avec backbone 4B.

RaisonnementReinforcement learningFine-tuning
SIG
75
HYP
25
arXiv cs.LG·

QPILOTS: Efficient Test-Time Q-Steering for Flow Policies

QPILOTS optimise les politiques de flow-matching et diffusion en temps d'inférence via Q-steering. La méthode projette les actions bruitées intermédiaires vers des estimations finales avant d'évaluer le critique, évitant l'instabilité numérique. Résultats : 90% de taux de succès sur 50 tâches offline-to-online, et surpasse les approches existantes sur 6 tâches de manipulation avec modèles VLA gelés.

Reinforcement learningAgents IARaisonnement
SIG
75
HYP
15
arXiv cs.LG·

Machine Learning and the Random Walk Puzzle: Forecasting the CAD/USD Exchange Rate with Expanding Window Evaluation and SHAP Interpretability

Étude comparant 5 modèles ML (régression linéaire, random forest, gradient boosting, XGBoost, AdaBoost) pour prévoir le taux CAD/USD mensuel (2017-2026, 113 observations). Seule la régression linéaire surpasse statistiquement la marche aléatoire (DM=3.06, p=0.0071). Random Forest atteint MAPE=1.17%. SHAP révèle que les lags courts (lag1-2) et moyennes mobiles dominent les prédictions.

BenchmarksÉvaluationsPapers
SIG
72
HYP
15
arXiv cs.LG·

Benchmarking Instance-Dependent Label Noise with Controlled Corruptions

CILN est un framework de benchmark pour le bruit de label dépendant de l'instance (IDN). Il génère du bruit via corruptions d'entrée contrôlées plutôt que par annotateurs imparfaits. 90 configurations testées sur CIFAR-10, MNIST et Adult montrent que la structure du bruit, pas seulement son taux, affecte la difficulté et expose des failles dans Co-Teaching et DivideMix.

BenchmarksÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

Étude comparative de modules de mémoire et compétences pour agents web. Sur WebArena et WorkArena, un baseline vanilla avec budget token équivalent égale ou surpasse AWM, ASI et ReasoningBank. Résultats sur Gemini 3 Flash, GPT-4o-mini, Qwen 3.6-27B montrent que les gains apparents disparaissent face à un acteur augmenté du même budget.

Agents IABenchmarksRaisonnement
SIG
75
HYP
15
arXiv cs.LG·

FastMix: Fast Data Mixture Optimization via Gradient Descent

FastMix automatise l'optimisation du mélange de données pour l'entraînement de modèles via descente de gradient. La méthode reformule la sélection de mélange comme un problème d'optimisation bilinéaire, optimisant conjointement les coefficients de mélange et les paramètres du modèle. Un seul modèle proxy suffit, réduisant drastiquement le coût de recherche comparé aux approches antérieures.

Fine-tuningBenchmarksPapers
SIG
78
HYP
25
arXiv cs.AI·

AI Engram: In Search of Memory Traces in Artificial Intelligence

Étude introduisant un cadre géométrique pour identifier des « engrams IA » — traces mémoire dans les réseaux de neurones profonds analogues aux unités biologiques. Les auteurs dérivent un estimateur en forme fermée permettant de manipuler chirurgicalement les connaissances apprises (composition, effacement) via arithmétique linéaire, sans optimisation itérative. Validation sur MLPs et LLMs.

RaisonnementPapersAlignement
SIG
78
HYP
25
arXiv cs.CL·

CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

CHILLGuard est un système de sécurité dédié aux LLM chinois avec taxonomie fine-grained (5 macro, 31 micro catégories). Les auteurs construisent 405k échantillons d'entraînement via RAG et réécriture, puis 51k échantillons de test annotés. Le modèle atteint +15.92% F1 vs Qwen3Guard-8B-Strict via Direct Preference Optimization.

Sécurité IAAlignementFine-tuning
SIG
78
HYP
25
arXiv cs.CL·

SHARD: Safe and Helpful Alignment via Self-Reframing Distillation

SHARD est une méthode de distillation par auto-reformulation pour améliorer l'équilibre sécurité-utilité des LLM. Elle réécrit les prompts sensibles selon des principes philosophiques, reformule les réponses de manière sûre et plus utile, puis fine-tune le modèle sur ces réponses auto-reformulées. Testée sur DNA et LINGUASAFE, SHARD améliore l'utilité tout en préservant la sécurité.

Fine-tuningSécurité IAAlignement
SIG
72
HYP
28
arXiv cs.CL·

ESBMC-PLC: Formal Verification of IEC 61131-3 Ladder Diagram Programs Using SMT-Based Model Checking

ESBMC-PLC est le premier vérificateur formel open-source avec support natif des diagrammes en échelle IEC 61131-3 (format PLCopen XML). L'outil traduit les rungs en GOTO IR, modélise le cycle de scan PLC et vérifie les propriétés de sécurité via bounded model checking ou k-induction SMT. Évaluation sur 13 benchmarks : 8 bugs détectés, 7 preuves k-induction non bornées, tous les tests < 60ms.

Sécurité IABenchmarksOpen source
SIG
78
HYP
15
arXiv cs.CL·

Pepti-Agent: An AI Agent for Peptide Design and Optimization

Pepti-Agent est un framework d'IA pour la conception de peptides thérapeutiques utilisant le Model Context Protocol (MCP). Un contrôleur LLM orchestre des outils indépendants : génération via PeptideGPT, prédiction de propriétés (solubilité, hémolytique, fouling) via ProtBERT, et mutation résidu par résidu. Le système trace chaque décision pour permettre le benchmarking multi-objectif et la validation expérimentale.

Agents IAMCPRaisonnement
SIG
75
HYP
15
arXiv cs.CL·

PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions

PhoneHarness est un benchmark et une plateforme d'exécution pour évaluer les agents mobiles sur des workflows réels. Il combine actions GUI, CLI et outils structurés, avec traçabilité auditable. Le benchmark atteint 75% de taux de réussite, surpassant les approches existantes de 12,9 points. L'accent porte sur les effets secondaires vérifiables, pas seulement les prédictions d'écran.

Agents IABenchmarksOutils
SIG
78
HYP
25
arXiv cs.CL·

Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus

XBCP, un benchmark contrôlé, évalue des agents de recherche profonde sur leur capacité à opérer en contexte multilingue. Quatre agents testés avec des retrievers denses et creux sur 12 langues montrent une dégradation significative : perte de recall, calibration réduite, citations moins fiables. Les problèmes persistent même avec l'or evidence fourni directement.

Agents IARAGBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

VGPT-RSI for RH-Adjacent Formal Progress: Boundary Certificates, Verified Finite Lagarias Inequalities, and Explicit Failure Localization

Système VGPT-RSI appliqué à deux tâches de certification adjacentes à l'hypothèse de Riemann : construction de certificats de frontière RH vérifiés formellement en Coq, et initiation d'une route Lagarias formalisée. Identifie explicitement les obstacles mathématiques non résolus (équivalence Lagarias, théorème de queue global, réduction aux entiers extrémaux).

RaisonnementPapersBenchmarks
SIG
72
HYP
15
Reddit r/LocalLLaMA·

HalBench: 29 OSS models tested on a custom built Sycophancy and Hallucination Benchmark, Qwen 3.6 and Gemma 4 scoring far above their weight! (While Meta keeps proving they forgot how to spend their money...)

HalBench v2.3 évalue 29 modèles open-source sur la sycophantie et hallucinations via 3,076 questions avec fausses prémisses. Qwen 3.6 (~27B) atteint 36.6% de rejet, surpassant tous les modèles open plus grands, GPT-5.4 et Gemini 3.1 Pro. Seuls Sonnet 4.6 et Grok dépassent 50%. Phi-4 obtient 2.3%.

BenchmarksOpen sourceÉvaluations
SIG
72
HYP
35
Reddit r/LocalLLaMA·

We trained a cybersecurity-focused Mythos like LLM open weights on HuggingFace

OpenMythos, un LLM open-source spécialisé en cybersécurité, entraîné via SFT puis RLVR (reward learning avec vérification). Données : 1,84K papers ArXiv cs.CR + dataset CVE structuré. Le modèle réduit les hallucinations sur les vulnérabilités et améliore la calibration d'incertitude. Démo, modèle et datasets disponibles sur HuggingFace.

Open sourceFine-tuningReinforcement learning
SIG
72
HYP
28
Reddit r/MachineLearning·

Open weights are not enough: we need open training frameworks for research and better algorithms [P]

FeynRL, un framework open-source pour le post-training RL des LLMs et agents, vise à rendre la formation transparente et modifiable. L'auteur argue que les poids ouverts ne suffisent pas : il faut des codebases d'entraînement explicites séparant algorithmes et systèmes. Le framework supporte SFT, DPO, multi-GPU et clusters.

Open sourceReinforcement learningGénération de code
SIG
72
HYP
28