Page 82 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Differentiable Belief-based Opponent Shaping

D-BOS (Differentiable Belief-based Opponent Shaping) est une méthode MARL qui façonne les adversaires en différenciant à travers les dynamiques de croyance bayésienne softmax sur k étapes. Contrairement aux approches existantes, elle traite l'état de croyance comme cible de façonnage plutôt que les paramètres ou politiques. Résultats : surpasse PPO et BBM dans les jeux à rôles cachés, notamment en contextes mixtes.

Multi-agentsReinforcement learningRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

Harmonizing Real-Time Constraints and Long-Horizon Reasoning: An Asynchronous Agentic Framework for Dynamic Scheduling

RACE-Sched, un framework multi-agent asynchrone, résout le problème d'ordonnancement dynamique en découplant exécution temps-réel (heuristiques symboliques) et raisonnement long-horizon (LLM). Un dépôt sémantique de règles validées améliore la transferabilité. Surpasse les baselines Deep RL et LLM sur GEN-Bench, MK-Bench, JMS-Bench.

Agents IAMulti-agentsRaisonnement
SIG
72
HYP
28
arXiv cs.LG·

Cycle-Space Informed Detection of Autoencoded Blind False Data Injection Attacks on Power Systems

Détection d'attaques par injection de fausses données sur réseaux électriques via un détecteur informé par l'espace cyclique. Les auteurs proposent une méthode robuste contre les attaques d'autoencodeurs qui exploitent l'espace nul des mesures, en utilisant les contraintes topologiques du réseau et la base de cycles minimale pour améliorer la détection.

Sécurité IABenchmarksPapers
SIG
72
HYP
15
arXiv cs.LG·

CosmicFish-HRM: Adaptive Reasoning via Hierarchical Recurrent Mechanisms in Compact Language Models

CosmicFish-HRM est un modèle compact avec un module de raisonnement hiérarchique (HRM) qui alloue dynamiquement l'effort computationnel pendant l'inférence. Le modèle apprend à arrêter selon la complexité de l'entrée, combinant cycles de raisonnement haut/bas niveau avec Grouped Query Attention, RoPE et SwiGLU. Les résultats montrent un comportement de raisonnement non-uniforme adapté aux tâches.

RaisonnementFine-tuningBenchmarks
SIG
72
HYP
25
arXiv cs.LG·

Return-to-Go Is More Than a Number: Q-Guided Alignment for Return-Conditioned Supervised Learning

Q-ALIGN DT aligne les modèles de séquences conditionnés en garantissant que la valeur Q de la politique correspond au return-to-go (RTG) d'entrée. La méthode utilise une fonction Q pour guider l'apprentissage et un fine-tuning par perturbation RTG. Résultats : meilleure contrôlabilité sur D4RL et généralisation à des tâches comme le velocity-tracking.

Reinforcement learningRaisonnementBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

Parallel Adaptive Multi-Objective Evolutionary Learning of Discretized Bayesian Network Classifiers for Clinical Data

Baymex, algorithme évolutionnaire multi-objectif, apprend des réseaux bayésiens discrets pour la classification clinique. Parallélisé sur 16 cœurs (speedup 54×), il optimise cross-entropy et complexité BIC. Sur données réelles (RADCURE, SUPPORT), il égale ou surpasse arbres de décision, régression logistique et forêts aléatoires, tout en produisant modèles interprétables.

Benchmarks
SIG
72
HYP
15
arXiv cs.CL·

Micro-Macro Retrieval: Reducing Long-Form Hallucination in Large Language Models

M2R (Micro-Macro Retrieval) est un framework retrieve-while-generate qui réduit les hallucinations dans la génération longue des LLM. Il combine une récupération macro (preuves externes) et micro (informations clés du raisonnement) pour maintenir la proximité entre données factuelles et sorties. Entraîné par reinforcement learning avec récompenses basées sur des règles.

RAGReinforcement learning
SIG
72
HYP
28
arXiv cs.CL·

Large language models reorganize representational geometry during in-context learning

Étude arXiv sur la géométrie représentationnelle lors de l'apprentissage en contexte (ICL) dans les LLM. Les chercheurs montrent que la performance ICL corrèle avec la structure représentationnelle des tâches et que l'ICL réussi s'accompagne d'une réorganisation géométrique augmentant la séparabilité. Le comportement des LLM suit un algorithme de type prototype.

RaisonnementPapers
SIG
72
HYP
18
arXiv cs.CL·

Error as a Lens: Probing LLM Reasoning through Synthetic Misconception Generation

Framework pour générer des erreurs synthétiques ciblées avec LLM selon une taxonomie cognitive (Bloom révisée). Un Generation Agent produit des solutions erronées, un Examination Agent valide leur cohérence avec le mode d'erreur spécifié. Testé sur TheoremQA, révèle que générer des erreurs authentiques est bien plus difficile que produire des réponses fausses arbitraires.

Agents IAMulti-agentsRaisonnement
SIG
72
HYP
18
arXiv cs.CL·

Structured Prompt Optimization Meets Reinforcement Learning for Global and Local Interpretability over Complex Text

eXTC combine optimisation structurée de prompts et apprentissage par renforcement pour la classification de texte. Le système apprend d'abord un rulebook en langage naturel, puis distille le raisonnement d'un LLM teacher vers un modèle compact, avant d'étendre les capacités via RL. Résultat : inférence rapide avec traces de raisonnement locales et explications globales modulaires.

Prompt engineeringReinforcement learningRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

The Cognitive Categorical Transformer: Category-Theoretic Inductive Biases for Language Modeling

Le Cognitive Categorical Transformer (CCT), modèle de 306M paramètres basé sur GPT-2 Small, intègre des composants inspirés de la théorie des catégories et des sciences cognitives. Sur WikiText-103, CCT atteint 21.27 PPL contre 24.19 pour GPT-2 Small, soit une réduction de 12% (2.92 PPL). Les ablations montrent que le simplicial message passing représente 84% de cette amélioration.

GPTPapersBenchmarks
SIG
72
HYP
25
arXiv cs.AI·

Behavior-Induced Mirror-Prox Temporal-Difference Learning for Faster Off-Policy Prediction

STHTD-MP, une nouvelle méthode de temporal-difference off-policy, remplace la métrique de covariance par la matrice de Bellman induite par la politique de comportement dans la formulation primal-dual. Analyse de convergence formelle et comparaison spectrale avec GTD2-MP montrent des gains potentiels sur benchmarks (Random Walk, Boyan Chain).

Reinforcement learningPapersBenchmarks
SIG
72
HYP
08
arXiv cs.AI·

Behavior-Aware Auxiliary Corrections for Off-Policy Temporal-Difference Prediction

Article théorique sur la stabilisation de l'apprentissage par différence temporelle hors-politique avec approximation de fonction. Propose BA-TDC et BA-TDRC, remplaçant la matrice auxiliaire de TDC par la matrice de Bellman comportementale. Analyse linéaire avec convergence prouvée sous condition de stabilité Hurwitz; expériences sur chaînes de Markov et contres-exemples classiques.

Reinforcement learningPapersBenchmarks
SIG
72
HYP
08
arXiv cs.AI·

Governing Technical Debt in Agentic AI Systems

Article définissant la « dette technique agentique » : accumulation de responsabilités quand prompts, mémoire, schémas d'outils et orchestration sont assemblés plus vite qu'ils ne peuvent être validés. Introduit aussi la « taxe stochastique » : coût opérationnel récurrent pour maintenir le comportement probabiliste des agents dans des limites acceptables. Propose des tableaux de bord légers pour la gouvernance.

Agents IAMulti-agentsSécurité IA
SIG
72
HYP
25
arXiv cs.AI·

The Importance of Out-of-Band Metadata for Safe Autonomous Agents: The Redpanda Agentic Data Plane

Redpanda propose une architecture de plan de données pour agents IA autonomes utilisant des canaux de métadonnées hors-bande. Ces canaux appliquent les politiques de sécurité, les classifications de données et les contraintes comportementales en dehors du chemin de lecture/écriture de l'agent, empêchant les hallucinations et manipulations. Démonstration avec un système multi-agent de rééquilibrage de portefeuille.

Agents IAMulti-agentsSécurité IA
SIG
72
HYP
28
arXiv cs.AI·

BEAMS: Benchmarking and Evaluating AI for Modeling and Simulation

BEAMS établit des benchmarks pour évaluer les outils IA en modélisation et simulation. Le projet open-source sd ai teste plusieurs LLMs sur des tâches comme la traduction causale, l'itération de modèles et le raisonnement causal. Les résultats montrent que les outils IA performent mieux en discussion qualitative qu'en raisonnement causal et correction d'erreurs quantitatives.

BenchmarksÉvaluationsRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

When Models Disagree: Rethinking LLM Evaluation for Public Comment Analysis

Des chercheurs proposent une méthode d'audit basée sur le désaccord entre modèles pour évaluer les LLM utilisés par les agences fédérales pour catégoriser les commentaires publics. Sur 1 260 commentaires USDA analysés avec 4 LLM, la divergence thématique inter-modèles dépasse la variation intra-modèle, et les annotateurs humains introduisent des cadres interprétatifs absents de l'ensemble.

ÉvaluationsRaisonnementRégulation
SIG
72
HYP
18
arXiv cs.AI·

Better Later Than Sooner: Neuro-Symbolic Knowledge Graph Construction via Ontology-grounded Post-extraction Correction

Framework neuro-symbolique pour construire des graphes de connaissances (KG) corrigés post-extraction selon des contraintes ontologiques. Combine extraction ouverte, canonicalization par embedding, et correction LLM ciblée des violations. Réduit les appels LLM et améliore la cohérence du KG pour le QA multi-hop et les opérations symboliques (agrégation, énumération).

RAGRaisonnementEmbeddings
SIG
72
HYP
18
arXiv cs.AI·

Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

Article arXiv proposant une architecture multi-agent avec mémoire sémantique et caching pour réduire les hallucinations LLM. Pipeline à trois étages (FrontEndAgent, SecondLevelReviewer, ThirdLevelReviewer) évalué sur 310 prompts. Résultats : réduction THS de -31,3% à -35,9%, taux de cache hit de 47,3%, réduction de 47% des appels LLM. Pas de réentraînement requis.

Agents IAMulti-agentsSécurité IA
SIG
72
HYP
28
Reddit r/LocalLLaMA·

I built an enforcement layer for AI coding agents using a local knowledge graph and hybrid RAG

Writ est une couche d'application pour agents de codage IA utilisant un graphe de connaissances Neo4j local et RAG hybride. Un pipeline de récupération en 5 étapes (BM25, similarité vectorielle HNSW, traversée de graphe, fusion de rangs réciproques) filtre les règles pertinentes. 30 scripts bash appliquent l'exécution : pas de code sans plan approuvé, tests obligatoires, analyse statique requise.

Agents IAGénération de codeRAG
SIG
72
HYP
25
Reddit r/MachineLearning·

Kept context-switching between arxiv, OpenReview, GitHub, and HuggingFace for every paper, so I built this. Chrome extension + website with everything inline, plus citation graph + SPECTER2 neighbors. 3M papers, free, feedback welcome [P]

Tomesphere : extension Chrome + site web indexant 3M papiers arxiv avec résumés LLM, avis OpenReview, repos GitHub, modèles HuggingFace, graphe de citations et voisins SPECTER2. Gratuit, sans inscription.

PapersOutilsOpen source
SIG
72
HYP
35