Page 95 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Investigation into In-Context Learning Capabilities of Transformers

Étude empirique systématique des capacités d'apprentissage en contexte des transformers sur des tâches de classification binaire Gaussienne. Les auteurs analysent comment la précision dépend de la dimension d'entrée, du nombre d'exemples en contexte et de la diversité des tâches d'entraînement. Ils caractérisent l'émergence du surapprentissage bénin et identifient les régions paramétriques critiques.

RaisonnementBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

MindMelody: A Closed-Loop EEG-Driven System for Personalized Music Intervention

MindMelody est un système fermé en temps réel qui génère de la musique personnalisée à partir de signaux EEG. Un modèle Transformer-GNN décode l'EEG en états émotionnels (Valence-Arousal), un LLM avec RAG formule des plans d'intervention, et un contrôleur EEG hiérarchique guide la synthèse audio. Une boucle de rétroaction continue adapte les paramètres selon l'EEG de l'utilisateur.

RaisonnementRAGGénération de code
SIG
72
HYP
35
arXiv cs.AI·

Experiment-as-Code Labs: A Declarative Stack for AI-Driven Scientific Discovery

Experiment-as-Code Labs propose un paradigme où les expériences scientifiques sont encodées en configurations déclaratives compilables vers des APIs d'instruments. Les agents IA formulent des hypothèses, un système effectue analyses de programme et orchestration, puis les expériences s'exécutent via contrôle d'équipements physiques. Stack générique science/lab/instrument-agnostique.

Agents IAPapersRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

When Does Non-Uniform Replay Matter in Reinforcement Learning?

Étude sur l'efficacité du replay non-uniforme en RL off-policy. Les auteurs identifient trois facteurs clés : volume de replay, récence des transitions et entropie de la distribution d'échantillonnage. Ils proposent Truncated Geometric replay, qui privilégie les expériences récentes tout en maintenant haute entropie, améliorant l'efficacité d'échantillonnage en régimes bas-volume.

Reinforcement learningBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

How Wrong Can Your Counterfactual Be? Quantifying Confounding Bias for Continuous Treatments without a Control Group

Framework de causal inference pour stress testing financier en données de panel avec traitement continu sans groupe contrôle. Propose une enveloppe de confounding en forme fermée paramétrée par deux sensibilités, combine identification partielle et conformal prediction pondérée. Montre que modèles prédictifs standard restent biaisés causalement sur données de chômage US.

RaisonnementBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction

Les pipelines RL asynchrones pour agents LLM perdent les anciens logits historiques nécessaires à la correction off-policy PPO, entrelançant correction de discordance et correction de staleness. L'article propose trois stratégies d'acquisition (snapshot, modèle dédié, interruption) et une méthode PPO-EWMA approximée pour préserver la sémantique de correction découplée.

Agents IAReinforcement learningRaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Embracing Biased Transition Matrices for Complementary-Label Learning with Many Classes

Les méthodes d'apprentissage par étiquettes complémentaires (CLL) restent limitées aux classifications à 10 classes. Cet article propose BICL, un cadre qui utilise intentionnellement des matrices de transition biaisées (non-uniformes) pour restreindre les étiquettes complémentaires. Sur CIFAR-100 et TinyImageNet-200, BICL améliore la précision de plus de 7× par rapport aux méthodes traditionnelles.

PapersBenchmarksÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

Expectation and Acoustic Neural Network Representations Enhance Music Identification from Brain Activity

Des chercheurs montrent que combiner des représentations acoustiques et prédictives d'un réseau de neurones artificiels améliore l'identification musicale à partir d'activité cérébrale (EEG). Les modèles préentraînés sur ces deux types de représentations surpassent les baselines et leurs gains sont complémentaires. Cette approche ouvre la voie à des modèles EEG génériques fondés sur les principes du codage cortical.

ÉvaluationsRaisonnement
SIG
72
HYP
18
arXiv cs.CL·

A Scalable Tool for Measuring Manner and Result Verbs in Developmental Language Research

Outil computationnel pour classifier les verbes de manière et de résultat à grande échelle. Utilise des prompts linguistiques avec LLM pour générer des annotations sur MASC et InterCorp (436 classes VerbNet). Classifier RoBERTa atteint 89,6% de précision sur trois datasets gold-standard. Applicable à la recherche développementale sur la sémantique verbale.

PapersBenchmarksFine-tuning
SIG
72
HYP
15
arXiv cs.AI·

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

Nouvel benchmark DDR-Bench évalue l'intelligence investigatrice des LLM : capacité autonome à explorer des bases de données et extraire insights sans requête explicite. Les modèles frontière montrent une agentivité émergente mais peinent sur l'exploration long-horizon. L'étude distingue intelligence investigatrice (fixer ses propres buts) vs exécutionnelle (compléter des tâches assignées).

Agents IABenchmarksRaisonnement
SIG
72
HYP
28
arXiv cs.CL·

Effort as Ceiling, Not Dial: Reasoning Budget Does Not Modulate Cognitive Cost Alignment Between Humans and Large Reasoning Models

Les grands modèles de raisonnement (LRM) génèrent des traces alignées avec les temps de réaction humains, mais cet alignement persiste indépendamment du budget de raisonnement en inférence. Étude sur GPT-OSS-20B et GPT-OSS-120B : l'allocation de tokens suit les patterns de difficulté humains et reste invariante across effort levels, suggérant que l'alignement cognitif est figé au training time.

RaisonnementBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games

GVGAI-LLM est un benchmark de jeux vidéo pour évaluer le raisonnement spatial et la résolution de problèmes des LLM. Basé sur le framework General Video Game AI, il contient 118 jeux en ASCII testant la planification et le raisonnement logique. Les évaluations zéro-shot révèlent des limitations persistantes des modèles actuels en raisonnement spatial, partiellement améliorées par prompting structuré.

BenchmarksRaisonnementAgents IA
SIG
72
HYP
25
arXiv cs.AI·

SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models

SIPO stabilise l'alignement des modèles de diffusion sur les préférences humaines en résolvant l'instabilité d'entraînement et le biais off-policy. La méthode introduit DPO-C&M pour clipper les timesteps non-informatifs et un schéma de pondération par importance conscient des timesteps. Tests sur SD1.5, SDXL, CogVideoX-2B/5B et Wan2.1-1.3B montrent amélioration vs Diffusion-DPO.

Génération d'imagesGénération de vidéosReinforcement learning
SIG
72
HYP
18
arXiv cs.AI·

Catastrophic Overfitting, Entropy Gap and Participation Ratio: A Noiseless $l^p$ Norm Solution for Fast Adversarial Training

Article arXiv proposant une solution au surapprentissage catastrophique (CO) en entraînement adversarial rapide. Les auteurs contrôlent la norme lp d'entraînement plutôt que d'ajouter du bruit ou de la régularisation. Ils quantifient la concentration de gradient via le Participation Ratio et l'entropie, développant un FGSM-lp adaptatif qui ajuste automatiquement la norme d'entraînement.

Sécurité IAAlignementBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Taming "Zombie'' Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution

AgentRevive propose un cadre Markov pour l'évolution résiliente de systèmes multi-agents LLM. Au lieu de supprimer agressivement les agents défaillants, la méthode utilise des transitions d'état souples (Actif/Standby/Terminé) avec un estimateur de risque d'hallucination. Résultats : surpasse les baselines sur raisonnement général, tâches spécialisées et défis d'hallucination, réduisant la consommation de tokens.

Multi-agentsAgents IARaisonnement
SIG
72
HYP
25
arXiv cs.AI·

Action-Gradient Monte Carlo Tree Search for Non-Parametric Continuous (PO)MDPs

Action-Gradient MCTS (AGMCTS) combine recherche arborescente globale et optimisation d'actions par gradient local pour la planification en ligne dans des espaces continus. Trois contributions théoriques : théorème de gradient de score d'action, arbre MIS pour réutiliser les échantillons, gradients tractables via formule d'aire. Surpasse les solveurs basés sur l'échantillonnage sur benchmarks MDP/POMDP continus.

RaisonnementReinforcement learningPapers
SIG
72
HYP
18
arXiv cs.AI·

Representational Alignment with Chemical Induced Fit for Molecular Relational Learning

ReAlignFit, une méthode d'apprentissage relationnel moléculaire, améliore la stabilité des modèles en alignant les représentations de sous-structures via un biais inspiré du mécanisme chimique d'ajustement induit. Testée sur 9 datasets, elle surpasse les modèles existants et renforce la robustesse face aux changements de distribution (règles et scaffolds).

PapersBenchmarksRaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Agentic AI Governance and Lifecycle Management in Healthcare

Des chercheurs proposent UALM (Unified Agent Lifecycle Management), un cadre de gouvernance pour les systèmes d'IA agentiques en santé. Le modèle adresse la prolifération d'agents (agent sprawl) via cinq couches de contrôle : registre d'identité, orchestration, gestion des données PHI, application de politiques runtime avec kill-switch, et décommissionnement lié à la révocation de credentials.

Agents IAMulti-agentsSécurité IA
SIG
72
HYP
18
arXiv cs.AI·

Mitigating Extrinsic Gender Bias for Bangla Classification Tasks

Étude sur le biais de genre extrinsèque dans les modèles de langage préentraînés en bengali. Construction de 4 datasets annotés manuellement (analyse de sentiment, détection de toxicité, discours haineux, sarcasme) avec perturbations de genre minimales. Proposition de RandSymKL, stratégie de débiaisage combinant divergence KL symétrique et perte cross-entropy, réduisant le biais tout en maintenant la précision.

BenchmarksSécurité IAAlignement
SIG
72
HYP
15
arXiv cs.CL·

AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering

AMATA est un framework multi-agent adaptatif pour le question-answering intensif en connaissances. Six agents spécialisés collaborent via des actions structurées pour améliorer la cohérence factuelle et réduire les hallucinations. Le système formalise la collaboration comme un problème d'alignement de trajectoires avec apprentissage des préférences intra et inter-agents.

Agents IAMulti-agentsRaisonnement
SIG
72
HYP
28
arXiv cs.CL·

Beyond Transcripts: Iterative Peer-Editing with Audio Unlocks High-Quality Human Summaries of Conversational Speech

Étude comparative de 10 workflows d'annotation pour la résumé de parole conversationnelle. Les résumés basés sur audio sont moins informatifs que ceux basés sur transcripts, mais l'édition itérative par pairs avec audio compense cette différence. Validation de cette approche pour créer des benchmarks intégrant informations lexicales et prosodiques.

BenchmarksVoixÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

Support-Safe Variational Hybrid Filtering for Contact-Mode and Sparse-Law Recovery

VHYDRO est un filtre variationnel hybride pour la dynamique robotique en contact. Il prévient la perte de branches en mélangeant la proposition apprise avec une loi de transition réalisable avant l'échantillonnage. Le modèle infère conjointement un état latent continu et un mode de contact discret, récupérant des lois port-hamiltoniennes éparses par régime.

RobotiqueRaisonnementPapers
SIG
72
HYP
15