Page 102 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

POST: Prior-Observation Adversarial Learning of Spatio-Temporal Associations for Multivariate Time Series Anomaly Detection

POST propose un cadre d'apprentissage adversarial pour la détection d'anomalies dans les séries temporelles multivariées. Le modèle combine des réseaux de neurones graphiques avec une optimisation minimax sur les matrices d'adjacence pour résoudre la sur-généralisation spatiale. Évaluation sur benchmark public et synthétique avec localisation d'anomalies au niveau des canaux.

BenchmarksPapersRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

Can LLMs Think Like Consumers? Benchmarking Crowd-Level Reaction Reconstruction with ConsumerSimBench

ConsumerSimBench, un benchmark construit sur 1 553 sujets de réseaux sociaux chinois et 23 122 critères de réaction, évalue si les LLMs peuvent reconstruire les patterns de réaction réels des consommateurs. Gemini-3.1-Pro couvre seulement 47,8% des critères, révélant un écart majeur entre performance technique et intuition consommateur. Un pipeline multi-agent améliore MiMo-V2.5-Pro de 32,9% à 37,6%.

BenchmarksÉvaluationsMulti-agents
SIG
72
HYP
25
arXiv cs.AI·

Agents for Experiments, Experiments for Agents: A Design Grammar for AI-Enabled Experimental Science

SEED est un framework qui représente les conditions expérimentales en graphes d'acteurs typés pour étudier les systèmes multi-agents et workflows humain-IA. Il permet de décrire les conditions, évaluer la nouveauté structurelle et générer des designs candidats sous contraintes. Test empirique sur triage médical montre que SEED-guided designs offrent meilleure traçabilité des changements d'interaction et gouvernance.

Agents IAMulti-agentsÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

QQJ est un cadre d'évaluation des systèmes IA génératifs qui combine jugement humain et LLM. Il utilise des rubriques multi-dimensionnelles conçues par experts et calibre les évaluateurs LLM sur un petit ensemble d'annotations de haute qualité. Expériences sur texte et images montrent meilleure alignement avec le jugement humain que les métriques automatiques traditionnelles.

ÉvaluationsLlamaVision
SIG
72
HYP
28
arXiv cs.AI·

New Insight of Variance reduce in Zero-Order Hard-Thresholding: Mitigating Gradient Error and Expansivity Contradictions

Nouvel algorithme de hard-thresholding d'ordre zéro avec réduction de variance pour les problèmes d'optimisation ℓ0. Résout la limitation du SZOHT sur le nombre de directions aléatoires en atténuant le conflit entre déviation des gradients ZO et expansivité de l'opérateur. Convergence améliorée validée sur régression ridge et attaques adversariales.

Reinforcement learning
SIG
72
HYP
15
arXiv cs.AI·

Efficient Lookahead Encoding and Abstracted Width for Learning General Policies in Classical Planning

Nouvelle approche pour l'apprentissage de politiques généralisées en planification classique via des réseaux de neurones graphiques relationnels (R-GNNs). Les auteurs introduisent un encodage efficace de la recherche lookahead IW et une abstraction relationnelle pour améliorer l'évolutivité sur le benchmark IPC 2023. Les résultats surpassent le planificateur classique LAMA.

RaisonnementBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

The Homogenization Problem in LLMs: Towards Meaningful Diversity in AI Safety

Article arXiv sur l'homogénéisation dans les LLM : les modèles reproduisent et amplifient les biais humains via l'effondrement de mode. Les auteurs proposent un cadre pour caractériser cette homogénéisation en termes de normalité (théorie queer) et introduisent la « xéno-reproduction » pour promouvoir la diversité. Expérience sur Claude 3.5 Haiku montrant les biais de genre.

ClaudeSécurité IAAlignement
SIG
72
HYP
25
arXiv cs.AI·

Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs

GVG (Generative Visual Grounding) utilise un modèle EEG-to-image pour traduire l'activité cérébrale en images visuelles, contournant l'alignement texte seul. Testé sur GVG-X-Omni (170M params tunés) et GVG-Janus (trimodal), le framework améliore la compréhension EEG et la génération visuelle en exploitant les priors visuels des MLLMs.

VisionMulti-agentsEmbeddings
SIG
72
HYP
35
arXiv cs.AI·

LAST-RAG: Literature-Anchored Stochastic Trajectory Retrieval-Augmented Generation for Knowledge-Conditioned Degradation Model Selection

LAST-RAG propose une méthode de sélection de modèles de dégradation stochastique pour l'estimation de la durée de vie utile restante (RUL). La méthode combine trajectoires observées et contexte domaine via récupération d'evidence d'une banque locale, avec un mécanisme RCRUS pour éviter l'élimination prématurée. Expériences montrent surperformance vs baselines statistiques et prognostiques.

RAGRaisonnementBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

ReTAMamba: Reliability-Aware Temporal Aggregation with Mamba for Irregular Clinical Time Series Prediction

ReTAMamba est un modèle basé sur Mamba pour prédire des séries temporelles cliniques irrégulières. Il estime la fiabilité des observations selon leur absence et le temps écoulé, intègre des informations multi-résolution via « Chronological Weaving », et utilise un routeur de tokens budgété. Sur MIMIC-IV, eICU et PhysioNet 2012, il améliore l'AUPRC de 7,51%, 7,80% et 10,15% respectivement.

BenchmarksPapersRaisonnement
SIG
72
HYP
18
arXiv cs.CL·

HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents

HINT-SD propose une auto-distillation ciblée pour entraîner des agents LLM sur des horizons longs. La méthode utilise l'historique complet de trajectoire pour identifier les actions pertinentes aux échecs et applique la distillation conditionnée par feedback uniquement sur ces spans. Sur BFCL v3 et AppWorld, elle améliore les baselines de 18,80% tout en réduisant le temps par étape d'entraînement de 2,26×.

Agents IAReinforcement learningRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models

Attention Hijacking : une attaque adversariale qui manipule les distributions d'attention internes des modèles vision-langage pour maintenir une réponse cible identique à travers différentes requêtes textuelles. La méthode amplifie l'influence des tokens visuels sur les tokens de réponse tout en supprimant celle des tokens textuels, améliorant la transférabilité cross-query.

VisionSécurité IAPapers
SIG
72
HYP
25
arXiv cs.CL·

CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook

CodeBind propose un framework d'alignement multimodal via codebook compositif partagé-spécifique. La méthode décompose les représentations en composantes sémantiques partagées et spécifiques à chaque modalité, validée sur 9 modalités (texte, image, vidéo, audio, profondeur, thermique, tactile, nuage de points 3D, EEG) avec SOTA en classification et retrieval.

EmbeddingsVisionRobotique
SIG
72
HYP
25
arXiv cs.AI·

ProtoSiTex: Learning Semi-Interpretable Prototypes for Multi-label Text Classification

ProtoSiTex est un framework semi-interprétable pour la classification multi-label fine-grained de textes. Il combine une phase de découverte non-supervisée de prototypes avec une phase de classification supervisée utilisant une fonction de perte hiérarchique. Les expériences sur un nouveau benchmark d'avis hôtels et deux benchmarks publics montrent des performances SOTA avec explications fidèles.

ÉvaluationsPapers
SIG
72
HYP
18
arXiv cs.CL·

ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

ESI-Bench est un benchmark pour l'intelligence spatiale incarnée testant 10 catégories de tâches sur OmniGibson. Les expériences montrent que l'exploration active surpasse les approches passives, mais les modèles échouent principalement par « action blindness » : mauvais choix d'action → mauvaises observations → erreurs en cascade. Les modèles manquent de métacognition contrairement aux humains.

BenchmarksVisionRaisonnement
SIG
72
HYP
25
arXiv cs.CL·

AdaSwitch: Adaptive Switching between Small and Large Agents for Effective Cloud-Local Collaborative Learning

AdaSwitch propose un paradigme collaboratif cloud-local où un agent local (petit LLM) traite les tâches simples et demande assistance à un agent cloud (grand LLM) pour le raisonnement complexe. Le mécanisme adaptatif détecte les erreurs locales et bascule dynamiquement. Évaluation sur 7 benchmarks (raisonnement mathématique, QA complexe) montre amélioration de performance avec réduction des coûts computationnels.

Agents IAMulti-agentsRaisonnement
SIG
72
HYP
25
arXiv cs.AI·

Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models

Nouvelle approche pour étendre les graphes de connaissances (KG) du patrimoine culturel français. Les auteurs introduisent WJoconde, un KG multimodal intégrant texte et images, avec trois variantes et un benchmark pour la complétion de KG. Ils proposent un framework combinant LLM et Vision-Language Models pour extraire et valider automatiquement les données, améliorant la fiabilité du KG.

VisionRAGBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

NeuSymMS: A Hybrid Neuro-Symbolic Memory System for Persistent, Self-Curating LLM Agents

NeuSymMS est un système de mémoire hybride neuro-symbolique pour agents LLM. Il couple l'extraction neurale de faits depuis le dialogue avec un système expert CLIPS qui classe, déduplique et réconcilie les faits. Les connaissances sont stockées sous forme de triplets sujet-relation-valeur en base de données relationnelle, avec mémoire court/long terme et promotion basée sur l'accès.

Agents IARAGRaisonnement
SIG
72
HYP
25
arXiv cs.AI·

Learning Higher-Order Structure from Incomplete Spatiotemporal Data: Multi-Scale Hypergraph Laplacians with Neural Refinement

Multi-Scale Hypergraph Laplacians (MSHL) : framework en deux étapes pour imputer des données spatiotemporelles incomplètes de réseaux de capteurs. Découverte de structures d'ordre supérieur via hypergraphes multi-échelles, puis raffinement par réseau résiduel conditionné. Garanties théoriques et tests sur réseaux routiers réels avec pannes structurées.

PapersBenchmarksInfrastructure
SIG
72
HYP
15
arXiv cs.AI·

Multi-Party Multi-Objective Optimization as Consensus Search: Runtime Analysis of Cross-Party Recombination

Étude théorique des algorithmes évolutionnaires multi-objectifs pour l'optimisation multi-parties (MPMOP). Sur le benchmark MP-JCG, une mutation guidée par les gains requiert Θ(n²) évaluations pour franchir une région critique, tandis que CPR-NSGA-II atteint O(n log n) via recombination cross-party. Analyse de runtime sur BPBOMST (problème d'arbre couvrant minimum multi-parties) avec bornes paramétrées.

Multi-agentsBenchmarksPapers
SIG
72
HYP
08
arXiv cs.AI·

EAGT: Echocardiography Augmentation for Generalisability and Transferability

Étude comparative de 29 techniques d'augmentation de données pour la segmentation échocardiographique 2D sur U-Net. Les transformations géométriques anatomiquement plausibles (affine, shift-scale-rotate, perspective, flip horizontal) améliorent la généralisation cross-dataset, tandis que les augmentations d'intensité agressives la dégradent. Les combinaisons par paires surpassent les augmentations individuelles.

VisionBenchmarksFine-tuning
SIG
72
HYP
15
arXiv cs.AI·

Position: AI Evaluations Should be Grounded on a Theory of Capability

Article de position argumentant que les évaluations de modèles IA doivent s'appuyer sur une théorie explicite de la capacité, plutôt que de traiter les scores comme des mesures directes. Les auteurs montrent empiriquement que les performances rapportées dépendent fortement des hypothèses de modélisation et proposent une « Evaluation Card » pour documenter les décisions sous-jacentes.

ÉvaluationsBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

From Demographics to Survey Anchors: Evaluating LLM Agents for Modeling Retirement Attitudes

Étude comparative d'agents LLM pour prédire les réponses à l'enquête SHARE (santé, vieillissement, retraite en Europe). Les agents basés uniquement sur des données démographiques (âge, revenu, éducation, etc.) montrent un biais de tendance centrale et une précision irréaliste, tandis que les agents ancrés sur des réponses d'enquête reproduisent mieux les interactions entre facteurs de planification retraite.

Agents IAÉvaluationsBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models

Nouvelle méthode de quantification 1-bit pour LLM exploitant les modèles pré-entraînés. Utilise un entraînement progressif cohérent (forward/backward) avec initialisation binary-aware et compensation dual-scaling pour convertir les poids en représentation binarisée. Réduit coûts d'entraînement et dégradation de précision comparé aux approches existantes.

Fine-tuningBenchmarksInfrastructure
SIG
72
HYP
18
arXiv cs.CL·

When TableQA Meets Noise: A Dual Denoising Framework for Complex Questions and Large-scale Tables

EnoTab est un framework de débruitage dual pour le TableQA (question-answering sur tables). Il décompose les questions complexes en unités sémantiques minimales et élagage les tables volumineuses via un arbre de preuves explicite, avec mécanisme de rollback pour gérer les états anormaux. Résultats probants sur questions complexes et tables à grande échelle.

RaisonnementRAGBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment

Nouvel article arXiv proposant HRC (Hybrid Reward-Cyclic), un modèle de récompense qui décompose explicitement les préférences humaines en composantes transitives (scalaires) et cycliques (vectorielles) via théorie des jeux. Introduit DSPPO (Dynamic Self-Play Preference Optimization) pour l'alignement. Résultats : +1.23% sur RewardBench 2 vs GPM, 44.75% win-rate AlpacaEval 2.0 avec Gemma-2B-it.

Reinforcement learningAlignementPapers
SIG
72
HYP
25
arXiv cs.AI·

QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

QQJ est un framework d'évaluation pour l'IA générative qui combine rubrics multi-dimensionnels conçus par experts et calibrage d'LLM évaluateurs sur un petit ensemble d'annotations de haute qualité. Testé sur génération de texte et images, QQJ montre meilleure alignement avec le jugement humain que les métriques automatiques traditionnelles et les évaluateurs LLM non structurés.

ÉvaluationsBenchmarksAlignement
SIG
72
HYP
28