Page 64 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.LG·

A Stationarity-and-Coupling Criterion for Training-Free Time-Lagged Spectral Embeddings of Multivariate Time Series

Étude d'un descripteur sans entraînement pour séries temporelles multivariées basé sur des matrices de corrélation décalées temporellement. Les auteurs proposent un critère de stationnarité et couplage pour prédire quand cette approche fonctionne : elle réussit sur Sleep-EDF (88.5%), BCI-IV-2a, MIT-BIH, ESC-50 mais échoue sur données non-stationnaires ou discriminées par puissance, validant le critère prédictif.

BenchmarksPapers
SIG
72
HYP
15
arXiv cs.LG·

SpikF-GO: Spiking Fourier Graph Operators for Multivariate Time Series Forecasting

SpikF-GO combine les réseaux de neurones impulsionnels (SNN) avec des opérateurs graphiques de Fourier pour la prévision de séries temporelles multivariées. La méthode introduit des portes de fréquence Hard Concrete et des portes LIF complexes pour traiter les composantes réelles et imaginaires, réduisant la consommation énergétique tout en surpassant FourierGNN sur 8 benchmarks.

PapersBenchmarksRaisonnement
SIG
72
HYP
25
arXiv cs.CL·

Fusing Stylometric and Embedding Systems to Estimate Authorship Likelihood Ratios in Japanese

Première application du cadre de rapport de vraisemblance (likelihood ratio) à l'attribution d'auteur en japonais. Fusion de systèmes stylométriques et d'embeddings de modèles de langage pré-entraînés sur ~1000 caractères de blogs. Le système fusionné améliore la discrimination (log-likelihood-ratio cost: 0.32484) tout en maintenant une bonne calibration.

EmbeddingsBenchmarksPapers
SIG
72
HYP
15
arXiv cs.CL·

MoDiCoL: A Modular Diagnostic Continual Learning Dataset for Robust Speech Recognition

MoDiCoL est un dataset de continual learning modulaire pour évaluer la robustesse des systèmes ASR face aux variations réelles (accents, bruits, conditions d'enregistrement, troubles de la parole). Les auteurs proposent un curriculum inspiré du monde réel et évaluent trois stratégies de continual learning pour analyser comment la robustesse se développe, se transfère et s'oublie.

BenchmarksÉvaluationsVoix
SIG
72
HYP
18
arXiv cs.CL·

Persuasion Index: A Theory-Guided Framework for Persuasion Analysis

Persuasion Index (PI) est une taxonomie de 15 dimensions fondée sur les théories de la persuasion en psychologie et communication. Implémentation avec 55 sous-features basées sur lexiques et détecteurs. Évaluation sur 4 datasets publics montre que PI fournit un espace de features partagé pour interpréter les patterns rhétoriques. Modèles linéaires légers et interprétables. Package open-source et interface web.

PapersSécurité IAPrompt engineering
SIG
72
HYP
18
arXiv cs.CL·

AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition

AgentSpec est un framework modulaire pour décomposer les agents LLM en composants réutilisables (perception, mémoire, raisonnement, réflexion, action, apprentissage). Les auteurs évaluent les interactions entre modules sur DeliveryBench, ALFRED, MiniGrid et RoboTHOR, montrant que la performance dépend de la compatibilité du scaffold et des effets d'interaction plutôt que de la force isolée des modules.

Agents IARaisonnementReinforcement learning
SIG
72
HYP
18
arXiv cs.AI·

UP-NRPA: User Portrait based Nested Rollout Policy Adaptation for Planning with Large Language Models in Goal-oriented Dialogue Systems

UP-NRPA, un framework basé sur les portraits utilisateur, adapte dynamiquement les stratégies de dialogue avec LLM sans apprentissage par renforcement hors ligne. Sur benchmarks collaboratifs et non-collaboratifs, le système atteint 100% de succès en plusieurs tâches et augmente le ratio vente-prix de 56,41% en négociation.

Agents IAReinforcement learningRaisonnement
SIG
72
HYP
35
arXiv cs.AI·

Refusal Beyond a Single Direction: A Preliminary Comparison of Diff-in-Means and INLP

Comparaison de deux méthodes d'intervention sur les refus de sécurité dans les modèles de chat : Difference-in-Means (DiM) vs Iterative Nullspace Projection (INLP). Sur 5 modèles open-weight, INLP counterfactual flipping égale DiM en suppression des refus, tandis que nullspace projection est plus faible. Les deux approches opèrent différemment dans l'espace d'activation.

Sécurité IAAlignementPapers
SIG
72
HYP
15
arXiv cs.AI·

Causal Object-Centric Models for Planning with Monte Carlo Tree Search

COMET combine un encodeur object-centric non supervisé avec un world model transformer pour effectuer Monte Carlo Tree Search dans un espace latent structuré. Un mécanisme action-slot fusion lie les actions aux objets. Évalué sur 8 tâches (Object-Centric Visual RL, ManiSkill, Robosuite, VizDoom), COMET surpasse les baselines en phase d'apprentissage précoce.

Reinforcement learningRaisonnementRobotique
SIG
72
HYP
18
arXiv cs.AI·

Dense Coordinate-List Fine-Tuning Induces a Controllable Interference Surface in Vision-Language Models

Fine-tuner des modèles vision-langage sur des listes de coordonnées denses améliore le grounding visuel mais induit des répétitions parasites. Sur Gemma 4 12B, une LoRA haute capacité élève F1@0.3 de 0.007 à 0.448 mais crée un taux de doublons de 0.080. Un contrôle au niveau objet élimine les répétitions (taux 0.000) tout en préservant la performance (F1 0.490).

Fine-tuningVisionBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

A Temporal Planning Framework for Disruption Aware Dynamic Route Optimization in Heterogeneous Railway Systems

Framework de planification temporelle pour optimiser dynamiquement les itinéraires dans les réseaux ferroviaires hétérogènes multi-écartements. Formule les opérations comme problème PDDL 2.1, modélise contraintes de compatibilité et scénarios de disruption. Évalué sur 200 instances (jusqu'à 1 000 points de voie, 120 trains).

RaisonnementBenchmarks
SIG
72
HYP
15
arXiv cs.LG·

D2H-AD: A Hybrid Model Utilizing Hyperdimensional Computing for Advanced Anomaly Detection

D2H-AD est un framework de détection d'anomalies basé sur l'Hyperdimensional Computing (HDC). Il combine encodage sensible à la densité et similarité basée sur la distance, surpassant cinq baselines (HDAD, ODHD, One-Class SVM, Isolation Forest, Autoencoders) sur cinq datasets. L'encodage hyperdimensionnel seul atteint +5.4% ROC-AUC. Léger, interprétable, efficace computationnellement : adapté TinyML et edge AI.

BenchmarksÉvaluationsInfrastructure
SIG
72
HYP
28
arXiv cs.LG·

Attention-Based Estimation of the Individual Treatment Benefit Probability under Dose Variation

Dose-AIPTB propose une méthode basée sur l'attention pour estimer la probabilité qu'un traitement bénéficie à un patient individuel sous différentes doses. Le framework reformule le problème en classification binaire du signe de l'effet de traitement individuel, utilisant des comparaisons par paires et agrégation par attention. Code disponible sur GitHub.

RaisonnementÉvaluationsPapers
SIG
72
HYP
15
arXiv cs.LG·

Deep Spectral Learning of Embedded Latent Transfer Operators for Stochastic Dynamical Systems

Méthode spectrale pour systèmes dynamiques stochastiques non-linéaires utilisant des opérateurs de transfert latents dans des espaces de features profonds. Deep Spectral Encoder (DSE) combine un encodeur neural non-linéaire, analyse canonique de corrélation fonctionnelle et filtrage bayésien séquentiel. Surpasse les baselines DMD et filtrage bayésien même sous bruit et observabilité partielle.

PapersRaisonnementReinforcement learning
SIG
72
HYP
15
arXiv cs.LG·

Recovering Stranded Discrimination in Knowledge Tracing: Per-Item Bias Correction via Empirical-Bayes Shrinkage

SLC (State-space Logit Correction) corrige les biais systématiques par item dans les modèles de knowledge tracing déployés. Via transformation Laplace/IRLS, shrinkage empirique-Bayes et Kalman smoother, la méthode améliore l'AUC sur 4 datasets et 5 backbones, particulièrement sur items rares. Les calibrateurs globaux (Platt, temperature scaling) ne récupèrent pas la discrimination perdue.

ÉvaluationsFine-tuningAlignement
SIG
72
HYP
18
arXiv cs.LG·

Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops

Étude arXiv sur les hallucinations médicales des LLM. Système multi-agent « Trust but Verify » testant 3 familles de modèles (GPT-OSS, Llama-3, Falcon-3) sur 103 questions cliniques avec médicaments bannis. Architecture à 5 agents réduit le taux d'hallucination de 53% et force le refus approprié plutôt que la recommandation dangereuse.

Multi-agentsSécurité IAAlignement
SIG
72
HYP
28
arXiv cs.CL·

Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces

WebDecept, un framework de test, évalue la robustesse des agents web autonomes face à des interfaces trompeuses en e-commerce. Sept patterns de déception (publicités ciblées, redirections, manipulations d'achat) sont injectés dans des environnements web. Les résultats montrent que les agents multimodaux actuels sont hautement vulnérables et que les contraintes par prompt ne suffisent pas à mitiger ces défaillances.

Agents IASécurité IABenchmarks
SIG
72
HYP
25
arXiv cs.CL·

SANA: What Matters for QA Agents over Massive Data Lakes?

SANA est un framework d'ablation diagnostique pour évaluer les agents QA sur des data lakes massifs. Il décompose les défaillances end-to-end en quatre composants : recherche, planification, analyse de données et politique d'action. Testé sur LakeQA et KramaBench, il révèle que l'analyse de données est le goulot d'étranglement principal, tandis que la recherche limite surtout les grands data lakes.

Agents IAÉvaluationsBenchmarks
SIG
72
HYP
18