Page 60 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.LG·

TMR-GGNN: Credit Card Fraud Detection based on Time-Aware Multi-Relational Guided Graph Neural Network

TMR-GGNN, un réseau de neurones graphiques multi-relationnel sensible au temps, détecte la fraude par carte bancaire en modélisant les interactions hétérogènes entre clients, commerçants, appareils et adresses IP. Le modèle combine attention relationnelle temporelle, apprentissage contrastif et une fonction de perte composite (InfoNCE + Focal Loss) pour gérer les données déséquilibrées et réduire les faux négatifs.

Reinforcement learning
SIG
72
HYP
15
arXiv cs.CL·

Efficient Financial Language Understanding via Distillation with Synthetic Data

Framework de distillation avec données synthétiques pour l'analyse de sentiment financier. Transfert de connaissances d'un modèle teacher instruction-tuned vers des modèles compacts. Sélection de seeds par clustering pour générer des données synthétiques via few-shot prompting. Le modèle compact surpasse le teacher sur textes complexes/bruyants avec supervision minimale.

Fine-tuningRAGPrompt engineering
SIG
72
HYP
18
arXiv cs.LG·

Quantum Annealing Enhanced Reinforcement Learning for Accurate Remaining Useful Lifetime Prediction

Framework QAQL combinant quantum annealing et Q-learning pour prédire la durée de vie utile restante (RUL) en maintenance prédictive. Chaque mise à jour Q-value est encodée en QUBO résolu sur D-Wave Advantage. Validé sur NASA C-MAPSS et datasets de maintenance : amélioration statistiquement significative vs baselines classiques et quantiques.

Reinforcement learningBenchmarksPapers
SIG
72
HYP
25
arXiv cs.LG·

PSyGenTAB: A Privacy-Preserving Framework for Synthetic Clinical Tabular Data Generation via Constrained Optimization

PSyGenTAB est un framework de génération de données synthétiques cliniques qui formule le problème comme une optimisation contrainte via la méthode du Lagrangien augmenté. Le système intègre des contraintes de confidentialité directement dans l'entraînement pour préserver les relations inter-variables cliniques et les patterns de classes minoritaires, tout en maintenant l'utilité des données pour l'IA médicale.

Benchmarks
SIG
72
HYP
18
arXiv cs.AI·

Searching for Synergy in Shared Workspace Human-AI Collaboration

Étude sur la collaboration humain-IA en espace partagé via Collaborative Gym et DiscoveryBench. Ajouter des collaborateurs améliore les performances seulement avec une structure de coordination. Un scaffolding combinant mémoire partagée et validation humaine (HITL gates) augmente la performance, particulièrement en équipes de trois, en clarifiant les responsabilités.

Agents IAMulti-agentsÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

LLMs Struggle to Measure What Distinguishes Students of Different Proficiency Levels: A Study of Item Discrimination in Reading Comprehension Assessment

Étude évaluant 42 LLMs (propriétaires et open-source) sur leur capacité à mesurer la discrimination d'items en compréhension de lecture. Les modèles échouent : corrélation de Spearman de 0,152 en prédiction directe, 0,241 en calibration CTT. Les LLMs ne capturent pas fiablement comment les items distinguent les étudiants de niveaux différents.

BenchmarksÉvaluationsPapers
SIG
72
HYP
15
Reddit r/LocalLLaMA·

I released Inflect-Nano, an ultra-extreme tiny 4.63m parameter TTS model.

Inflect-Nano-v1, modèle TTS de 4.63M paramètres, est le 2e plus petit modèle de synthèse vocale public. Composé d'un modèle acoustique (3.46M) et d'un vocoder (1.17M), il génère de l'audio 24 kHz en anglais. ~17x plus petit que Kokoro, ~108x plus petit que Chatterbox. Exécutable localement en PyTorch, adapté aux appareils embarqués et assistants vocaux hors ligne.

VoixOpen sourceOutils
SIG
72
HYP
25
arXiv cs.LG·

Credibility-Weighted Pricing of Autonomous Vehicle Liability Under Operational Design Domain Shift

Framework bayésien hiérarchique pour tarifier la responsabilité civile des véhicules autonomes face aux changements de domaine opérationnel. Testé sur 648 accidents Waymo vérifiés (4 villes US, 116M miles) : poids de crédibilité modérés (0.12-0.46), pooling partiel surpasse l'absence de pooling, avantage du kernel détectable à ~12 villes déployées.

Sécurité IABenchmarksRégulation
SIG
72
HYP
15
arXiv cs.AI·

MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning

MathVis-Fine propose un cadre pour améliorer le raisonnement mathématique multimodal en modélisant les dépendances visuelles fine-grained. Un nouveau dataset annote les images avec des ratings de dépendance visuelle. Un entraînement progressif en deux étapes équilibre les récompenses de correction et de grounding visuel selon la nécessité réelle de chaque échantillon.

RaisonnementVisionBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games

Les chercheurs proposent « Equation-to-Behavior Prompting » pour guider les LLM à simuler différents modèles cognitifs humains (Bayésien, motivated reasoning, modèle α-β de Grether). Les grands modèles approximent ces spécifications par prompting, mais les petits modèles échouent. L'entraînement par RL réduit l'erreur de croyance de 26,5% et améliore les performances de 2,5–12% sur des jeux de persuasion légaux.

RaisonnementReinforcement learningÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

Can LLMs Be CEOs? Benchmarking Strategic Resource Reallocation with Multi-Role Agent Simulation

CEO-Bench, un benchmark multi-agent, évalue la capacité des LLM à prendre des décisions stratégiques de réallocation de ressources. Cinq modèles frontière testés sur 13 scénarios montrent une validité structurelle élevée mais divergent sur l'étalonnage stratégique. Les défaillances incluent la capture par un seul conseiller et l'amnésie historique.

Agents IAMulti-agentsRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

MapSatisfyBench: Benchmarking Satisfaction-Aware Map Agents through Behavior-Grounded Implicit Decision Factors

MapSatisfyBench est un benchmark pour évaluer les agents LLM intégrés aux services cartographiques. Il mesure leur capacité à identifier et satisfaire les besoins implicites des utilisateurs (facteurs de décision non explicités) à partir de données comportementales réelles. Les expériences montrent que les agents actuels réussissent bien sur les tâches explicites mais peinent à anticiper les facteurs implicites.

Agents IABenchmarksÉvaluations
SIG
72
HYP
18
arXiv cs.LG·

Generalization Guarantees for Multi-Input Neural Operator Learning in Sobolev Spaces

Analyse théorique des garanties de généralisation pour les opérateurs neuronaux multi-entrées avec erreur mesurée en normes de Sobolev. Le cadre traite plusieurs fonctions d'entrée sur domaines différents avec dimensions et régularités variables. Les taux d'approximation et de généralisation quantifient explicitement la contribution de chaque espace d'entrée.

PapersRaisonnementBenchmarks
SIG
72
HYP
08
arXiv cs.LG·

Decision-Driven Geosteering Under Uncertainty: A Unified Framework for Sequential Decision Optimization

Framework d'optimisation séquentielle pour la géonavigation de puits pétroliers sous incertitude. Intègre filtrage particulaire pour l'interprétation probabiliste du sous-sol et apprentissage par renforcement basé sur la valeur. Compare trois approches décisionnelles : programmation dynamique approximée, Deep Q-learning et Double DRL avec décomposition duelle, validées sur simulateur industriel.

Reinforcement learningRaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.LG·

Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs

Les chercheurs identifient un problème critique dans l'édition de connaissances des MLLMs : les mises à jour fonctionnent avec des entrées multimodales (texte+image) mais échouent avec des entrées unimodales seules. Ils proposent DECODE, une méthode qui localise et découple les neurones spécifiques à chaque modalité pour propager les éditions de manière cohérente.

Fine-tuningVisionÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

Perceptual compensation for tonal context in self-supervised speech models

Étude sur wav2vec2.0 examinant la compensation perceptuelle pour le contexte tonal en mandarin. Les modèles pré-entraînés non supervisés ne montrent pas de compensation dans les similarités d'embeddings. Les classifieurs de probing révèlent une compensation partielle mais ne répliquent pas les performances humaines. Les objectifs supervisés semblent nécessaires pour abstraire certaines régularités phonologiques.

PapersÉvaluationsVoix
SIG
72
HYP
15
arXiv cs.CL·

Bridging Functional Correctness and Runtime Efficiency Gaps in LLM-Based Code Translation

SwiftTrans, un framework de traduction de code par LLM, combine exploration multi-perspective (MpTranslator avec apprentissage en contexte parallèle) et sélection consciente des différences (DiffSelector) pour améliorer à la fois la correction fonctionnelle et l'efficacité runtime. Évaluation sur CodeNet, F2SBench et SwiftBench.

Génération de codePrompt engineeringBenchmarks
SIG
72
HYP
18
arXiv cs.CL·

MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation

MODE-RAG est un système multi-agent basé sur l'énergie libre variationnelle pour réduire les hallucinations dans les systèmes de génération augmentée par récupération multimodale. Il utilise MCTS, perturbations logit et des agents spécialisés pour router les requêtes à haut risque et vérifier les faits. Les auteurs introduisent ModeVent, un sous-ensemble du dataset MultiVent, pour évaluer la robustesse.

RAGMulti-agentsVision
SIG
72
HYP
28