Page 94 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

Answer Only as Precisely as Justified: Calibrated Claim-Level Specificity Control for Agentic Systems

Méthode de contrôle de spécificité au niveau des affirmations pour systèmes agentiques. CSS décompose les réponses en claims, propose des reformulations moins précises, et émet chaque claim au niveau de spécificité calibré admissible. Sur LongFact, améliore l'utilité de 0.846 à 0.913 tout en conservant 0.938 de spécificité.

Agents IARaisonnementÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

A Machine with Short-Term, Episodic, and Semantic Memory Systems

Modèle d'agent IA avec trois systèmes de mémoire (court terme, épisodique, sémantique) inspirés de la cognition humaine, chacun représenté par un graphe de connaissances. Évaluation via un environnement RL custom « the Room ». L'agent Deep Q-learning apprend à encoder, stocker et récupérer les mémoires pour répondre à des questions. Surpasse un agent sans cette structure.

Reinforcement learningRaisonnementAgents IA
SIG
72
HYP
25
arXiv cs.AI·

The Loupe: A Plug-and-Play Attention Module for Amplifying Discriminative Features in Vision Transformers

The Loupe est un module de gating spatial léger pour Vision Transformers hiérarchiques, conçu pour la classification visuelle fine-grained. Inséré à un stade intermédiaire, il prédit un masque spatial monocanal via un petit CNN et repondère les activations. Sur CUB-200-2011, il améliore Swin-Base de 88,36% à 91,72% et Swin-Tiny de 85,14% à 88,61% avec <0,1% de paramètres supplémentaires.

VisionBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

Lost or Hidden? A Concept-Level Forgetting in Supervised Continual Learning

Étude diagnostique du catastrophic forgetting en continual learning via Sparse Autoencoders. Framework analyse comment l'information spécifique aux tâches évolue au niveau des concepts latents. Résultat : majorité de l'oubli apparent est récupérable sous hypothèse de linéarité ; dégradation due à l'accessibilité représentationnelle plutôt qu'à l'effacement complet.

PapersRaisonnementVision
SIG
72
HYP
15
arXiv cs.AI·

SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning

SSL4RL utilise des tâches d'apprentissage auto-supervisé (rotation d'images, reconstruction de patches masqués) comme signaux de récompense pour l'entraînement par renforcement de modèles vision-langage. Le framework élimine le besoin de données de préférence humaine et améliore les performances sur des benchmarks de raisonnement vision-centric et vision-langage.

VisionReinforcement learningRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

Unlocking the Potential of Diffusion Language Models through Template Infilling

Template Infilling (TI) est une méthode de conditioning pour les Diffusion Language Models qui aligne des ancres structurelles sur l'ensemble de l'espace de réponse cible, remplaçant le prefix prompting. Évaluée sur raisonnement mathématique, génération de code et planification, TI améliore les performances de 9,40% et accélère la génération multi-token.

Génération de codeRaisonnementBenchmarks
SIG
72
HYP
28
arXiv cs.AI·

Geometry-aware 4D Video Generation for Robot Manipulation

Modèle de génération vidéo 4D pour la manipulation robotique qui enforce la cohérence multi-vue 3D via supervision par alignement de pointmap cross-view. Génère des séquences vidéo spatio-temporellement alignées à partir d'une seule image RGB-D par vue, sans poser en entrée. Démontre stabilité visuelle supérieure et récupération de trajectoires d'effecteur robot sur datasets simulés et réels.

RobotiqueGénération de vidéosVision
SIG
72
HYP
18
arXiv cs.LG·

LEAF: A Living Benchmark for Event-Augmented Forecasting

LEAF est un benchmark vivant pour évaluer les capacités de prévision des LLM en utilisant des événements multidimensionnels. Le système utilise des agents de récupération récursive et une validation croisée dual-agent pour fournir du texte auxiliaire pertinent. Les tests montrent que les LLM exploitent les signaux d'événements complexes pour améliorer les prévisions, notamment sur les actions boursières.

BenchmarksAgents IAMulti-agents
SIG
72
HYP
28
arXiv cs.AI·

EmergentBridge: Improving Zero-Shot Cross-Modal Transfer in Unified Multimodal Embedding Models

EmergentBridge améliore les modèles d'embedding multimodaux unifiés pour les paires de modalités non appariées (audio↔profondeur, infrarouge↔audio). La méthode apprend un mappage produisant un « noisy bridge anchor » et applique l'alignement dans un sous-espace orthogonal, préservant la structure d'alignement existante. Résultats sur 9 datasets : surpasse les baselines en classification et retrieval zero-shot.

EmbeddingsVisionMulti-agents
SIG
72
HYP
18
arXiv cs.AI·

Two-Dimensional Quantization for Geometry-Aware Audio Coding

Q2D2 (Two-Dimensional Quantization) est un nouveau schéma de quantization pour les codecs audio neuraux. Il projette les paires de features sur des grilles 2D structurées (hexagonales, rhombiques, rectangulaires) pour améliorer l'efficacité de compression, le taux de tokens et l'utilisation du codebook, tout en maintenant la qualité de reconstruction état de l'art sur la parole, l'audio et la musique.

Génération de codePapersBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning

VideoDR est le premier benchmark pour le video question answering en domaine ouvert, combinant extraction visuelle multi-frames, récupération web itérative et raisonnement multi-hop. L'évaluation de modèles multimodaux (closed/open-source) montre que le paradigme Agentic n'est pas systématiquement supérieur au Workflow; les défis clés sont la dérive d'objectif et la cohérence long-horizon.

Agents IAVisionRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception

Speech-Hands est un framework vocal agentic qui apprend à décider quand faire confiance à ses prédictions ou consulter des perceptions audio externes. Le modèle réduit le WER de 12,1% sur 7 benchmarks OpenASR et atteint 77,37% de précision en audio QA, en utilisant un mécanisme d'auto-réflexion pour éviter les hypothèses bruitées.

Agents IAVoixRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

"The Whole Is Greater Than the Sum of Its Parts": A Compatibility-Aware Multi-Teacher CoT Distillation Framework

COMPACT, un framework de distillation CoT multi-enseignants, fusionne adaptativement les supervisions de plusieurs LLMs vers des modèles compacts. Il pondère dynamiquement les gradients des enseignants via trois métriques : consensus basé graphe, adaptabilité par information mutuelle, et difficulté basée perte. Résultats SOTA sans oubli catastrophique.

RaisonnementFine-tuningPapers
SIG
72
HYP
25
arXiv cs.AI·

SuReNav: Superpixel Graph-based Constraint Relaxation for Navigation in Over-constrained Environments

SuReNav propose une méthode de navigation basée sur graphes de superpixels pour les environnements sur-contraints. Le système combine génération de cartes avec contraintes régionales, relaxation via réseau de neurones entraîné sur démonstrations humaines, et exécution entrelacée. Évalué sur cartes 2D/3D OpenStreetMap et robot Spot, il atteint le meilleur score de ressemblance humaine.

Agents IARobotiquePapers
SIG
72
HYP
25
arXiv cs.AI·

GRAFT: Decoupling Ranking and Calibration for Survival Analysis

GRAFT est un modèle AFT hybride pour l'analyse de survie qui découple le classement pronostique de l'étalonnage des estimations. Il combine un modèle AFT linéaire avec un réseau résiduel non-linéaire et des portes stochastiques pour la sélection de features. Entraîné sur une perte alignée C-index avec imputation conditionnelle, il surpasse les baselines en discrimination et calibration.

PapersBenchmarksRaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Perception-based Image Denoising via Generative Compression

Article proposant un cadre de compression générative pour le débruitage d'images basé sur la perception. Deux approches : un débruiteur WGAN conditionnel contrôlant le compromis rate-distortion-perception, et une stratégie de reconstruction par diffusion itérative guidée par des latents compressés. Garanties théoriques et améliorations perceptuelles validées sur benchmarks.

Génération d'imagesPapersBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Forgetting is Competition: Rethinking Unlearning as Representation Interference in Diffusion Models

SurgUn, une méthode d'oubli de concepts pour modèles de diffusion texte-image, traite l'oubli comme une compétition contrôlée plutôt qu'une suppression directe. Via gradient ascendant sur cibles et descent sur distracteurs sémantiquement divers, elle réduit l'imbalance erase-retain et limite les dégâts collatéraux. Testée sur Stable Diffusion v1.5, SDXL et SANA-1.5.

Génération d'imagesSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.AI·

Self-Play Only Evolves When Self-Synthetic Pipeline Ensures Learnable Information Gain

Les boucles d'auto-évolution des LLM stagnent quand elles ne génèrent pas d'information apprenable. Cette étude identifie trois rôles (Proposer, Solver, Verifier) et trois designs système (co-évolution asymétrique, croissance de capacité, recherche proactive d'information) pour maintenir le gain d'information à travers les itérations sur des tâches de codage.

RaisonnementReinforcement learningGénération de code
SIG
72
HYP
25
arXiv cs.AI·

Spatiotemporal Robustness of Temporal Logic Tasks using Multi-Objective Reasoning

Article arXiv proposant une notion de robustesse spatiotemporelle (STR) pour les spécifications de logique temporelle sur signaux discrets. Formalisée comme problème de raisonnement multi-objectif via ordre partiel, STR capture perturbations spatiales et temporelles conjointes. Applicable aux systèmes multi-agents, villes intelligentes, contrôle du trafic aérien. Algorithmes de monitoring proposés.

Multi-agentsRaisonnementSécurité IA
SIG
72
HYP
15
arXiv cs.AI·

Limitations of Sequence-Based Protein Representations for Parkinson's Disease Classification: A Leakage-Free Benchmark

Étude comparative de représentations protéiques (composition acides aminés, k-mers, ProtBERT, descripteurs physicochimiques) pour classifier la maladie de Parkinson. ProtBERT + MLP atteint F1=0.704±0.028, ROC-AUC=0.748±0.047. Les séquences primaires seules montrent un pouvoir discriminant limité; des features structurelles/fonctionnelles sont nécessaires.

BenchmarksPapersEmbeddings
SIG
72
HYP
15