Page 106 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Concise and Logically Consistent Conformal Sets for Neuro-Symbolic Concept-Based Models

COCOCO, un framework post-hoc, intègre la Conformal Prediction aux modèles neuro-symboliques basés sur concepts (NeSy-CBMs) pour améliorer la fiabilité. Il conformalise concepts et labels conjointement via une étape de révision déduction-abduction, garantissant cohérence, couverture et concision sans hypothèse distributionnelle. Testé sur 8 datasets.

RaisonnementSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.AI·

Hypergraph Pattern Machine: Compositional Tokenization for Higher-Order Interactions

HGPM (Hypergraph Pattern Machine) modélise les interactions d'ordre supérieur en tokenisant les sous-ensembles compositionnels et en utilisant un Transformer conscient de l'inclusion. Sur 10 benchmarks hypergraphes, la méthode égale ou surpasse l'état de l'art, notamment en prédiction d'événements indésirables en polypharmacologie où elle identifie correctement les combinaisons de médicaments inhibitrices.

PapersBenchmarksRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

Fixed External Cameras as Common Prior Maps for Active 3D Scene Graph Generation

Framework RGB pour la génération active de graphes de scènes 3D (3DSG) utilisant des caméras externes fixes comme cartes de contexte préalable. Le système fusionne observations de caméras embarquées et externes dans un pipeline unique, guidant le robot vers les régions d'incertitude sémantique élevée. Une seule caméra externe augmente le rappel d'objets initial de +79%.

VisionRobotiqueAgents IA
SIG
72
HYP
18
arXiv cs.AI·

Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

Vision Inference Former (VIF) est un module architectural léger qui améliore la cohérence visuelle dans les modèles multimodaux. Il injecte continuellement les sémantiques visuelles pendant la génération pour contrer l'affaiblissement de l'alignement vision-langage sur de longues séquences. Testé sur 14 benchmarks (raisonnement, OCR, tableaux), VIF améliore les performances avec surcharge minimale.

VisionMulti-agentsAlignement
SIG
72
HYP
25
arXiv cs.AI·

An Empirical Study of Privacy Leakage Chains via Prompt Injection in Black-Box Chatbot Environments

Étude empirique des chaînes de fuite de données via injection de prompts dans des environnements de chatbot boîte noire. Les chercheurs analysent comment un attaquant peut détourner les tâches d'un agent LLM en injectant du contenu malveillant dans des sources externes (pages web). Ils introduisent la technique « exemplification » et démontrent une chaîne d'exfiltration de données fonctionnelle.

Agents IAPrompt engineeringSécurité IA
SIG
72
HYP
25
arXiv cs.AI·

Improving Spatio-Temporal Residual Error Propagation by Mitigating Over-Squashing

Teger, un module d'incertitude structuré, améliore la prédiction de séries temporelles spatio-temporelles en atténuant le sur-compression d'information (over-squashing) via un mécanisme de réécriture de graphe basé sur la courbure de Forman. Intégré à une tête de covariance low-rank-plus-diagonal, Teger est agnostique au backbone et montre des gains CRPS constants sur LSTM, Transformer et xLSTM.

RaisonnementBenchmarksPapers
SIG
72
HYP
18
arXiv cs.AI·

Confidence-Gated Robot Autonomy: When Does Uncertainty Actually Help?

Étude sur l'utilisation de l'incertitude prédictive pour la décision autonome/déférence en robotique. Sur trois benchmarks de reconnaissance d'activité temporelle, l'incertitude ne fournit un classement d'erreurs fiable que si le modèle de base est suffisamment compétent. Softmax, MC Dropout et ensembles produisent des comportements similaires ; le choix du seuil a plus d'impact que la méthode d'incertitude.

RobotiqueÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

RAGA: Reading-And-Graph-building-Agent for Autonomous Knowledge Graph Construction and Retrieval-Augmented Generation

RAGA est un agent autonome basé LLM pour la construction de graphes de connaissances et la génération augmentée par récupération. Il remplace les pipelines batch stateless par une boucle ReAct avec opérations CRUD complètes, synchronisation KG-vecteur hybride et vérification ancrée aux sources. Tests sur QASPER montrent des gains mesurables en qualité de réponses et preuves.

Agents IARAGRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

PromptDecipher: Supporting AI Tutor Authoring Through Editable Simulated Interactions

PromptDecipher est un système d'authoring pour chatbots tutoriels IA qui restructure le workflow autour de corrections directes plutôt que de prompts système abstraits. Les enseignants interagissent avec un aperçu de chat en direct, éditent les réponses indésirables du bot, et un pipeline automatisé propose des rewrites de prompts validés sur des scénarios de test prédéfinis.

Prompt engineeringAgents IAOutils
SIG
72
HYP
28
arXiv cs.AI·

Unveiling Memorization-Generalization Coexistence: A Case Study on Arithmetic Tasks with Label Noise

Étude sur la coexistence mémorisation-généralisation dans les réseaux de neurones sur-paramétrés. Avec 80% de bruit d'étiquettes sur des tâches arithmétiques, les modèles mémorisent les labels bruyants mais conservent une structure interne de généralisation. Extraction par méthodes fréquentielles : précision quasi-parfaite. Partitionnement en composantes généralisation/mémorisation proposé.

PapersÉvaluationsAlignement
SIG
72
HYP
15
arXiv cs.AI·

Balancing Knowledge Distillation for Imbalance Learning with Bilevel Optimization

BiKD propose un framework bilevel pour équilibrer dynamiquement les pertes hard et soft en distillation de connaissance sur données déséquilibrées. Un réseau de génération de poids produit des pondérations adaptatives par échantillon, guidé par un ensemble de validation équilibré. Expériences sur CIFAR-10/100 long-tailed montrent des gains sur les méthodes récentes.

Fine-tuningBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

STRIDE: A Self-Reflective Agent Framework for Reliable Automatic Equation Discovery

STRIDE est un framework d'agent auto-réflexif pour la découverte d'équations symboliques par LLM. Il améliore la fiabilité en coordonnant génération consciente des données, évaluation par ajustement mixte, réparation critique-exécuteur et mémoire sémantique préservant la diversité. Les expériences sur benchmarks de régression symbolique montrent gains en précision, robustesse OOD et récupération structurelle.

Agents IARaisonnementBenchmarks
SIG
72
HYP
25
arXiv cs.AI·

Interaction-Breaking Adversarial Learning Framework for Robust Multi-Agent Reinforcement Learning

Nouvelle méthode IBAL pour renforcer la robustesse du MARL face aux perturbations d'interactions inter-agents. Le framework utilise une approche théorique de l'information pour construire des attaques qui dégradent la coordination en perturbant observations et actions, puis entraîne les agents à rester fiables. Amélioration démontrée sur baselines existants et scénarios d'agents manquants.

Multi-agentsReinforcement learning
SIG
72
HYP
18
arXiv cs.AI·

MARR: Module-Adaptive Residual Reconstruction for Low-Bit Post-Training Quantization

MARR propose une méthode de quantification post-entraînement basse précision (≤4-bit) pour LLMs et Vision Transformers. Elle utilise des coefficients d'échelle adaptatifs par module pour équilibrer la correction d'erreur accumulée et le biais introduit par les résidus, via une stratégie de mise à jour basée PID. Gains jusqu'à 20,2% sur LLMs et 4,6% sur ViTs.

VisionPapersBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Whispers in the Noise: Surrogate-Guided Concept Awakening via a Multi-Agent Framework

ConceptAgent, un framework multi-agent sans entraînement, contourne l'effacement de concepts dans les modèles de diffusion en exploitant la dynamique du débruitage. L'approche black-box réveille des concepts supprimés en initialisant la trajectoire de débruitage via des états bruyants guidés par substitut, sans accès aux paramètres du modèle.

Multi-agentsSécurité IAGénération d'images
SIG
72
HYP
35
arXiv cs.AI·

Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA

Étude de la compression de prompts sur LLaDA, un DLLM de 8B paramètres, utilisant LLMLingua-2. Évaluation sur GSM8K, DUC2004, ShareGPT avec ratio 2× montre que la préservation sémantique ne garantit pas la stabilité en modèles diffusion : le raisonnement mathématique se dégrade fortement tandis que la résumé reste robuste. Les méthodes de compression autorégressives ne transfèrent pas uniformément aux DLLMs.

Prompt engineeringBenchmarksRaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning

Distinguishable Deletion (D²) unifie suppression de connaissance et refus pour l'oubli des LLM. La méthode utilise un index énergétique pour effacer les connaissances indésirables dans les représentations latentes plutôt que des tokens spécifiques, évitant la suppression biaisée et la réémergence de contenu nuisible. Energy-based Unlearning Alignment (EUA) applique ce mécanisme à l'entraînement et l'inférence.

Sécurité IAAlignementPapers
SIG
72
HYP
25