Page 101 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

PPAI: Enabling Personalized LLM Agent Interoperability for Collaborative Edge Intelligence

PPAI est un système d'interopérabilité pour agents LLM personnalisés en edge computing. Il permet la collaboration P2P entre utilisateurs en routant les requêtes vers des agents spécialisés distants. Le système propose un mécanisme de scoring query-agent basé sur des prototypes et un jeu bayésien multi-agent pour équilibrer la charge. Résultats : +7,96% de précision, -16,34% de latence.

Agents IAMulti-agentsBenchmarks
SIG
72
HYP
25
arXiv cs.AI·

Does Your Reasoning Model Implicitly Know When to Stop Thinking?

Les modèles de raisonnement long (LRM) génèrent des chaînes de pensée redondantes sans corrélation avec la justesse. L'article découvre que les LRM savent implicitement quand arrêter. SAGE (Self-Aware Guided Efficient Reasoning) exploite cette capacité via un nouveau paradigme d'échantillonnage, améliorant précision et efficacité sur benchmarks mathématiques.

RaisonnementReinforcement learningBenchmarks
SIG
72
HYP
28
arXiv cs.AI·

MusicSynth: An Automated Pipeline for Generating Violin Fingerboard Animations from Sheet Music Using Optical Music Recognition

MusicSynth est un outil web open-source qui convertit automatiquement des partitions de violon (photo ou fichier) en vidéos animées montrant le positionnement des doigts sur le manche. Le système combine reconnaissance optique de musique (OMR), parsing MusicXML et rendu vidéo. Testé sur 110 partitions : 91,2% de reconnaissance des notes en musique imprimée, 99,1% de précision en positionnement des doigts.

VisionGénération de codeOpen source
SIG
72
HYP
25
arXiv cs.AI·

Task-Level AI Readiness Assessment for Business Process Management:The T-IPO Model and LARA Matrix in Financial-Services IT Operations

Papier arXiv proposant T-IPO et LARA, deux outils pour évaluer la capacité des agents LLM à gérer des tâches métier. LARA est une matrice 5 dimensions classant les tâches en 4 niveaux (L1-L4), avec poids 1.5× sur la sensibilité compliance. Validation sur 127 tâches (κ=0.80), réplication sur 3 institutions (κ=0.73). Auto-completion décroît de 95% (L1) à 40% (L3).

Agents IAÉvaluationsPapers
SIG
72
HYP
15
arXiv cs.CL·

Presupposition and Reasoning in Conditionals: A Theory-Based Study of Humans and LLMs

Étude comparative des jugements humains et prédictions de 4 LLMs sur la projection de présuppositions dans les conditionnels. 120 participants évalués en parallèle avec les modèles. Les humains intègrent indices probabilistes et pragmatiques ; les LLMs montrent alignement variable. Les modèles alignés aux humains manquent de raisonnement pragmatique cohérent.

BenchmarksRaisonnementPapers
SIG
72
HYP
15
arXiv cs.AI·

StrLoRA: Towards Streaming Continual Visual Instruction Tuning for MLLMs

StrLoRA introduit un cadre de tuning visuel continu en streaming pour MLLMs. Contrairement aux méthodes existantes limitées à des tâches prédéfinies, StrCVIT traite des flux de données avec tâches dynamiques et entrelacées. StrLoRA utilise un routage d'experts à deux étapes avec sélection consciente des tâches et pondération token-wise, stabilisé par régularisation.

Multi-agentsFine-tuningVision
SIG
72
HYP
28
arXiv cs.AI·

AI4BayesCode: From Natural Language Descriptions to Validated Modular Stateful Bayesian Samplers

AI4BayesCode traduit des descriptions en langage naturel en samplers MCMC validés et modulaires. Le système décompose les modèles bayésiens en blocs de sampling mappés à des composants intégrés, avec validation pré et post-génération. Une architecture stateful récursive permet la composition cohérente de composants développés indépendamment.

Génération de codeAgents IARaisonnement
SIG
72
HYP
28
arXiv cs.CL·

AI Slop or AI-enhancement? Student perceptions of AI-generated media for an English for Academic Purposes course

Étude d'implémentation de Google Notebook LM pour générer vidéos, podcasts et infographies dans un cours d'anglais académique (106 étudiants, Hong Kong). Les étudiants ont apprécié l'utilité perçue et la facilité d'usage ; préférence pour contenus visuels/multimodaux. Corrélation positive entre préférence vidéo et performance académique, mais charge cognitive élevée associée à baisse des notes.

RAGOutilsÉvaluations
SIG
72
HYP
25
arXiv cs.AI·

From Reactive to Proactive: A Multi-Regulatory Empirical Analysis of 480 AI Incidents and a Data-Driven Governance Compliance Framework

Analyse de 480 incidents IA réels du AIID comparés aux cadres de gouvernance EU AI Act, NIST AI Risk Management Framework et GDPR. Révèle des lacunes substantielles dans la responsabilité post-déploiement. Propose le Proactive AI Governance Compliance Framework (PAGCF), méthodologie en 4 phases pour passer d'une gouvernance réactive à une assurance de conformité pré-déploiement.

RégulationSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.AI·

SAFE-SVD: Sensitivity-Aware Fidelity-Enforcing SVD for Physics Foundation Models

SAFE-SVD propose une méthode de compression pour les modèles fondamentaux de physique (PFM) qui préserve la fidélité physique. La technique modélise la sensibilité des couches dans l'espace fonctionnel de sortie, évitant la dégradation sévère des performances causée par les méthodes conventionnelles. Les expériences montrent des gains substantiels en ratios de compression tout en maintenant la précision.

PapersBenchmarksInfrastructure
SIG
72
HYP
28
arXiv cs.CL·

MA$^{2}$P: A Meta-Cognitive Autonomous Intelligent Agents Framework for Complex Persuasion

MA²P est un framework multi-agent autonome pour la persuasion complexe. Il coordonne la gestion de la perception, l'inférence d'états mentaux, l'exécution de stratégies et l'évaluation des performances. Un configurateur meta-cognitif sélectionne une méta-stratégie adaptée au domaine pour améliorer la généralisation et le taux de succès de persuasion.

Agents IAMulti-agentsRaisonnement
SIG
72
HYP
35
arXiv cs.AI·

Latent Action Reparameterization for Efficient Agent Inference

LAR (Latent Action Reparameterization) compresse l'espace d'actions des agents LLM en apprenant des actions latentes multi-étapes sémantiques. Cela réduit l'horizon de décision effectif et les coûts d'inférence tout en préservant l'expressivité. Sur plusieurs benchmarks, LAR diminue les tokens d'action et le temps d'inférence sans dégrader les taux de succès.

Agents IAGénération de codeRaisonnement
SIG
72
HYP
25
arXiv cs.CL·

LLM-Based Intelligent Notification Composition: From Static Personalization to Context-Aware Persuasive Messaging

Étude sur l'utilisation des LLM pour composer des notifications push personnalisées et persuasives. Les auteurs définissent 6 dimensions de qualité (pertinence contextuelle, clarté, actionnabilité, etc.) et montrent des gains de +8% à +14.5% en CTR vs templates statiques. Propose un framework architectural avec routing budgété, génération ancrée et apprentissage en ligne.

Prompt engineeringRAGBusiness
SIG
72
HYP
28
arXiv cs.AI·

Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs

Fre-Res propose une compression adaptative des tokens vidéo pour les MLLMs vidéo. Le framework sépare les détails spatiaux (ancres haute-fidélité) et l'évolution temporelle (tokens résidus-fréquence via DCT 1D). Un Spatial-Guided Absorber aligne les dynamiques fréquentielles avec les embeddings visuels. Résultats : performance proche du full-token avec réduction substantielle de la longueur des tokens.

VisionGénération de vidéosÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

When Outcome Looks Right But Discipline Fails: Trace-Based Evaluation Under Hidden Competitor State

Article proposant une évaluation basée sur les traces pour détecter quand un agent atteint ses KPI économiques mais viole les contraintes comportementales. Dans un cadre de tarification hôtelière avec état concurrent caché, les auteurs montrent que PPO seul échoue à préserver l'alignement avec le comportement de référence, tandis que le clonage comportemental et une RL avec historique préalable réussissent mieux.

Reinforcement learningÉvaluationsAgents IA
SIG
72
HYP
15
arXiv cs.AI·

AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment

AMR-SD propose une auto-distillation asymétrique avec réflexion méta pour améliorer l'attribution de crédit au niveau des tokens dans l'entraînement par renforcement des LLM. La méthode compresse les signaux de diagnostic en indices socratiques auto-générés et utilise un gain d'information causale avec seuil ReLU asymétrique pour moduler les avantages par token, évitant l'effondrement en fin d'entraînement.

Reinforcement learningRaisonnementAlignement
SIG
72
HYP
18
arXiv cs.CL·

Alignment Drift in Long-Term Human-LLM Interaction: A Mechanism-Oriented Framework

Étude sur la « dérive d'alignement » : processus graduel où les sorties LLM deviennent moins contraintes par le message actuel de l'utilisateur et plus façonnées par l'historique d'interaction, tout en restant utiles. Framework mécaniste distinguant signaux A/B, boucles de rétroaction et régimes interactionnels pour contrôler cette dérive cumulative.

AlignementAgents IASécurité IA
SIG
72
HYP
18
arXiv cs.CL·

Mitigating Extrinsic Gender Bias for Bangla Classification Tasks

Étude sur le biais de genre extrinsèque dans les modèles de langage préentraînés en bengali. Construction de 4 datasets annotés manuellement (analyse de sentiment, détection de toxicité, discours haineux, sarcasme) avec perturbations de genre minimales. Proposition de RandSymKL, stratégie de débiaisage combinant divergence KL symétrique et cross-entropy. Code et datasets publics.

BenchmarksSécurité IAAlignement
SIG
72
HYP
15
arXiv cs.CL·

To MRL or not to MRL: Text Embeddings are Robust to Truncation Without Matryoshka Embeddings, Except In Heavy Truncation Scenarios

Une étude arXiv compare l'apprentissage Matryoshka (MRL) avec la troncature simple d'embeddings textuels. Les résultats montrent que sans MRL, les embeddings restent robustes jusqu'à 80% de réduction dimensionnelle. MRL n'offre un avantage que pour les troncatures très agressives (>80%), remettant en question son coût d'entraînement systématique.

EmbeddingsPapersBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

FIM-LoRA: Task-Informative Rank Allocation for LoRA via Calibration-Time Gradient-Variance Estimation

FIM-LoRA optimise l'allocation de rang dans LoRA en utilisant 8 passes de calibration pour estimer la variance des gradients par couche. Cette approche sans paramètres supplémentaires atteint les mêmes performances que LoRA standard (88.6 vs 88.7 sur GLUE avec DeBERTa-v3-base) tout en réduisant les coûts mémoire de 256x comparé à l'estimation Fisher complète.

Fine-tuningPapersBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Latency-Aware Deep Learning Benchmark for Real-Time Cyber-Physical Attack and Fault Classification in Inverter-Dominated Power Grids

Benchmark latency-aware pour 8 architectures deep learning (MLPs, Transformers) en détection d'anomalies sur réseaux électriques dominés par onduleurs. Classification en temps réel < 15 ms par cycle, mais latence end-to-end 50-90 ms (3+ cycles). Écart critique entre capacité algorithmique et déploiement protection-grade identifié.

BenchmarksRaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks

Article arXiv sur les limites spatiales des MLLMs en environnements multi-agents. Les modèles souffrent d'une « illusion cartésienne » : ils manquent de compréhension 3D topologique ancrée. Les auteurs proposent un module « Epistemic Sensory Bottleneck » avec une chaîne de pensée basée sur des ancres pour améliorer l'inférence spatiale de second ordre (Theory of Mind). Baseline zéro-shot : 42% de précision.

VisionMulti-agentsRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation

PPR-GDE, une méthode RL pour la génération ouverte, utilise des récompenses de préférence par paires et une diversité basée sur les groupes pour éviter l'effondrement de la diversité. Sans récompenses scalaires, elle préserve les évaluations subjectives et encourage la dispersion sémantique dans les groupes de réponses.

Reinforcement learningRaisonnementÉvaluations
SIG
72
HYP
25