Page 83 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language Models

Framework hiérarchique pour LLMs compacts en systèmes agentiques sous contraintes (mémoire, latence, coût). Distillation du modèle + boucle oracle-contrôleur qui valide les protocoles, projette l'historique dans un domaine de prompt viable, et déclenche du fine-tuning léger. Séparation entre apprentissage du schéma et adaptation sémantique. Évaluation sur Multi-Fidelity Bayesian Optimization.

Agents IAFine-tuningPrompt engineering
SIG
72
HYP
18
arXiv cs.CL·

Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models

Méthode pour contrôler finement le style vocal dans les modèles TTS basés sur prompts. Interpolation entre styles via vecteurs directionnels dans l'espace d'embedding (99-100% succès conversion genre, variation pitch 36 Hz). Transitions intra-énoncé via KV-cache swapping et sliding-window attention masking (similarité locuteur 0.81-0.91).

VoixPrompt engineeringPapers
SIG
72
HYP
18
arXiv cs.CL·

LCO: LLM-based Constraint Optimization for Safer Agentic LLMs in Real-world Tasks

LCO (LLM-based Constraint Optimization) est un framework qui réduit le reward hacking en contexte (ICRH) chez les LLMs autonomes sans fine-tuning. Deux modules : auto-réflexion pour intégrer des contraintes de sécurité, et échantillonnage évolutionnaire pour maintenir les actions dans un espace sûr. Sur GPT-4, réduction de 39% du taux de toxicité et 15.23% de l'ICRH.

Agents IASécurité IAAlignement
SIG
72
HYP
25
arXiv cs.AI·

Prefix-Safe Bayesian Belief Tracking for LLM Reasoning Reliability:Separating Calibration from Ranking

Méthode de suivi bayésien séquentiel (SBBT) pour estimer la fiabilité des traces de raisonnement LLM avant la réponse finale. Évalue P(y=1|o_{1:t}) sur MATH-500, GSM8K, AIME 2025, RIMO-N. Les scores scalaires améliorent la calibration (Brier), tandis que les signaux structurés gagnent +0.110 AUROC en mathématiques difficiles.

RaisonnementÉvaluationsBenchmarks
SIG
72
HYP
18
arXiv cs.CL·

UniMaia: Steering Chess Policies with Language for Human-like Play

UniMaia est un framework qui contrôle une politique d'échecs (Lc0) via des prompts en langage naturel, sans réentraînement multimodal complet. Un encodeur texte léger et un mécanisme ControlNet permettent de moduler le jeu (sélection d'ouverture, niveau). UniMaia-Aux ajoute des objectifs temporels et de prédiction comportementale. Résultats SOTA sur benchmarks prompt-conditionnés.

Prompt engineeringRaisonnementFine-tuning
SIG
72
HYP
25
arXiv cs.LG·

Metric-Aware PCA as a Linear Instance of Geometric Deep Learning

Article théorique positionnant l'Analyse en Composantes Principales Métrique-Consciente (MAPCA) dans le cadre du deep learning géométrique. MAPCA paramétre l'ACP par une matrice métrique définie positive, avec solutions équivariantes sous le groupe orthogonal préservant la métrique. Un théorème d'unicité caractérise l'ACP Invariante comme unique métrique linéaire équivariante sous rescaling diagonal.

PapersRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

Personalized Observation Normalization for Federated Reinforcement Learning in Simulation Environments with Heterogeneity

Méthode de normalisation d'observation personnalisée (PON) pour l'apprentissage par renforcement fédéré en environnements hétérogènes. Chaque agent normalise localement ses entrées d'état avec moyenne et variance mises à jour continuellement, évitant les problèmes d'agrégation de paramètres déséquilibrés. Tests sur tâches MuJoCo hétérogènes montrent accélération d'entraînement et performance supérieure.

Reinforcement learningMulti-agents
SIG
72
HYP
18
arXiv cs.LG·

$E^3$-Agent: An Executable and Evolving Agent for Resource Management of Edge Generative Inference

E³-Agent est un agent IA exécutable et adaptatif pour la gestion des ressources d'inférence générative sur edge. Il combine un routeur rapide (décisions en millisecondes) et un contrôleur LLM lent piloté par événements, apprenant en ligne des retours d'exécution. Évalué en simulation, il réduit la latence de 65-73% vs baselines statiques sur scénarios dynamiques (sémantique, churn, drift).

Agents IARaisonnementInfrastructure
SIG
72
HYP
28
arXiv cs.LG·

Architecture-driven Shift: towards a lightweight selector for capturing the trends of logit shift

Nouvelle métrique Architecture-driven Shift (ADS) pour sélectionner efficacement les modèles pré-entraînés en apprentissage continu. ADS décompose le logit shift en dépendances architecturales et données, révélant que la combinaison capture bien la tendance du logit shift avec peu d'échantillons. Validation sur 175+ architectures avec corrélation Spearman ≥0.731.

Reinforcement learningBenchmarksPapers
SIG
72
HYP
18
arXiv cs.LG·

Balancing Fidelity and Diversity in Diffusion Models via Symmetric Attention Decomposition: Hopfield Perspective

Article théorique décomposant la matrice d'attention pré-softmax en composantes symétrique et antisymétrique. La partie symétrique gouverne le paysage énergétique, la partie antisymétrique pilote la circulation. Les auteurs proposent des mesures de stabilité Hopfield pour quantifier la fidélité-diversité en génération et un contrôle pour moduler ce compromis.

RaisonnementPapersVision
SIG
72
HYP
15
arXiv cs.LG·

Comparative Analysis of Liquid Neural Networks and LSTM for Sequential Pattern Recognition: Robustness, Efficiency, and Clinical Utility

Étude comparative entre réseaux de neurones liquides (LNN/CfC) et LSTM sur quatre modalités séquentielles (N-MNIST, QuickDraw, IAM, PhysioNet Sepsis-3). Les LNN modélisent l'évolution de l'état caché comme équation différentielle continue. Résultats : LNN surpassent LSTM en efficacité paramétrique et robustesse face aux données manquantes, particulièrement en domaines cliniques.

BenchmarksRaisonnement
SIG
72
HYP
18
arXiv cs.LG·

Detect by Yourself: Self-Designing Agentic Workflows for Few-Shot Graph Anomaly Detection

SignGAD propose un framework d'agents auto-configurables pour la détection d'anomalies en graphes avec peu d'exemples. Au lieu d'utiliser un détecteur fixe, le système conçoit des workflows adaptés à chaque tâche en sélectionnant encodages et designs de détecteurs appropriés. Une stratégie de refit gardée affine les workflows sélectionnés sous supervision limitée.

Agents IABenchmarksPapers
SIG
72
HYP
28
arXiv cs.LG·

Resource-Constrained Affect Modelling via Variance Regularisation Pruning

Variance-Regularised Pruning (VR) est une méthode de compression de modèles pour l'affective computing qui priorise la stabilité inter-utilisateurs plutôt que la seule parcimonie. Testée sur le dataset AGAIN (9 environnements de jeu), VR maintient des performances CCC compétitives à 80% de sparsité sans fine-tuning supplémentaire, adaptée aux systèmes embarqués.

ÉvaluationsFine-tuningPapers
SIG
72
HYP
15
arXiv cs.LG·

SparseOpt: Addressing Normalization-induced Gradient Skew in Sparse Training

SparseOpt, un optimiseur conscient de la parcimonie, résout le problème de gradient asymétrique induit par la normalisation par batch en entraînement sparse dynamique. Tests sur ResNet (CIFAR-100, ImageNet) montrent convergence plus rapide et meilleure généralisation. Première étude systématique de l'interaction entre Batch Normalization, couches sparse et DST.

PapersBenchmarksFine-tuning
SIG
72
HYP
18
arXiv cs.CL·

Modeling Community Attitude through Reaction Tone: A Human-AI Collaborative Framework for Evaluating LLM Alignment with Linguistic Behaviors in Online Communities

CARE, un framework d'évaluation, mesure la capacité des LLM à simuler les réactions authentiques de communautés en ligne face à l'actualité. L'étude révèle un « realism gap » : les prompts explicites de communauté n'améliorent pas la fidélité de simulation. Les modèles frontière montrent des signatures comportementales divergentes.

ÉvaluationsAlignementBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

Supervised Distributional Reduction via Optimal Transport and Dependence Maximization

SDR (Supervised Distributional Reduction) combine le transport optimal et la maximisation de dépendance pour apprendre des représentations cibles. L'algorithme étend l'objectif Fused Gromov-Wasserstein avec un terme de dépendance explicite, produisant des embeddings compacts qui capturent structure géométrique et signal prédictif. Application aux processus gaussiens avec noyaux adaptatifs.

Papers
SIG
72
HYP
15
arXiv cs.LG·

Faster Thermal Profiling of a Lunar Rover with Machine Learning Adapted Finite Difference Model

Un framework de machine learning informé par la physique (PIML) pour modéliser thermiquement un rover lunaire. Un réseau de neurones adaptatif détermine le maillage 3D en différences finies selon les charges thermiques, améliorant la précision de 50% vs modèles coarse-mesh et 39% vs ANN pur, tout en étant 3x plus rapide que les simulations haute-fidélité.

RaisonnementBenchmarksRobotique
SIG
72
HYP
15
arXiv cs.LG·

Transferable Reinforcement Learning via Probabilistic Latent Embeddings and Dynamic Policy Adaptation for Sim-to-Real Deployment

Framework RL pour transfert de politique sim-to-real via embeddings latents probabilistes et adaptation dynamique. Utilise meta-RL et CMDPs pour inférer la représentation latente de l'environnement, avec formulation distributional RL ajustant dynamiquement les niveaux de risque selon la précision d'estimation du contexte latent.

Reinforcement learningRobotiqueSécurité IA
SIG
72
HYP
18
arXiv cs.LG·

Test-Time Collective Action: Proxy-Based Perturbations for Correcting Algorithmic Harms

Nouvelle approche permettant à des groupes d'utilisateurs de corriger les biais algorithmiques sans intervention de la plateforme. Test-Time Collective Action (TTCA) utilise des perturbations universelles générées via un proxy du modèle pour améliorer l'équité sans accès à l'entraînement. Validation sur CIFAR-10, CIFAR-100 et FairFace montre la fermeture des écarts de précision entre sous-groupes.

Sécurité IAAlignementÉvaluations
SIG
72
HYP
18
arXiv cs.LG·

Bayesian Deployment Approval for Learned Landing Controllers under Finite Rollout Validation

Framework bayésien pour valider le déploiement de contrôleurs d'atterrissage autonomes entraînés par RL. Utilise l'inférence bayésienne pour quantifier l'incertitude sur la capacité réelle des politiques, au-delà des métriques empiriques (reward, taux de succès). Expériences avec PPO et SAC montrent que l'optimisation empirique surconfiance, tandis que l'inférence bayésienne calibre mieux la confiance de déploiement.

Reinforcement learningSécurité IARobotique
SIG
72
HYP
15
arXiv cs.AI·

EAPO: Entropy-Driven Adaptive Positive-Negative Sample Weighting for Policy Optimization in Open-Ended QA

EAPO est une méthode d'optimisation de politique adaptative pour l'entraînement de modèles de raisonnement en QA ouvert. Elle ajuste dynamiquement le poids des échantillons positifs/négatifs selon le ratio d'entropie courante/initiale pour préserver l'exploration et la stabilité. Tests sur deux datasets médicaux montrent amélioration de la diversité et stabilité vs baselines à poids fixes.

Reinforcement learningRaisonnementÉvaluations
SIG
72
HYP
18
arXiv cs.LG·

Can Entry-Wise Clipping Give Spectral Control of Stochastic Gradients?

Article théorique sur le contrôle spectral du bruit de gradient stochastique via clipping entrée-par-entrée. Montre qu'une méthode simple d'écrêtage entrée-par-entrée peut équilibrer structure matricielle et coût computationnel, avec garanties de convergence O(ε⁻⁴) sous bruit Cauchy-contaminé. Gains empiriques : ~7% de tokens économisés sur NanoGPT avec shrinkage lisse, ~2% supplémentaires combiné avec Muon.

PapersReinforcement learningBenchmarks
SIG
72
HYP
15