Page 100 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

RAPT: Retrieval-Augmented Post-hoc Thresholding for Multi-Label Classification

RAPT est un wrapper de post-traitement retrieval-augmented pour améliorer la sélection d'étiquettes en classification multi-label sans réentraînement. Appliqué à des encodeurs metric learning et transformers fine-tunés, RAPT atteint 0.87 Macro-F1 sur données industrielles, surpassant les baselines statiques et les LLMs few-shot (K=5) avec 115x moins de temps d'inférence.

RAGBenchmarksFine-tuning
SIG
72
HYP
18
arXiv cs.AI·

Enhancing Cloud Network Resilience via a Robust LLM-Empowered Multi-Agent Reinforcement Learning Framework

CyberOps-Bots combine un agent LLM avec des agents RL multi-niveaux pour défendre les réseaux cloud contre les attaques. Le framework hiérarchique utilise la planification ReAct et la mémoire long-court terme. Sur données cloud réelles, il maintient 68,5% plus de disponibilité et gagne 34,7% en performance sans réentraînement lors de changements de scénarios.

Multi-agentsReinforcement learningRaisonnement
SIG
72
HYP
35
arXiv cs.AI·

ADMEDTAGGER: an annotation framework for distillation of expert knowledge for the Polish medical language

Framework d'annotation utilisant Llama3.1 comme modèle professeur pour étiqueter des textes médicaux polonais. Corpus de 5 catégories cliniques (Radiologie, Oncologie, Cardiologie, Hypertension, Pathologie). DistilBERT atteint F1 > 0.80 par catégorie, 500× plus petit qu'un LLM, 300× moins de VRAM, inférence plusieurs centaines de fois plus rapide.

LlamaFine-tuningBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications

Étude sur le retrait contrôlé de l'alignement de sécurité dans les modèles de langage pour évaluer les capacités en cybersécurité. Compare prompting en contexte autorisé, projection de direction de refus et LoRA. Sur 60 tâches (Security-AR), la projection LoRA seule atteint 0,87 en score sécurité avec 0,83 en capacités générales, mais augmente la conformité dangereuse non autorisée.

Sécurité IAAlignementFine-tuning
SIG
72
HYP
15
arXiv cs.CL·

Response-free item difficulty modelling for multiple-choice items with fine-tuned transformers: Component-wise representation and multi-task learning

Modélisation de la difficulté d'items sans réponses pour questions à choix multiples via transformers fine-tunés. Approche end-to-end sur le texte des items éliminant l'ingénierie manuelle des features. Variante multi-tâche avec objectif auxiliaire QA améliore significativement les petits ensembles d'entraînement.

Fine-tuningBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

LEAF: A Living Benchmark for Event-Augmented Forecasting

LEAF est un benchmark vivant pour évaluer les capacités de prévision des LLM en utilisant des événements multidimensionnels. Le système utilise des agents de récupération récursive et une validation croisée multi-agents pour fournir du contexte textuel aux modèles. Les tests montrent que les LLM exploitent les signaux d'événements complexes pour améliorer les prévisions boursières.

BenchmarksAgents IAMulti-agents
SIG
72
HYP
28
arXiv cs.AI·

DiPRL: Learning Discrete Programmatic Policies via Architecture Entropy Regularization

DiPRL propose une méthode d'apprentissage par renforcement programmatique qui génère des politiques discrètes interprétables sans étape de discrétisation post-hoc. Via régularisation d'entropie architecturale, le modèle converge vers des programmes discrets pendant l'entraînement, évitant la perte de performance et la nécessité d'ajustement fin supplémentaire.

Reinforcement learningRaisonnementPapers
SIG
72
HYP
18
arXiv cs.LG·

Forecasting Medium-Horizon Alzheimer's Disease Progression: Residual Gap-Aware Transformers for 24-Month CDR-SB Change from ADNI Clinical and Biomarker Histories

Modèle transformer résiduel sensible aux lacunes temporelles pour prédire la progression de la maladie d'Alzheimer sur 24 mois. Entraîné sur 2 600 échantillons ADNI, il réduit l'erreur quadratique de 13,1% et augmente la corrélation de 26,4% par rapport à un modèle linéaire mixte, en combinant une référence statistique avec apprentissage résiduel sur historiques cliniques et biomarqueurs irréguliers.

BenchmarksPapersRaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Systematic Evaluation of Vision Transformers for Automated Cervical Cancer Classification: Optimization, Statistical Validation, and Clinical Interpretability

Étude d'optimisation systématique de Vision Transformers (ViT-Tiny) pour le dépistage du cancer du col utérin sur le dataset Herlev (917 images). Configuration optimale : 94,9%-95,2% de précision en validation croisée avec augmentation horizontale et pondération de classe (0,7 x 1,3). Grad-CAM valide l'interprétabilité clinique : attention sur noyaux, limites cellulaires et texture chromatinienne.

VisionBenchmarksÉvaluations
SIG
72
HYP
25
arXiv cs.CL·

Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment

Nouvel article arXiv proposant HRC (Hybrid Reward-Cyclic), un modèle de récompense qui décompose les préférences humaines en composantes transitives (scalaires) et cycliques (vectorielles) via la théorie des jeux. Introduit DSPPO (Dynamic Self-Play Preference Optimization) pour l'alignement dynamique. Améliore RewardBench 2 (+1.23% sur Gemma-2B-it) et atteint 44.75% sur AlpacaEval 2.0.

Reinforcement learningAlignementPapers
SIG
72
HYP
25
arXiv cs.AI·

PropGuard: Safeguarding LLM-MAS via Propagation-Aware Exploration and Remediation

PropGuard est un framework de sécurité pour les systèmes multi-agents basés sur LLM (LLM-MAS). Il détecte et neutralise les injections malveillantes propagées entre agents via un graphe spatio-temporel dual et un inspecteur entraîné par GE-GRPO. Les tests sur 4 architectures et 5 scénarios d'attaque montrent une réduction significative du succès des attaques.

Multi-agentsSécurité IAAgents IA
SIG
72
HYP
18
arXiv cs.CL·

Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades

Étude de la propagation d'erreurs ASR dans les cascades ASR-LLM pour la compréhension orale en coréen. Les erreurs de reconnaissance vocale causent des défaillances sémantiques que les métriques ASR classiques ne capturent pas. Les erreurs d'un seul caractère en coréen créent un canal de défaillance distinct. Un modèle audio-langage large surpasse le pipeline ASR-LLM sur données bruitées.

VoixRaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.LG·

Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders

Des chercheurs identifient l'instabilité des préférences dans les modèles de récompense via des variations d'entrée subtiles (paraphrases, injections de motifs, backdoors). Ils isolent les features instables avec des autoencodeurs creux (SAEs) et proposent deux stratégies d'atténuation : SAE Feature Steering et SAE Residual Correction, réduisant les assignations de préférences incorrectes sans réentraînement.

AlignementSécurité IAÉvaluations
SIG
72
HYP
18
arXiv cs.LG·

Orth-Dion: Eliminating Geometric Mismatch in Distributed Low-Rank Spectral Optimization

Orth-Dion améliore Dion, un optimiseur spectral pour l'entraînement distribué à faible rang. En remplaçant la normalisation de colonnes par une orthogonalisation QR, la méthode élimine un facteur √r dans la convergence et atteint le taux O(√L_r/T) des méthodes spectrales exactes. Validation sur pré-entraînement de modèles de langage.

Reinforcement learningBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

Online Algorithms with Unreliable Guidance

Nouvel article arXiv présentant OAG (Online Algorithms with Unreliable Guidance), un modèle pour l'apprentissage augmenté en ligne qui sépare composantes prédictives et algorithmiques. Introduit le compilateur DTB (drop-or-trust-blindly) convertissant algorithmes online standards en versions augmentées. Démontre garanties optimales sur matching bipartite, caching et tâches métriques uniformes.

RaisonnementBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

Modality vs. Morphology: A Framework for Time Series Classification for Biological Signals

Revue unifiée sur la classification de séries temporelles de signaux biologiques (EEG, EMG, ECG, PPG, oculomoteurs). Le cadre morphologie-modalité montre que la structure des ondes (pics, rafales, oscillations, dérives) détermine plus fortement les performances que l'architecture du modèle. Les biais inductifs alignés avec la dynamique physiologique améliorent interprétabilité et généralisation.

BenchmarksVisionPapers
SIG
72
HYP
15
arXiv cs.CL·

Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA

Étude de la compression de prompts sur LLaDA, un DLLM de 8B paramètres, avec LLMLingua-2. Évaluation sur GSM8K, DUC2004, ShareGPT à ratio 2× montre que la préservation sémantique ne garantit pas la stabilité en modèles diffusion : le raisonnement mathématique se dégrade fortement tandis que la résumé reste robuste. Les méthodes autorégressives ne transfèrent pas uniformément aux DLLMs.

Prompt engineeringBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

AdaGraph: A Graph-Native Clustering Algorithm That Overcomes the Curse of Dimensionality and Enables Scientific Discovery

AdaGraph est un algorithme de clustering graph-native qui élimine la malédiction de la dimensionnalité en opérant sur la topologie kNN plutôt que sur des métriques euclidiennes. Sans spécifier k a priori, il identifie des modules de gènes en génomique (GSE14520, 10k gènes), atteint ARI=0.751 en clustering texte (20NG-6cat vs HDBSCAN 0.464), et surpasse Silhouette/Davies-Bouldin sur 10 benchmarks jusqu'à d=5000.

BenchmarksPapers
SIG
72
HYP
28
arXiv cs.LG·

Flow-Direct: Feedback-Efficient and Reusable Guidance for Flow Models via Non-Parametric Guidance Field

Flow-Direct propose un cadre de guidage sans entraînement pour modèles de flux utilisant un champ de guidage non-paramétrique persistant. Dérivé analytiquement du ratio log-densité entre distributions de base et pondérées par récompense, ce champ accumule tous les échantillons évalués pour améliorer l'efficacité feedback et permettre la réutilisabilité sans nouvelles évaluations de récompense.

PapersRaisonnementReinforcement learning
SIG
72
HYP
18
arXiv cs.AI·

When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning

Étude d'attaques adversariales par suppression d'actions en apprentissage par renforcement auto-jeu. Un attaquant retire sélectivement des actions légales de l'ensemble disponible pour la victime. Sur des jeux de poker (6 à 5 531 états) et deux domaines non-poker, le masquage appris cause plus de dégâts que le masquage aléatoire. L'attaque persiste sur Q-learning, PPO, NFSP, DQN et ne montre pas de récupération.

Reinforcement learningSécurité IABenchmarks
SIG
72
HYP
18