Page 104 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

NaviRAG: Towards Active Knowledge Navigation for Retrieval-Augmented Generation

NaviRAG propose un framework RAG qui remplace la récupération passive par une navigation active du savoir. Le système structure les documents en hiérarchie sémantique et utilise un agent LLM pour naviguer itérativement, identifiant les lacunes informationnelles et récupérant du contenu au niveau de granularité approprié. Résultats : amélioration de la récupération et de la performance QA sur documents longs.

RAGAgents IARaisonnement
SIG
72
HYP
28
arXiv cs.AI·

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models

HT-GRPO, une méthode d'apprentissage par renforcement hiérarchique pour les modèles de diffusion multi-modaux, organise l'optimisation en trois étapes (global, structure, raffinement). Elle résout le problème des séquences de démasquage multiples et attribue des récompenses différenciées selon l'importance des tokens. Tests sur MMaDA et Lumina-DiMOO montrent des gains sur GenEval et DPG.

Reinforcement learningGénération d'imagesBenchmarks
SIG
72
HYP
25
arXiv cs.CL·

From Chatbots to Confidants: A Cross-Cultural Study of LLM Adoption for Emotional Support

Étude cross-culturelle sur 4,641 participants dans 7 pays montrant que l'adoption des LLM pour le soutien émotionnel varie de 20% à 59%. Les utilisateurs âgés de 25-44 ans, religieux, mariés et de statut socioéconomique élevé rapportent plus de confiance. Les demandes portent sur la solitude, le stress, les conflits relationnels et la santé mentale. Corpus de 731 prompts multilingues collectés.

Sécurité IAAlignementRégulation
SIG
72
HYP
25
arXiv cs.CL·

The Frequency Confound in Language-Model Surprisal and Metaphor Novelty

Une étude arXiv analyse la relation entre surprisal (imprévisibilité) des modèles de langage et la nouveauté métaphorique. Sur 8 tailles de Pythia et 154 checkpoints, la fréquence lexicale prédit mieux la nouveauté métaphorique que le surprisal. L'association surprisal-nouveauté culmine en phase d'entraînement précoce puis décline, miroir de l'association surprisal-fréquence.

PapersBenchmarksÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

The Lattice Representation Hypothesis of Large Language Models

Une hypothèse propose que les LLM encodent des treillis de concepts (lattices) dans leur géométrie d'embeddings. Le cadre unifie la Linear Representation Hypothesis avec l'Analyse Formelle de Concepts (FCA), montrant que les directions d'attributs linéaires induisent des treillis via intersections d'hyperplans. Expériences sur WordNet valident que les embeddings capturent les structures logiques et hiérarchiques.

RaisonnementPapersEmbeddings
SIG
72
HYP
18
arXiv cs.AI·

DiagEval: Trajectory-Conditioned Diagnosis for Reliable Software Evaluation with GUI Agents

DiagEval est un protocole d'évaluation diagnostique pour les agents GUI testant des logiciels interactifs générés par LLM. Il réutilise les trajectoires échouées pour identifier si les défaillances proviennent de l'évaluateur ou du logiciel. Sur WebDevJudge-Unit et RealDevBench, DiagEval récupère 45.6-62.1% des faux négatifs et améliore la précision de 69.9% à 78.3% et de 65.0% à 81.6%.

Agents IAÉvaluationsGénération de code
SIG
72
HYP
18
arXiv cs.AI·

GRID: Graph Representation of Intelligence Data for Security Text Knowledge Graph Construction

GRID est un framework end-to-end pour construire des graphes de connaissances de sécurité à partir d'articles de cyber threat intelligence. Utilisant Qwen3-4B-Instruct, il combine extraction de graphes, révision de texte et une banque de tâches (questions multi-choix + regex) pour générer des récompenses stables. Sur 249 articles CTI, le modèle Task-bank atteint 84,62% précision, 64,91% rappel et 68,53% F1 moyen.

Reinforcement learningBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Hierarchical Two-Stage Framework for Environment-Aware Long-Horizon Vessel Trajectory Prediction

Framework hiérarchique deux étages pour prédire les trajectoires de navires sur long horizon en conditions océaniques réelles. Combine prédicteur long-terme avec prédicteur court-terme basé sur Graph Transformer spatio-temporel sur grille maritime. Module environnemental intègre courants, vent, hauteur de vague via attention cross-modale. Résultats : 25% meilleur ADE, 17% meilleur FDE sur données CTS Australie.

RaisonnementBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

Diffusion Attention Expert Model for Predicting and Semi-automatic Localizing STAS in Lung Cancer Histopathological Images

DAEM (Diffusion Attention Expert Model) détecte les STAS (spread through air spaces) dans les images histopathologiques de cancer du poumon. Le modèle atteint AUC 0.8946 sur coupes congelées et 0.9112 sur coupes en paraffine. Validation sur 8 institutions externes. Localisation semi-automatique et biomarqueurs TME identifiés.

VisionBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

Reversa: A Reverse Documentation Engineering Framework for Converting Legacy Software into Operational Specifications for AI Agents

Reversa est un framework de rétro-ingénierie documentaire qui convertit les systèmes legacy en spécifications opérationnelles pour agents IA. Un pipeline multi-agents extrait les règles métier implicites, synthétise l'architecture et génère des spécifications traçables avec marquage de confiance. Étude de cas : migration ATM COBOL→Go produisant 517 claims, 10 gaps identifiés et 53 scénarios Gherkin.

Agents IAMulti-agentsGénération de code
SIG
72
HYP
25
arXiv cs.AI·

GCE-MIL: Faithful and Recoverable Evidence for Multiple Instance Learning in Whole-Slide Imaging

GCE-MIL améliore l'apprentissage multi-instance pour l'analyse d'images histologiques en optimisant directement la qualité des preuves (suffisance, nécessité, récupérabilité) plutôt que de s'appuyer sur les poids d'attention. Sur 81 configurations (9 backbones, 9 datasets), le gain Macro-F1 atteint +0.024 et C-index +0.014, avec inférence 5× plus rapide.

PapersBenchmarksVision
SIG
72
HYP
18
arXiv cs.AI·

ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization

ISEP propose une méthode d'apprentissage par renforcement hors ligne qui élargit implicitement le support des actions en interpolant entre données en distribution et échantillons de politique. Un mécanisme stochastique alterne entre clonage conservateur et signaux d'expansion optimiste, implémenté via Flow Matching conditionnel avec guidance sans classifieur.

Reinforcement learningPapers
SIG
72
HYP
15
arXiv cs.AI·

Learning Relative Representations for Fine-Grained Multimodal Alignment with Limited Data

Méthode post-hoc d'alignement multimodal utilisant des représentations relatives au niveau token pour appareiller encodeurs pré-entraînés avec peu de données. Apprentissage d'ancres learnable dans chaque espace modal pour induire des patterns de similarité cross-modal cohérents. Surpasse les méthodes existantes en classification zero-shot, retrieval cross-modal et segmentation zero-shot.

EmbeddingsVisionRAG
SIG
72
HYP
18
arXiv cs.AI·

COOPO: Cyclic Offline-Online Policy Optimization Algorithm

COOPO est un algorithme d'apprentissage par renforcement hybride offline-online qui alterne entre entraînement offline régularisé par KL et fine-tuning online. Le retour cyclique à l'entraînement offline élimine l'oubli catastrophique et la dérive de distribution. Sur les benchmarks D4RL, COOPO réduit les interactions online tout en améliorant les performances finales.

Reinforcement learningPapersBenchmarks
SIG
72
HYP
28
arXiv cs.AI·

Echoes in Filter Bubble: Diagnosing and Curing Popularity Bias in Generative Recommenders

Étude sur les biais de popularité dans les systèmes de recommandation génératifs (GRs). Les auteurs identifient que ce biais provient d'une faille d'optimisation au niveau des tokens et d'une tokenization d'items non différenciée. Ils proposent Ghost, un GR avec optimisation asymétrique unlikelihood et tokenization skeleton-founded, validé sur 3 datasets.

PapersBenchmarksAlignement
SIG
72
HYP
18
arXiv cs.CL·

Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

Framework de fine-tuning multilingue pour MLLMs combinant génération synthétique OCR-traduction, SFT avec LoRA et chain-of-thought visuel structuré. Améliore significativement l'extraction de texte petit, flou, occludé sur reçus, menus, documents en conditions visuelles dégradées. Surpasse GPT-5 et Gemini sur OCR et hallucinations.

VisionRaisonnementFine-tuning
SIG
72
HYP
28
arXiv cs.AI·

BESplit: Bias-Compensated Split Federated Learning with Evidential Aggregation

BESplit propose un cadre de federated learning distribué (SFL) pour atténuer les effets des données non-IID. La méthode combine Evidential Aggregation pour pondérer les contributions clients, Bias-Compensated Collaboration pour aligner les représentations, et Dual-Teacher Distillation pour synchroniser les modèles. Tests sur 5 benchmarks montrent amélioration de précision et stabilité.

AlignementBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

Mirror Descent-Type Algorithms for the Variational Inequality Problem with Functional Constraints

Algorithmes de descente miroir pour résoudre des inégalités variationnelles avec contraintes fonctionnelles. Les auteurs proposent des variantes qui alternent entre étapes productives et non-productives selon les valeurs des contraintes, avec analyse de convergence optimale pour opérateurs monotones bornés et contraintes convexes Lipschitz. Applications à GANs, RL et entraînement adversarial.

Reinforcement learningPapersAlignement
SIG
72
HYP
15
arXiv cs.AI·

PESD-TSF: A Period-Aware and Explicit Structured Decomposition Framework for Long-Term Time Series Forecasting

PESD-TSF est un framework de décomposition structurée pour la prévision de séries temporelles longues. Il introduit un mécanisme de gating périodique multiplicatif, un encodeur multi-échelle avec attention détrended, et une attention collaborative inter-variables (CSCA) pour préserver les structures périodiques et les dépendances entre variables à travers les couches profondes.

BenchmarksPapers
SIG
72
HYP
18
arXiv cs.AI·

Visual Sculpting: Visually-Aligned Planning Representations for Long-Horizon Robot Clay Sculpting

Méthode de planification robotique pour la sculpture sur argile basée sur une représentation alignée visuellement. Le système modélise la dynamique des matériaux déformables en capturant textures et éclairage, permettant une planification long-horizon (>100 actions) sans retraining par objectif. Testé sur trois matériaux avec différents effecteurs.

RobotiqueVisionRaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Estimating Item Difficulty with Large Language Models as Experts

Étude évaluant trois LLMs off-the-shelf pour estimer la difficulté d'items pédagogiques sans données de réponse. Sur 6 domaines de mathématiques primaires, les corrélations de Spearman montrent alignement modéré à fort avec les difficultés empiriques. Les comparaisons par paires surpassent les jugements absolus; l'ajout de probabilités de tokens et d'exemples few-shot améliore les résultats.

Prompt engineeringÉvaluationsBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

ORACLE: Anticipating Scams from Partial Trajectories in Streaming App Usage

ORACLE est un framework agentic pour anticiper les escroqueries mobiles à partir de trajectoires d'utilisation d'applications en streaming. Sur un benchmark de 12 types d'escroqueries (95 apps, 15 jours en moyenne), le système utilise un gestionnaire de contexte auto-évolutif et une auto-distillation supervisée pour détecter les signaux précoces à partir d'observations partielles.

Agents IARaisonnementSécurité IA
SIG
72
HYP
25
arXiv cs.LG·

M$^2$FedAQI: Multimodal Federated Learning for Air Quality Prediction on Heterogeneous Edge Devices

M²FedAQI propose un framework fédéré multimodal léger pour la prédiction décentralisée de l'indice de qualité de l'air (AQI) sur des appareils edge hétérogènes. Le système fusionne données visuelles et tabulaires via un mécanisme de modulation de features. Évalué sur PM25Vision et TRAQID, il améliore l'accuracy de 11%, l'AUC de 3,53%, le F1-score de 12,2% et R² de 18% par rapport aux baselines.

VisionBenchmarksPapers
SIG
72
HYP
25
arXiv cs.AI·

Peak-Detector: Explainable Peak Detection via Instruction-Tuned Large Language Models in Physiological Sign

Peak-Detector utilise des LLMs instruction-tuned pour détecter les pics dans les signaux physiologiques (ECG, PPG, BCG, BSG) avec explainabilité. Une technique de « peak-representation » compresse les séries temporelles en préservant les événements critiques. Le modèle est optimisé via fine-tuning supervisé puis reinforcement learning multi-objectif, testé sur 7 datasets (6 publics + 1 cohorte réelle).

RaisonnementFine-tuningReinforcement learning
SIG
72
HYP
25