Page 96 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.AI·

Tracking Drift: Variation-Aware Entropy Scheduling for Non-Stationary Reinforcement Learning

Méthode AES (Adaptive Entropy Scheduling) pour ajuster dynamiquement le coefficient d'entropie en RL non-stationnaire face à la dérive environnementale. Propose une règle d'échelle en racine carrée basée sur un proxy de non-stationnarité observable. Évaluation sur 4 variantes d'algorithmes, 12 tâches, 4 modes de dérive : réduit la dégradation de performance et accélère la récupération après changements abruptes.

Reinforcement learningRaisonnement
SIG
72
HYP
18
arXiv cs.CL·

ToolMATH: A Diagnostic Benchmark for Long-Horizon Tool Use under Systematic Tool-Catalog Constraints

ToolMATH est un benchmark de diagnostic pour évaluer l'utilisation d'outils sur long horizon par les modèles de langage. Il convertit des solutions mathématiques en outils Python réutilisables avec descriptions naturelles et schémas typés, puis mesure l'adaptabilité (succès avec outils de remplacement), la robustesse (stabilité face aux distracteurs) et la connectivité des outils (précision sur chaînes longues).

BenchmarksAgents IAOutils
SIG
72
HYP
18
arXiv cs.AI·

No Plan, Yet Human: A Reactive Robotics Model Predicts Human Planning Failures on a Clinical Task

AICON, un modèle réactif de robotique basé sur la descente de gradient, prédit mieux que les modèles de planification les erreurs humaines sur la Tour de Londres (test cognitif). Sans lookahead, il reproduit l'ordre de difficulté des 24 problèmes et échoue comme les patients atteints de la maladie de Parkinson, suggérant que la capacité de planification réduite bascule vers un mode réactif.

RobotiqueRaisonnementPapers
SIG
72
HYP
15
arXiv cs.AI·

On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression

Étude de la robustesse adversariale des modèles vision-langage compressés. Les auteurs proposent CAGE, une attaque qui exploite le décalage entre l'optimisation des perturbations (sur tokens complets) et l'inférence (via compression). CAGE combine disruption de features et alignement de distortion de rang pour révéler les vulnérabilités cachées des LVLMs compressés.

VisionSécurité IABenchmarks
SIG
72
HYP
15
arXiv cs.AI·

\textsc{MasFACT}: Continual Multi-Agent Topology Learning via Geometry-Aware Posterior Transfer

MasFACT propose un cadre de transfert de posterior géométriquement conscient pour les systèmes multi-agents LLM. Il résout le problème de « topology forgetting » en préservant les structures de collaboration historiques lors de l'adaptation à de nouvelles tâches, via transport optimal Gromov-Wasserstein et adaptation PAC-Bayes conservative.

Multi-agentsAgents IALlama
SIG
72
HYP
18
arXiv cs.AI·

AnchorDiff: Topology-Aware Masked Diffusion with Confidence-based Rewriting for Radiology Report Generation

AnchorDiff propose un framework de diffusion masquée pour la génération de rapports radiologiques, intégrant des ancres cliniques dérivées de graphes de connaissances. Contrairement aux modèles autorégressifs traditionnels, cette approche bidirectionnelle utilise une stratégie d'entraînement sensible à la topologie basée sur RadGraph et un raffinement itératif. SOTA sur MIMIC-CXR et MIMIC-RG4.

PapersBenchmarksGénération de code
SIG
72
HYP
18
arXiv cs.AI·

Diamond Maps: Efficient Reward Alignment via Stochastic Flow Maps

Diamond Maps sont des modèles de flux stochastiques permettant l'alignement efficace aux récompenses au moment de l'inférence. Ils amortissent plusieurs étapes de simulation en un seul échantillonneur tout en préservant la stochasticité nécessaire. Appris par distillation depuis GLASS Flows, ils surpassent les méthodes existantes en performance et scalabilité.

RaisonnementReinforcement learningPapers
SIG
72
HYP
25
arXiv cs.LG·

A Structural Threshold in Decision Capacity Governs Collapse in Self-Play Reinforcement Learning

Une étude arXiv montre qu'un seuil de capacité décisionnelle détermine l'effondrement en apprentissage par renforcement auto-joué. Éliminer toutes les décisions contingentes à portée positive provoque une convergence rapide vers un attracteur d'exploitation déterministe. Préserver même une seule décision contingente prévient cet effondrement, confirmant que le mécanisme est la co-adaptation sous contrainte.

Reinforcement learningPapersMulti-agents
SIG
72
HYP
15
arXiv cs.AI·

AI Slop or AI-enhancement? Student perceptions of AI-generated media for an English for Academic Purposes course

Étude d'implémentation de Google Notebook LM dans un cours d'anglais académique (106 étudiants, Hong Kong). Génération de vidéos, podcasts et infographies via RAG. Les étudiants ont apprécié les contenus visuels et multimodaux ; la préférence vidéo corrèle positivement avec les résultats académiques. La charge cognitive élevée impacte négativement les notes.

RAGÉvaluationsOutils
SIG
72
HYP
25
arXiv cs.AI·

Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework

buddyMe, framework open-source multi-modèles, intègre trois paradigmes d'interaction d'agents : orchestration multi-agents (Generator-Evaluator), boucles ReAct, interaction augmentée par mémoire. Pipeline 5 étapes testé sur 4 cas réels (guides musée, météo, planification). Résultats : détection 20% omissions requêtes, 30% invocations outils redondantes, consensus adversarial en 2-3 rounds (70% cas).

Agents IAMulti-agentsRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

Learning Native Continuation for Action Chunking Flow Policies

Legato est une méthode d'entraînement pour les politiques VLA basées sur des flux d'actions chunked. Elle initialise le débruitage à partir d'un mélange d'actions connues et de bruit, et reshape la dynamique du flux pour assurer la cohérence entre entraînement et inférence. Tests réels : 10% d'amélioration en fluidité de trajectoire et temps de tâche vs RTC.

VisionGénération de codeRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

MHMamba: Multi-Head Mamba for 3D Brain Tumor Segmentation

MHMamba combine une architecture U-Net avec un modèle state-space multi-tête (Mamba) pour la segmentation 3D de tumeurs cérébrales en IRM. La méthode maintient la complexité linéaire de Mamba tout en améliorant la modélisation des dépendances longue portée et la stabilité multimodale. Tests sur BraTS2021/2023 montrent gains en précision, cohérence des contours et détection des petites lésions.

VisionBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Baba in Wonderland: Online Self-Supervised Dynamics Discovery for Executable World Models

Alice est un système d'apprentissage de modèles monde exécutables en ligne qui découvre les dynamiques d'environnement sans descriptions de règles ni signaux de récompense. L'agent induit les lois de transition par interaction seule, en traitant les conflits de préservation comme signal structurel pour raffiner les hypothèses. Évaluation sur Baba in Wonderland montre une amélioration substantielle.

RaisonnementReinforcement learningPapers
SIG
72
HYP
15
arXiv cs.AI·

Alignment Drift in Long-Term Human-LLM Interaction: A Mechanism-Oriented Framework

Étude de l'alignment drift : processus graduel où les sorties LLM deviennent moins contraintes par le message utilisateur actuel et plus façonnées par l'historique d'interaction, tout en restant cohérentes. Cadre mécaniste proposé distinguant signaux A/B, expliquant boucles de rétroaction et sélection de sous-motifs sur trois régimes interactionnels.

AlignementSécurité IAPapers
SIG
72
HYP
18
arXiv cs.AI·

Conservative AI for Safety-Sensitive Medical Image Restoration: Residual-Bounded CT-CTA Enhancement for Intracranial Aneurysm-Relevant Signal Recovery

Framework de restauration d'images médicales 2.5D avec résidus bornés pour améliorer les CT/CTA intracrâniens sans modifier les régions cliniquement sensibles. Le modèle ajoute un résidu appris via une carte de contrôle d'édition limitant magnitude et étendue spatiale. Sur 50 cas hors-distribution : PSNR 37.51 dB, taux d'édition iatrogène 4.0%, stabilité positive en 85.4% des 1000 runs Monte Carlo.

VisionSécurité IAÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

Recall Isn't Enough: Bounding Commitments in Personalized Language Systems

Article arXiv proposant CBEA+LCV, une méthode pour valider les engagements dans les systèmes de langage personnalisés. Plutôt que traiter la personnalisation comme un problème de rappel, l'approche structure les contraintes avant génération. Sur 360 tests, atteint zéro défaillance à 0.49-0.60 disponibilité contre 0.003-0.092 pour les baselines, avec 74-75% réduction de payload.

RaisonnementÉvaluationsSécurité IA
SIG
72
HYP
15
arXiv cs.AI·

Flowette: Flow Matching with Graphette Priors for Graph Generation

Flowette est un framework de flow matching continu pour la génération de graphes avec motifs récurrents. Le modèle utilise un transformer basé sur GNN pour apprendre un champ de vélocité, intègre des couplages par transport optimal et introduit les graphettes, une famille probabiliste de modèles de structure graphique généralisant les graphons. Résultats SOTA sur plusieurs benchmarks.

PapersBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Semantic Smoothing via Novel View Synthesis for Robust SAR Image Classification

Défense contre les perturbations adversariales pour la classification SAR via lissage sémantique. Remplace le bruit isotrope par des transformations géométriques générées par synthèse de nouvelles vues, conditionnées sur la géométrie d'acquisition. Améliore la robustesse contre FGSM, PGD, OTSA, SMGAA tout en augmentant la précision en classification nette.

Sécurité IAVisionÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

Human-Certified Module Repositories for the AI Age

Les Human-Certified Module Repositories (HCMR) proposent une architecture pour construire des logiciels fiables dans le développement assisté par IA. Face aux risques de composants non vérifiés dans les écosystèmes modulaires, ce framework combine supervision humaine et analyse automatisée pour certifier les modules et garantir une assemblée sûre par humains et agents IA.

Agents IAGénération de codeSécurité IA
SIG
72
HYP
25
arXiv cs.AI·

Geometry-Aware Attention Guidance for Diffusion Models via Modern Hopfield Dynamics

GAG (Geometry-Aware Attention Guidance) améliore les modèles de diffusion sans entraînement supplémentaire en guidant l'attention via la dynamique de Hopfield moderne. Analyse théorique prouve que la discordance sparse-dense agit comme signal d'accélération directionnel. Méthode universelle testée sur FLUX.1, FLUX.2, Qwen-Image avec gains de qualité et surcoût minimal.

Génération d'imagesPapersRaisonnement
SIG
72
HYP
25
arXiv cs.AI·

Avoiding Structural Failure Modes in Tabular Fair SSL: Online Primal-Dual Allocation under Confidence Gating

Article arXiv identifiant deux modes de défaillance structurels en apprentissage semi-supervisé équitable sur données tabulaires : Masking Collapse et Trivial Saturation. Propose OPDA (Online Primal-Dual Allocation), un contrôleur adaptatif qui ajuste dynamiquement les pénalités d'équité sans tuning par dataset. Évalué sur Adult, ACSIncome, COMPAS.

PapersBenchmarksSécurité IA
SIG
72
HYP
15
arXiv cs.AI·

HAAS: A Policy-Aware Framework for Adaptive Task Allocation Between Humans and Artificial Intelligence Systems

HAAS est un framework pour l'allocation adaptative de tâches entre humains et systèmes IA en ingénierie logicielle et fabrication. Il combine un système expert basé sur des règles de gouvernance avec un apprentissage par bandit contextuel. Les résultats montrent que la gouvernance n'est pas binaire mais un paramètre ajustable : une gouvernance modérée améliore performance et réduit la fatigue en fabrication.

Agents IAMulti-agentsReinforcement learning
SIG
72
HYP
18
arXiv cs.AI·

Are Multimodal LLMs Ready for Surveillance? A Reality Check on Zero-Shot Anomaly Detection in the Wild

Étude systématique de modèles multimodaux (MLLMs) sur la détection d'anomalies vidéo (VAD) avec les benchmarks ShanghaiTech et CHAD. Les modèles montrent un biais conservateur en zéro-shot : haute précision mais effondrement du recall. Instructions spécifiques améliorent F1 de 0,09 à 0,64, mais le recall reste critique pour la surveillance réelle.

VisionRaisonnementPrompt engineering
SIG
72
HYP
25