Page 26 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.LG·

AdaGraph: A Graph-Native Clustering Algorithm That Overcomes the Curse of Dimensionality and Enables Scientific Discovery

AdaGraph est un algorithme de clustering graph-native qui élimine la malédiction de la dimensionnalité en opérant sur la topologie des graphes kNN plutôt que sur les distances euclidiennes. Testé sur 10 benchmarks synthétiques (d=10 à 5000) et trois domaines scientifiques (génomique, NLP, matériaux), il surpasse HDBSCAN, WGCNA et autres méthodes sans spécifier k a priori.

BenchmarksPapers
SIG
78
HYP
35
arXiv cs.CL·

Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

Étude de la « cognitive poisoning » : des outils malveillants qui accumulent la confiance via des retours bénins avant de devenir nuisibles. TRUST-Bench (1,970 épisodes) et VISTA-Guard proposent une défense basée sur le scoring du risque de l'action finale à partir de la trajectoire d'interaction. Les heuristiques classiques échouent ; le scoring conscient de la trajectoire atteint 84,2% en-domaine.

Agents IASécurité IABenchmarks
SIG
78
HYP
15
arXiv cs.AI·

InvDesFlow-AL: active learning-based workflow for inverse design of functional materials

InvDesFlow-AL combine diffusion et apprentissage actif pour l'inverse design de matériaux. Le modèle atteint RMSE 0.0423 Å en prédiction de structures cristallines (+32.96% vs méthodes existantes) et génère systématiquement des matériaux à basse énergie de formation. Validation : découverte de Li₂AuH₆ comme supraconducteur BCS à 140 K.

PapersBenchmarksReinforcement learning
SIG
78
HYP
25
arXiv cs.AI·

(Sparse) Attention to the Details: Preserving Spectral Fidelity in ML-based Weather Forecasting Models

Mosaic, un modèle probabiliste de prévision météorologique, corrige trois défaillances spectrales des modèles ML : l'amortissement spectral, l'aliasing haute fréquence et les fuites résiduelles. Avec 214M paramètres à 1.5° de résolution, il égale des modèles entraînés 6× plus fins et génère des ensembles bien calibrés en 12s pour 10 jours sur H100.

PapersBenchmarksVision
SIG
78
HYP
15
arXiv cs.AI·

Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks

Nouvelle métrique appelée Refusal Index (RI) pour mesurer la capacité des LLM à refuser les questions hors de leur connaissance. RI corrèle la probabilité de refus avec la probabilité d'erreur via la corrélation de Spearman. Tests sur 16 modèles et 5 datasets montrent que le comportement de refus des LLM reste fragile malgré une haute précision factuelle.

ÉvaluationsSécurité IAAlignement
SIG
78
HYP
15
arXiv cs.CL·

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

BacktestBench est le premier benchmark large-scale pour le backtesting quantitatif automatisé, contenant 18 246 paires question-réponse annotées sur 6 millions de données de marché réelles. AutoBacktest, un système multi-agent, traduit les stratégies en langage naturel en backtests reproductibles via un Summarizer, un Retriever SQL et un Coder Python. Évaluation sur 23 LLMs mainstream.

BenchmarksMulti-agentsGénération de code
SIG
78
HYP
25
arXiv cs.LG·

LoopQ: Quantization for Recursive Transformers

LoopQ est un framework de quantification post-entraînement (PTQ) conçu pour les modèles de langage récursifs (LoopLMs) qui réutilisent les blocs Transformer. Il résout trois défis : décalage de distribution entre rôles, réutilisation d'état entre boucles, et accumulation d'erreur récursive. Sous quantification W4A4, LoopQ améliore la précision de 68,8% et réduit la perplexité de 87,7% vs baseline PTQ statique.

RaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

Membership Inference Attacks on Discrete Diffusion Language Models

Étude des attaques d'inférence d'appartenance (MIA) sur les modèles de diffusion masqués (MDLM). Les chercheurs extraient des vecteurs de 46 dimensions de la perte de reconstruction à différents ratios de masquage et entraînent XGBoost et MLP. Sur le benchmark MIMIR, XGBoost atteint AUC 0.878 (pic 0.930), surpassant le baseline SAMA de 0.062 AUC. La trajectoire ELBO seule explique la majorité du signal.

Sécurité IABenchmarksPapers
SIG
78
HYP
15
arXiv cs.AI·

Who Generated This 3D Asset? Learning Source Attribution for Generative 3D Models

Première étude systématique d'attribution de source pour assets 3D générés. Les chercheurs construisent un benchmark couvrant 22 générateurs 3D et proposent un Transformer multi-vue multi-modal détectant les fingerprints (incohérences cross-view, artefacts géométriques, signatures fréquentielles). Résultats : 97,22% en supervision complète, 77,17% avec 1% des données.

VisionBenchmarksSécurité IA
SIG
78
HYP
25
arXiv cs.CL·

OpenJarvis: Personal AI, On Personal Devices

OpenJarvis propose une architecture de stack IA personnelle décomposée en cinq primitives (Intelligence, Engine, Agents, Tools & Memory, Learning) pour exécuter localement des tâches sans envoyer données sensibles au cloud. Via recherche de spec guidée par LLM, les modèles locaux atteignent la précision des modèles cloud sur 4/8 benchmarks, réduisent coût API de ~800x et latence de 4x.

Agents IARaisonnementOpen source
SIG
78
HYP
25
arXiv cs.AI·

EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

EvoMemBench est un benchmark unifié évaluant la mémoire des agents LLM selon deux axes : portée (intra-épisode vs. inter-épisode) et contenu (orienté connaissance vs. exécution). Comparaison de 15 méthodes de mémoire : les baselines long-contexte restent compétitives, les méthodes par récupération dominent pour les tâches intensives en connaissances, les méthodes procédurales excèlent pour l'exécution.

Agents IABenchmarksRaisonnement
SIG
78
HYP
18
arXiv cs.CL·

Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks

Chercheurs proposent l'Indice de Refus (RI), métrique mesurant la capacité des LLM à refuser les questions hors de leurs connaissances. RI corrèle la probabilité de refus avec la probabilité d'erreur via Spearman. Tests sur 16 modèles et 5 datasets montrent que les LLM refusent de façon instable malgré une haute précision factuelle.

ÉvaluationsSécurité IAAlignement
SIG
78
HYP
15
arXiv cs.AI·

TailedTS: Benchmark Dataset for Heavy-Tailed Time Series Prediction and Periodicity Quantification

TailedTS est un benchmark de 24,69 milliards de points de données issu des vues Wikipedia 2024, conçu pour tester les modèles de prévision de séries temporelles sous conditions heavy-tailed et non-gaussiennes. Le dataset révèle que 5% des pages génèrent 70% du trafic, et introduit un cadre de quantification de périodicité montrant que les pages très consultées ont une structure périodique plus faible.

BenchmarksPapers
SIG
78
HYP
15
arXiv cs.AI·

SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering

SkillMOO optimise les bundles de compétences pour agents de codage via recherche multi-objectif (NSGA-II) sur taux de réussite et coût d'inférence. Sur 16 tâches SkillsBench, le framework atteint le meilleur rang de pass rate sur 11/12 tâches non-nulles, réduisant les coûts jusqu'à 31,7% et gagnant jusqu'à 21 points de pourcentage en taux de réussite.

Agents IAGénération de codeBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

Attractor-Vascular Coupling Theory: Formal Grounding and Empirical Validation for AAMI-Standard Cuffless Blood Pressure Estimation from Smartphone Photoplethysmography

Théorie du couplage attracteur-vasculaire (AVCT) : cadre mathématique montrant que la géométrie de l'attracteur cardiaque encode l'information de pression artérielle. Modèle LightGBM calibré sur PPG smartphone atteint MAE 2.05 mmHg (SBP) et 1.67 mmHg (DBP) en validation LOSO-CV stricte (46 sujets, 29,684 fenêtres), satisfaisant critères AAMI/IEEE SP10. PPG seul égale ECG+PPG à 0.05 mmHg près.

PapersBenchmarksÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

The Alpha Illusion: Reported Alpha from LLM Trading Agents Should Not Be Treated as Deployment Evidence

Étude critique des agents de trading basés sur LLM (FinCon, FinMem, TradingAgents, FinAgent, QuantAgent, FLAG-Trader). Les Sharpe ratios rapportés ne constituent pas une preuve de déploiement viable : contamination temporelle, frictions non modélisées et calibration prédictive insuffisante invalident les résultats. Propose protocole de reporting P1-P6 et architecture modulaire avec LLM comme interface d'audit.

Agents IABenchmarksPapers
SIG
78
HYP
15
arXiv cs.CL·

Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning

Les trajectoires de confiance au niveau des tokens dans les LLM encodent des signaux géométriques liés à la correction des traces de raisonnement. Sans accès au texte ou aux états cachés, une représentation basse dimension sépare les traces correctes des incorrectes sur GSM8K, MATH et MMLU. NeuralConf, un estimateur léger, améliore l'agrégation pondérée par confiance par rapport au vote majoritaire.

RaisonnementÉvaluationsPapers
SIG
78
HYP
25
arXiv cs.AI·

Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use

Étude arXiv montrant que les LLM présentent un écart entre la reconnaissance du besoin d'outils et leur utilisation réelle. Sur 4 modèles testés en arithmétique et QA factuels, les auteurs détectent 26.5-54% de désaccords. L'analyse des états cachés révèle que cognition et action deviennent orthogonales en couches finales, concentrant l'erreur à la transition cognition-action.

Agents IAOutilsRaisonnement
SIG
78
HYP
15
arXiv cs.AI·

Perovskite-R1: a domain-specialized large language model for intelligent discovery of precursor additives and experimental design

Perovskite-R1 est un LLM spécialisé basé sur QwQ-32B, fine-tuné sur 1 232 publications scientifiques et 33 269 matériaux candidats pour découvrir des additifs précurseurs optimisant les cellules solaires pérovskites. Le modèle génère des solutions pour la passivation des défauts et améliore stabilité/performance, validées expérimentalement.

QwenFine-tuningRaisonnement
SIG
78
HYP
25
arXiv cs.CL·

EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

EvoMemBench est un benchmark unifié évaluant la mémoire des agents LLM selon deux axes : portée (in-episode vs cross-episode) et contenu (knowledge vs execution-oriented). Comparaison de 15 méthodes mémoire : les baselines long-context restent compétitives, les méthodes retrieval-based dominent pour les tâches knowledge-intensive, les méthodes procédurales pour l'execution-oriented.

Agents IABenchmarksRAG
SIG
78
HYP
22
arXiv cs.AI·

PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows

PROTEA est une interface pour déboguer et affiner les workflows multi-agents LLM hors ligne. Elle évalue les sorties intermédiaires avec des rubriques configurables, localise les goulots d'étranglement via le graphe du workflow, et génère des révisions de prompts ciblées. Sur deux workflows en production, PROTEA améliore la précision de 64,3% à 83,9% et le Hit@5 de 0,30 à 0,38.

Multi-agentsAgents IAPrompt engineering
SIG
78
HYP
18
arXiv cs.AI·

AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent

AgentArk distille l'intelligence multi-agent dans un seul modèle LLM via trois stratégies hiérarchiques : fine-tuning amélioré, augmentation par trajectoires et distillation consciente du processus. Le modèle résultant préserve l'efficacité computationnelle d'un agent unique tout en conservant les capacités de raisonnement et d'auto-correction des systèmes multi-agent.

Agents IAMulti-agentsFine-tuning
SIG
78
HYP
25
arXiv cs.AI·

CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

CounterCount est un framework de diagnostic pour évaluer les biais de comptage dans les modèles vision-langage. Les tests révèlent que les VLMs performent bien sur des images factuelles mais dégradent significativement sur des images contrefactuelles où les attributs visuels contredisent les priors appris. Une stratégie de modulation d'attention au temps d'inférence améliore la précision jusqu'à 8%.

VisionÉvaluationsBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving

DriveMoE propose une architecture Mixture-of-Experts pour la conduite autonome de bout en bout. Le modèle combine une Vision MoE (sélection dynamique de caméras selon le contexte) et une Action MoE (activation d'experts spécialisés pour différents comportements). Construit sur la baseline Drive-π₀, DriveMoE atteint l'état de l'art sur Bench2Drive en évitant l'averaging des modes.

VisionAgents IAPapers
SIG
78
HYP
25
arXiv cs.AI·

LegalCheck: Retrieval- and Context-Augmented Generation for Drafting Municipal Legal Advice Letters

LegalCheck automatise la rédaction de lettres de réponse aux objections dans les municipalités néerlandaises via RAG et génération augmentée par contexte. Déployé à Amsterdam, le système produit des brouillons juridiques en minutes au lieu d'heures, avec 80-100% du contenu essentiel, tout en maintenant la révision par expert et la cohérence légale.

RAGPrompt engineeringBusiness
SIG
78
HYP
22
arXiv cs.AI·

SocialMemBench: Are AI Memory Systems Ready for Social Group Settings?

SocialMemBench est un benchmark évaluant les systèmes de mémoire IA dans les groupes sociaux multi-parties (430 personas, 7,355 tours de conversation, 1,031 paires QA). Gemini 2.5 Flash atteint 0.721 sur petits réseaux vs 0.98 attendu. Les quatre frameworks open-source (Mem0, LangMem, Graphiti, Cognee) obtiennent 0.12-0.18, bien en dessous des références (0.345-0.369), révélant un écart mesurable.

BenchmarksGeminiAgents IA
SIG
78
HYP
15