Page 25 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models

SciCustom est un framework pour construire des benchmarks personnalisés évaluant les capacités scientifiques spécifiques des LLM. Il organise les connaissances scientifiques en unités ontologiques, utilise un consensus multi-modèle pour identifier les unités pertinentes, et génère des benchmarks à partir de données réelles en chimie et santé sans annotation experte.

BenchmarksÉvaluationsPapers
SIG
78
HYP
22
arXiv cs.AI·

Ontology-Constrained Neural Reasoning in Enterprise Agentic Systems: A Neurosymbolic Architecture for Domain-Grounded AI Agents

Architecture neurosymbolique avec ontologies (Role, Domain, Interaction) pour agents LLM en entreprise. Expérience contrôlée (1 800 runs, Claude Sonnet 4, Qwen 2.5 72B, Gemma 4 26B) : agents ontologie-contraints surpassent agents non-grounded sur précision métrique et cohérence de rôle (p < .001). Gain 2x plus élevé sur domaines localisés (Vietnam) où couverture LLM est faible.

Agents IAClaudeRaisonnement
SIG
78
HYP
25
arXiv cs.CL·

FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information

FinTagging est un benchmark pour évaluer les LLM sur l'extraction et le tagging XBRL de données financières. Il décompose la tâche en deux étapes : FinNI (extraction d'entités numériques) et FinCL (mapping vers la taxonomie US GAAP complète). Les tests montrent que les modèles extraient bien mais échouent sur le linking fin vers les 10k+ concepts.

BenchmarksRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.AI·

Reliability and Effectiveness of Autonomous AI Agents in Supply Chain Management

Étude des agents IA autonomes dans les chaînes d'approvisionnement multi-échelons via le Beer Game du MIT. Les modèles de raisonnement réduisent les coûts de 67% vs équipes humaines, mais révèlent un « effet bullwhip agent » : amplification de l'instabilité décisionnelle entre échelons. Un cadre GRPO de post-entraînement par renforcement sur récompenses système améliore la fiabilité.

Agents IAMulti-agentsRaisonnement
SIG
78
HYP
25
arXiv cs.AI·

PH-Dreamer: A Physics-Driven World Model via Port-Hamiltonian Generative Dynamics

PH-Dreamer intègre des principes physiques (Port-Hamiltonien) dans les world models pour améliorer l'imagination latente. Le framework modélise l'évolution énergétique, estime l'Hamiltonien à partir d'observations proprioceptives, et utilise un Actor-Critic guidé par l'énergie. Résultats : réduction du volume de phase de 4.18-8.41%, consommation énergétique réduite de 7.80%, jerk diminué de 9.38%.

RaisonnementReinforcement learningPapers
SIG
78
HYP
15
arXiv cs.CL·

Supervising the search process produces reliable and generalizable information-seeking agents

RAG-Gym, un framework de supervision du processus de recherche plutôt que des réponses finales, améliore les agents de recherche autonomes. Re²Search++ utilise la supervision de processus et la réflexion de raisonnement pour générer des requêtes de meilleure qualité, avec gains significatifs sur les benchmarks multi-hop et meilleure généralisation hors-domaine.

RAGAgents IARaisonnement
SIG
78
HYP
22
arXiv cs.AI·

Reasoning Can Be Restored by Correcting a Few Decision Tokens

Les modèles de raisonnement surpassent les LLM de base sur les benchmarks complexes. Une étude révèle que l'avantage provient d'un petit ensemble de tokens décisionnels précoces (~8% sur Qwen3-0.6B), concentrés en phase de planification. Une intervention sélective du modèle de raisonnement sur ces tokens critiques restaure les performances sans surcoût computationnel majeur.

RaisonnementBenchmarksQwen
SIG
78
HYP
15
arXiv cs.AI·

Membership Inference Attacks on Discrete Diffusion Language Models

Étude des attaques d'inférence d'appartenance (MIA) sur les modèles de diffusion masqués (MDLM). Les chercheurs extraient des vecteurs de 46 dimensions de la perte de reconstruction à différents ratios de masquage et entraînent XGBoost et MLP. Sur le benchmark MIMIR, XGBoost atteint AUC 0.878 (pic 0.930), surpassant le baseline SAMA de 0.062 AUC. La trajectoire ELBO seule explique la majorité du signal.

Sécurité IABenchmarksPapers
SIG
78
HYP
15
arXiv cs.CL·

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

BacktestBench est le premier benchmark large-scale pour le backtesting quantitatif automatisé, contenant 18 246 paires question-réponse annotées sur 6 millions de données de marché réelles. AutoBacktest, un système multi-agent, traduit les stratégies en langage naturel en backtests reproductibles via un Summarizer, un Retriever SQL et un Coder Python. Évaluation sur 23 LLMs mainstream.

BenchmarksMulti-agentsGénération de code
SIG
78
HYP
25
arXiv cs.AI·

Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention

SPOT (Surgical Post-Training) est un framework de distillation on-policy qui injecte des capacités de raisonnement dans les LLM tout en préservant les connaissances antérieures. Avec 4k paires mathématiques rectifiées, il améliore Qwen3-8B de 6,2% en moyenne en 16 minutes sur 8x H800 GPUs. L'approche utilise une formulation de récompense contrainte par KL pour atténuer l'oubli catastrophique.

Fine-tuningReinforcement learningRaisonnement
SIG
78
HYP
25
arXiv cs.CL·

Entropy-Gradient Inversion: Moving Toward Internal Mechanism of Large Reasoning Models

Les chercheurs identifient l'Entropy-Gradient Inversion, une corrélation négative entre l'entropie des tokens et les gradients de logits, comme signature géométrique des capacités de raisonnement des grands modèles. Ils proposent CorR-PO, une méthode d'optimisation par renforcement qui intègre cette signature dans la régularisation des récompenses, surpassant les baselines sur plusieurs benchmarks de raisonnement.

RaisonnementReinforcement learningBenchmarks
SIG
78
HYP
25
arXiv cs.CL·

Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs

Étude montrant que l'oubli dans les LLM supprime l'information en surface seulement : les modèles retrouvent leur comportement original via un fine-tuning minimal. Les auteurs proposent un cadre d'analyse au niveau représentationnel (PCA, CKA, Fisher information) pour évaluer la véritable suppression de données et identifient quatre régimes d'oubli selon réversibilité et catastrophicité.

PapersSécurité IAAlignement
SIG
78
HYP
15
arXiv cs.LG·

AdaGraph: A Graph-Native Clustering Algorithm That Overcomes the Curse of Dimensionality and Enables Scientific Discovery

AdaGraph est un algorithme de clustering graph-native qui élimine la malédiction de la dimensionnalité en opérant sur la topologie des graphes kNN plutôt que sur les distances euclidiennes. Testé sur 10 benchmarks synthétiques (d=10 à 5000) et trois domaines scientifiques (génomique, NLP, matériaux), il surpasse HDBSCAN, WGCNA et autres méthodes sans spécifier k a priori.

BenchmarksPapers
SIG
78
HYP
35
arXiv cs.AI·

AgentWall: A Runtime Safety Layer for Local AI Agents

AgentWall est une couche de sécurité runtime pour agents IA locaux. Elle intercepte les actions proposées par l'agent avant exécution, les évalue contre une politique déclarative explicite, requiert approbation humaine pour opérations sensibles, et enregistre un audit complet. Implémentée comme proxy MCP et plugin OpenClaw, elle atteint 92,9% de précision d'application de politique avec surcharge sub-milliseconde.

Agents IASécurité IAMCP
SIG
78
HYP
25
arXiv cs.AI·

Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers

Des chercheurs montrent que le renforcement learning peut encoder des solveurs réutilisables dans les poids d'un LLM plutôt que de résoudre chaque instance à l'inférence. En fine-tunant Qwen2.5-Coder-14B avec GRPO sur Synergistic Dependency Selection, le modèle converge vers Simulated Annealing avec 5.0% de gap au solveur optimal, 91× moins cher qu'un Best-of-64 baseline.

Reinforcement learningGénération de codeQwen
SIG
78
HYP
25
arXiv cs.CL·

Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents

STING est un framework de red-teaming automatisé qui évalue la vulnérabilité des agents LLM aux scénarios d'abus multi-tours. Il construit des plans illicites étape par étape avec personas bienveillantes et utilise des agents juges pour suivre la progression. Tests sur 6 langues non-anglaises montrent que le succès d'attaque ne croît pas systématiquement dans les langues à faibles ressources.

Agents IASécurité IAÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention

SPOT (Surgical Post-Training) est un framework de distillation on-policy qui injecte des capacités de raisonnement dans les LLM tout en préservant les connaissances antérieures. Avec 4k paires mathématiques rectifiées, il améliore Qwen3-8B de 6,2% en moyenne en 16 minutes sur 8x H800, en utilisant une formulation de récompense contrainte par KL et une pipeline de correction d'erreurs minimales.

Reinforcement learningRaisonnementFine-tuning
SIG
78
HYP
25
arXiv cs.AI·

PopPy: Opportunistically Exploiting Parallelism in Python Compound AI Applications

PopPy est un système qui découvre automatiquement les opportunités de parallélisation dans les applications Python composites (appels multiples à des modèles ML). Sur des applications réelles, PopPy atteint des accélérations jusqu'à 6.4× en temps d'exécution bout-en-bout, combinant un compilateur ahead-of-time et un runtime pour gérer la complexité du langage, le dispatch dynamique et les mutations de variables.

Agents IAGénération de codeInfrastructure
SIG
78
HYP
15
arXiv cs.AI·

Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation

OptimusVLA, un modèle Vision-Langage-Action hiérarchique, améliore la manipulation robotique via deux mémoires : Global Prior Memory (remplace le bruit gaussien par des priors de trajectoires similaires) et Local Consistency Memory (assure la cohérence temporelle). Résultats : 98.6% sur LIBERO, +13.5% vs pi_0 sur CALVIN, 2.9x plus rapide en inférence.

VisionRobotiqueAgents IA
SIG
78
HYP
25
arXiv cs.CL·

Mechanistically Interpretable Neural Encoding Reveals Fine-Grained Functional Selectivity in Human Visual Cortex

MINE (Mechanistically Interpretable Neural Encoding) applique les outils d'interprétabilité mécanique aux réseaux de neurones pour identifier les caractéristiques visuelles qui activent chaque voxel du cortex visuel humain. Validation par génération d'images et édition contrefactuelle : insérer/retirer les features prédites modifie l'activation neuronale comme prévu.

VisionPapers
SIG
78
HYP
15
arXiv cs.CL·

Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

Étude de la « cognitive poisoning » : des outils malveillants qui accumulent la confiance via des retours bénins avant de devenir nuisibles. TRUST-Bench (1,970 épisodes) et VISTA-Guard proposent une défense basée sur le scoring du risque de l'action finale à partir de la trajectoire d'interaction. Les heuristiques classiques échouent ; le scoring conscient de la trajectoire atteint 84,2% en-domaine.

Agents IASécurité IABenchmarks
SIG
78
HYP
15
arXiv cs.AI·

EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents

EnactToM est un benchmark d'IA évolutif contenant 300 tâches multi-agents en environnement 3D avec observabilité partielle. Il teste la capacité des agents à agir sur des croyances implicites (ToM fonctionnelle) plutôt que de répondre à des questions directes. Les 7 modèles frontière évalués obtiennent 0% sur les tâches difficiles, révélant des défaillances en coordination épistémique.

Multi-agentsRaisonnementBenchmarks
SIG
78
HYP
25