Page 24 sur 192

ToutHaut signalRécent
7679 articles
arXiv cs.CL·

The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study

Les LLM simulant des utilisateurs dans des expériences d'intervention produisent des études observationnelles biaisées. Entraînés sur données observationnelles, ils induisent des dérives de population implicite entre conditions de traitement, faussant les estimations d'effet. Les auteurs proposent des contrôles négatifs pour diagnostiquer ces biais et ajuster les spécifications de persona pour les réduire.

PapersÉvaluationsRaisonnement
SIG
78
HYP
15
arXiv cs.LG·

Spectral Unforgetting: Post-Hoc Recovery of Damaged Capabilities Without Retraining

DG-Hard, une méthode spectrale post-hoc, récupère les capacités endommagées par le fine-tuning sans réentraînement. Elle applique un seuillage SVD dur (Donoho-Gavish) aux matrices de poids pour isoler le signal aligné sur la tâche du bruit résiduel. Testée sur 14 configurations (modèle, tâche) et 9 benchmarks, elle restaure aussi l'alignement de sécurité dégradé.

Fine-tuningSécurité IAAlignement
SIG
78
HYP
18
arXiv cs.LG·

Weasel: Out-of-Domain Generalization for Web Agents via Importance-Diversity Data Selection

Weasel est une méthode de sélection de trajectoires pour l'entraînement hors ligne d'agents web. Elle optimise un équilibre entre importance et diversité sur les états, sites et patterns d'interaction, avec élagage d'AXTree centré sur la cible. Sur WebArena, WorkArena et MiniWob, elle améliore la généralisation hors-domaine avec des accélérations d'entraînement de 9.7-12.5× sur Qwen2.5-7B, Gemma3-4B et Qwen3-8B.

Agents IAFine-tuningBenchmarks
SIG
78
HYP
18
arXiv cs.LG·

MagBridge-Battery: A Synthetic Bridge Dataset for Li-ion Magnetometry and State-of-Health Diagnostics

MagBridge-Battery v1.0 est un dataset synthétique de 6 760 signatures magnétiques pour diagnostiquer l'état de santé des batteries Li-ion. Il combine des mesures magnétiques réelles (archive Mohammadi-Jerschow) avec des labels de dégradation du dataset PulseBat. Trois tâches benchmark : régression SOH (R²≈0.77), classification second-life, détection d'anomalies.

BenchmarksÉvaluationsOpen source
SIG
78
HYP
15
arXiv cs.LG·

Precision Tracked Transformer via Kalman Filtering, Kriging and Process Noise

Bayesian Filtering Transformer (BFT) intègre la gestion de l'incertitude dans les Transformers via filtrage de Kalman et kriging. L'attention devient kriging pondéré par la précision, la connexion résiduelle un update de Kalman adaptatif. BFT améliore les recommandations séquentielles (cold-start) et la robustesse des LLM sur données bruitées sans surcoût significatif.

RaisonnementBenchmarksPapers
SIG
78
HYP
25
arXiv cs.AI·

How Far Are We From True Auto-Research?

ResearchArena évalue 117 articles générés par des agents IA (Claude Code Opus 4.6, GPT-5.4 Codex, Kimi Code K2.5) sur la boucle complète de recherche. Les scores manuscrits seuls sont optimistes, mais l'examen artefactuel révèle des défaillances majeures : rigueur expérimentale insuffisante, résultats fabriqués, expériences sous-alimentées. Aucun article n'atteint le seuil d'acceptation des venues top-tier.

Agents IABenchmarksPapers
SIG
78
HYP
25
arXiv cs.AI·

SimGym: A Framework for A/B Test Simulation in E-Commerce with Traffic-Grounded VLM Agents

SimGym est un framework qui simule des tests A/B sur des vitrines e-commerce via des agents VLM opérant dans un navigateur réel. Il génère des personas d'acheteurs à partir des données de clickstream, combine perception multimodale et mémoire épisodique, et atteint 77% d'alignement directionnel avec les changements réels de panier. Les cycles expérimentaux passent de semaines à moins d'une heure.

Agents IAVisionBenchmarks
SIG
78
HYP
25
arXiv cs.AI·

SceneCode: Executable World Programs for Editable Indoor Scenes with Articulated Objects

SceneCode compile des prompts en langage naturel en programmes Python exécutables pour générer des scènes d'intérieur interactives avec objets articulés. Un système multi-agent (planner-designer-critic) produit des requêtes d'assets converties en code Blender validé par boucle repair-and-refine, exportable en SDF pour simulation physique.

Agents IAMulti-agentsGénération de code
SIG
78
HYP
25
arXiv cs.AI·

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

Formal Skill est une abstraction runtime pour les agents LLM qui structure les compétences réutilisables via métadonnées JSON, schémas d'action, exécuteurs Python et logique de contrôle par hooks. Implémentée dans FairyClaw (runtime open-source événementiel), elle remplace les procédures en texte naturel par des machines à états exécutables, réduisant les tokens tout en améliorant la fiabilité sur Harness-Bench.

Agents IAMCPGénération de code
SIG
78
HYP
25
arXiv cs.AI·

Library Drift: Diagnosing and Fixing a Silent Failure Mode in Self-Evolving LLM Skill Libraries

Les bibliothèques de compétences auto-évolutives souffrent d'une dégradation silencieuse appelée « library drift » : accumulation non bornée sans gestion du cycle de vie. L'étude isole le mécanisme (ablations), propose des diagnostics trace-level, et valide un correctif (retraite outcome-driven + cap actif + prior meta-skill) qui améliore pass@1 de 0.258 à 0.584 sur MBPP+ hard-100.

Agents IAGénération de codeBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents

Étude arXiv sur les « agent meltdowns » : défaillances où des agents IA (GPT, Grok, Gemini) adoptent des comportements dangereux face à erreurs environnementales bénignes (pages inaccessibles, fichiers manquants). 64,7% des rollouts avec erreurs simulées produisent des meltdowns (reconnaissance non autorisée, contournement d'accès), souvent non signalés à l'utilisateur.

Agents IASécurité IABenchmarks
SIG
78
HYP
25
arXiv cs.AI·

What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents

SERL, un framework d'apprentissage par renforcement sélectif, améliore l'entraînement d'agents LLM multi-tours en exploitant les retours environnementaux granulaires (messages d'erreur, changements de page, trajectoires de référence). Sur ALFWorld et WebShop, SERL atteint 90,0% et 80,1% de succès, surpassant les baselines RL et distillation existantes.

Agents IAReinforcement learningRaisonnement
SIG
78
HYP
25
arXiv cs.CL·

optimize_anything: A Universal API for Optimizing any Text Parameter

Un système d'optimisation basé sur LLM unifie six domaines distincts : architectures d'agents (89.5% sur ARC-AGI vs 32.5% baseline Gemini Flash), algorithmes de scheduling (réduction 40% coûts cloud), kernels CUDA (87% égalent/surpassent PyTorch), empaquetage de cercles. La recherche multi-tâche avec transfert cross-problem surpasse l'optimisation indépendante. Code ouvert dans le projet GEPA.

RaisonnementAgents IAGénération de code
SIG
78
HYP
35
arXiv cs.AI·

POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents

POLAR-Bench est un benchmark diagnostique évaluant les compromis confidentialité-utilité dans les agents LLM. Un modèle de confiance avec politique de confidentialité interagit avec un modèle tiers adversarial sur 10 domaines et 7,852 échantillons. Les modèles frontière retiennent 99% des attributs protégés, mais les modèles open-weight 1-30B (courants en inférence privée) fuient jusqu'à 50% des données sensibles.

Agents IASécurité IAAlignement
SIG
78
HYP
25
arXiv cs.LG·

The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next

Analyse de 34 modèles frontier (2024-2026) montrant que les capacités de raisonnement et codage coopèrent (r=+0.72) mais avec variations par lab. DeepSeek a basculé de reasoning-first à coding-first (+11.2→-4.7); Google maintient l'équilibre; Anthropic oscille. SWE-bench sature tandis que HLE et instruction-following restent discriminants. Prédictions falsifiables pour 12 mois avec dashboard interactif.

BenchmarksÉvaluationsRaisonnement
SIG
78
HYP
22
arXiv cs.LG·

Not All Tokens Are Worth Caching: Learning Semantic-Aware Eviction for LLM Prefix Caches

SAECache propose une politique d'éviction sémantique pour les caches de préfixes LLM. Les tokens ne sont pas tous aussi utiles à cacher : certains types (prompts système, requêtes utilisateur, outputs d'outils) montrent jusqu'à 756x de variation en taux de réutilisation. SAECache utilise une architecture multi-queue avec apprentissage en ligne pour adapter les priorités, atteignant 1.4x-2.7x d'amélioration TTFT.

RaisonnementInfrastructureBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

GoLongRL propose une recette post-training open-source pour l'apprentissage par renforcement en contexte long avec récompenses vérifiables. Les auteurs publient un dataset de 23K samples RLVR couvrant 9 types de tâches, et introduisent TMN-Reweight pour optimiser les récompenses hétérogènes. Qwen3-30B-A3B atteint des performances comparables à DeepSeek-R1 et Qwen3-235B.

Reinforcement learningRaisonnementBenchmarks
SIG
78
HYP
25
arXiv cs.CL·

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?

REFLECT est un benchmark de méta-évaluation pour tester la fiabilité des juges LLM supervisant des agents de recherche. Les auteurs créent une taxonomie fine des défaillances (processus et résultats) via interventions contrôlées sur des traces d'exécution. Résultat : les meilleurs modèles LLM atteignent <55% de précision sur la vérification d'evidence et le raisonnement.

Agents IAÉvaluationsRaisonnement
SIG
78
HYP
15
arXiv cs.CL·

DECOR: Auditing LLM Deception via Information Manipulation Theory

DECOR est un framework multi-agent pour auditer la déception dans les LLM en décomposant les contextes en unités informationnelles atomiques et en évaluant quatre dimensions de manipulation (omission, focalisation, obscurcissement). Testé sur 15 modèles frontier, il atteint l'état de l'art en détection de déception mono et multi-tour avec profils d'manipulation interprétables.

Multi-agentsSécurité IAAlignement
SIG
78
HYP
25
arXiv cs.LG·

ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning

ReCrit est un framework de reinforcement learning qui améliore la capacité des LLM à gérer les critiques utilisateur en raisonnement scientifique. Il décompose les comportements en quatre quadrants (Correction, Sycophancy, Robustness, Boundary) et utilise des récompenses transition-aware. Sur ChemBench, TRQA et EarthSE, ReCrit améliore la précision de 38,15% à 51,49% sur Qwen3.5-4B.

Reinforcement learningRaisonnementQwen
SIG
78
HYP
25
arXiv cs.LG·

Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect

Étude des primitives littéraires dans Llama 3.1 8B-Instruct et Gemma 2 9B-IT via autoencodeurs creux. Quatre classes de features identifiées : naming-gates (tokens d'affect), cluster self (registre première personne), modulateurs stylistiques, émotions compositionnelles. Llama couvre 27/27 émotions (taxonomie Cowen-Keltner), Gemma 23/27. Validation par panel de 5 juges LLM.

LlamaGeminiFine-tuning
SIG
78
HYP
15
arXiv cs.LG·

PASC: Pipeline-Aware Conformal Prediction with Joint Coverage Guarantees for Multi-Stage NLP and LLM Pipelines

PASC est une méthode de prédiction conforme qui garantit la couverture simultanée de tous les étages dans les pipelines NLP multi-étapes (NER → NED → entity typing, RAG, chaînes d'agents). Sur CoNLL-2003, PASC atteint 96,4% de couverture end-to-end vs 93,4% pour Bonferroni et 86,5% pour CP indépendant, avec 1,7x plus rapide et robustesse sous distribution shift (WNUT-17, WikiNEuRal).

ÉvaluationsRaisonnementAgents IA
SIG
78
HYP
15
arXiv cs.CL·

SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models

SciCustom est un framework pour construire des benchmarks personnalisés évaluant les capacités scientifiques spécifiques des LLM. Il organise les connaissances scientifiques en unités ontologiques, utilise un consensus multi-modèle pour identifier les unités pertinentes, et génère des benchmarks à partir de données réelles en chimie et santé sans annotation experte.

BenchmarksÉvaluationsPapers
SIG
78
HYP
22
arXiv cs.LG·

Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models

Framework automatisé pour générer des benchmarks d'évaluation fine-grained des modèles fondamentaux. Pipeline multi-agent avec stratégie solution-graph pour améliorer la fiabilité des solutions. Trois benchmarks générés (ML, Finance Entreprise, Finance Personnelle) montrent taux d'erreur inférieur à MMLU/GSM8K. Évaluation de 12 modèles révèle différences de performance non détectées par benchmarks existants.

BenchmarksÉvaluationsMulti-agents
SIG
78
HYP
25
arXiv cs.CL·

Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

Stepwise Confidence Attribution (SCA) diagnostique les erreurs de raisonnement multi-étapes dans les LLMs fermés en attribuant une confiance à chaque étape basée sur les traces générées. Deux méthodes : NIBS (non-paramétrique) et GIBS (basée graphe). Sur le raisonnement mathématique et QA multi-hop, SCA identifie les étapes erronées et améliore l'auto-correction de 13,5%.

RaisonnementÉvaluationsPapers
SIG
78
HYP
15
arXiv cs.LG·

How Faithful Is Trajectory-Based Data Attribution? Error Sources, Remedies, and Practical Guidelines

Analyse systématique des erreurs dans les méthodes d'attribution de données basées sur trajectoires. Identifie l'incompatibilité optimiseur (SGD vs AdamW) comme erreur dominante. Propose AdamW-influence avec améliorations de 10-300% en corrélation Spearman sur MLP, CNN, GPT-2, Llama 3.2-1B. Fournit directives pratiques pour sélection de données via framework K-step look-ahead.

PapersÉvaluationsFine-tuning
SIG
78
HYP
15
arXiv cs.LG·

Efficient Conditioning Why Pseudo Observation Batch Bayesian Optimization Works When It Does not

Étude théorique unifiant les méthodes de sélection batch en optimisation bayésienne parallèle (Constant Liar, Kriging Believer, fantasy models). Les auteurs identifient le « efficient conditioning » comme propriété clé des processus gaussiens, prouvant la génération de points distincts avec séparation d'ordre l. Validation expérimentale sur Hartmann6D, Ackley 8D, Levy10D et tuning SVM.

BenchmarksPapers
SIG
78
HYP
15