Archives

juin 2026

2731 articles

arXiv cs.CL·

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

VoidPadding introduit un token [VOID] dédié au padding dans les modèles de diffusion masqués (MDLMs), libérant [EOS] pour la terminaison sémantique. Sur Dream-7B-Instruct, cela améliore les benchmarks de raisonnement mathématique et génération de code de +17.84 points vs baseline et +6.95 vs RainbowPadding, réduisant les NFE de 55.7%.

Génération de codeRaisonnementBenchmarks
SIG
72
HYP
25
arXiv cs.CL·

Learning task-specific subspaces via interventional post-training of speech foundation models

Méthode de post-entraînement pour les modèles de fondation vocale via apprentissage contrastif interventionnel. Transforme les représentations enchevêtrées en sous-espaces séparés (contenu/locuteur) en utilisant un dataset interventionnel et une perte contrastive multi-parties. Améliore la vérification de locuteur hors-domaine et la détection de mots-clés.

VoixFine-tuningPapers
SIG
72
HYP
15
arXiv cs.CL·

Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models

Les modèles de raisonnement entraînés par RL génèrent souvent du raisonnement inutile après avoir trouvé la bonne réponse (overthinking). Cet article propose Dynamic Rollout Editing (DRE), une intervention au moment de l'entraînement GRPO qui édite les trajectoires réussies continuant après l'émergence de la réponse, préservant le préfixe vérifié et affaiblissant le signal de préférence pour la pensée inutile.

Reinforcement learningRaisonnement
SIG
78
HYP
15
arXiv cs.AI·

DiagFlowBench: Evaluating How Language Models Handle Off-Procedure Inputs in Grounded Diagnostic Dialogue

DiagFlowBench évalue comment les modèles de langage gèrent les requêtes hors-procédure dans le diagnostic industriel. Un dataset de 1 676 conversations multi-tours basées sur 50 flowcharts de diagnostic révèle que les modèles sélectionnent souvent une étape réelle mais inadéquate plutôt que d'halluciner, créant une vulnérabilité : des conseils plausibles mais incorrects.

BenchmarksÉvaluationsRaisonnement
SIG
75
HYP
15
arXiv cs.CL·

ChLogic: Evaluating Robustness of Logical Reasoning in Chinese Expressions

ChLogic est un benchmark bilingue anglais-chinois évaluant la robustesse du raisonnement logique dans les LLM. Construit à partir de templates logiques formels, il contient 100 propositions alignées et 15 phénomènes spécifiques au chinois. Les expériences sur Qwen3, Ministral et GLM révèlent un écart de performance persistant anglais-chinois, la rétrotraduction produisant des effets mixtes.

BenchmarksRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

Improving low-resource ASR using bilingual fine-tuning with language identification: a cross-linguistic evaluation

Étude sur le fine-tuning bilingue pour la reconnaissance vocale en langues peu dotées. Évaluation sur 9 paires linguistiques avec tokens d'identification de langue en entrée. Résultat : le fine-tuning bilingue améliore les performances quand l'identification de langue est précise ; fournir le token à l'inférence compense les erreurs d'identification.

VoixFine-tuningBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings

Étude comparative des capacités des LLM pour prédire le locuteur suivant, les changements de tour et l'adressataire dans des conversations multi-parties. Sur le corpus AMI, les LLM surpassent les modèles supervisés et les humains en prédiction du locuteur suivant sans accès audio-visuel. Les MM-LLM dépassent les LLM textuels mais restent sous la performance humaine pour l'adressataire et les changements de tour.

BenchmarksÉvaluationsVision
SIG
72
HYP
18
arXiv cs.CL·

The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

Les modèles élaguées passent les benchmarks à choix multiples mais échouent en génération ouverte. Étude multilingue montrant que sous élagage haute sparsité (Wanda), les réponses correctes sont démotées plutôt qu'effacées : elles réapparaissent avec beam search ou sampling. Les benchmarks à choix multiples surestiment l'utilisabilité des LLM compressés.

BenchmarksÉvaluationsFine-tuning
SIG
78
HYP
15
arXiv cs.CL·

OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation

OPD-Evolver est un framework de co-évolution lent-rapide qui cultive des agents auto-évolutifs via auto-distillation on-policy. Le système gère une hiérarchie mémoire à quatre niveaux pour lire, utiliser, écrire et maintenir l'expérience. Sur benchmarks multi-domaines, OPD-Evolver surpasse ReasoningBank (+11.5%) et Skill0 (+5.8%), avec OPD-Evolver-9B rivalisant avec Qwen3.5-397B et Step-3.5-Flash.

Agents IARaisonnementReinforcement learning
SIG
72
HYP
35
arXiv cs.CL·

Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing

STATEWITNESS, un expliciteur d'activations, détecte la tromperie dans les LLMs de raisonnement en lisant les états cachés du modèle cible et répondant à des requêtes en langage naturel. Atteint 0.916 AUROC, +11.6% vs meilleur moniteur texte black-box, +25.0% vs baseline probe. Fournit traces d'évidence au niveau token/phrase pour inspection humaine.

RaisonnementSécurité IAAlignement
SIG
78
HYP
25
arXiv cs.LG·

The Critical Role of Model Selection in Causal Inference: A Comparative Analysis of Classification Models within the InferBERT Framework for Pharmacovigilance

InferBERT combine transformers et Do-calculus pour détecter les effets indésirables causaux en pharmacovigilance. Étude comparative sur AILF et TRAM : BioBERT surpasse XGBoost, ALBERT et Med-LLaMA. Conclusion : le pré-entraînement spécialisé (biomedical) prime sur la taille du modèle.

BenchmarksFine-tuningSécurité IA
SIG
72
HYP
15
arXiv cs.CL·

An expressivity analysis of hierarchical modelling in deep transformers via bounded-depth grammars

Analyse théorique de l'expressivité des transformers profonds via des grammaires sans contexte de profondeur bornée. Les auteurs construisent explicitement des transformers avec attention positionnelle dont la profondeur croît linéairement avec celle de la grammaire, démontrant que ces architectures peuvent encoder des états grammaticaux abstraits dans des sous-espaces linéairement séparables du flux résiduel.

PapersRaisonnementBenchmarks
SIG
78
HYP
15
arXiv cs.CL·

Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

Étude d'un biais de second ordre chez les LLMs : comment les modèles jugent les contenus biaisés, au-delà de leur génération. Basée sur l'épistémologie de l'entitlement, la méthode évalue si les LLMs infèrent correctement les démographies sans justification suffisante. Résultats : biais systématique selon les groupes ciblés, contournement des garde-fous, persistance des déclencheurs démographiques.

ÉvaluationsSécurité IAAlignement
SIG
72
HYP
18
arXiv cs.CL·

The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports

Étude sur 450 rapports de radiologie thoracique montrant que la réécriture par LLM pour standardisation préserve l'alignement image-texte (2,5% de dégradation) mais érode 26,8-29,3% des entités cliniques et 14,9-16,5% du langage d'incertitude. Le paradoxe : les tâches produisant du texte « plus propre » éloignent le contenu de l'image.

VisionRAGÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows

AIPatient Arena évalue les LLM en consultation clinique multi-tours sur 8 dimensions via des graphes de connaissances EHR. Sur 437 patients, les modèles excellent en questionnement (4.43-4.99/5) et conduite éthique (4.38-4.93/5), mais échouent en diagnostic (2.63-3.55/5) et couverture informationnelle (2.08-3.02/5). Les faiblesses incluent répétitions, omissions d'antécédents, gestion insuffisante de l'incertitude.

ÉvaluationsRaisonnementSécurité IA
SIG
82
HYP
15
arXiv cs.LG·

Rift: A Conflict Signature for Deception in Language Models

Des chercheurs identifient une signature interne de la tromperie dans les modèles de langage : les réponses mensongères affichent une rang résiduel 2.1-2.3x plus élevé que les réponses naïvement fausses. Cette signature détecte la déception avec 100% de précision sur GPT-2, Qwen2.5 et Phi-3, et transfère zero-shot entre familles de modèles et langues (AUC 0.933-1.0).

Sécurité IAAlignementÉvaluations
SIG
82
HYP
25
arXiv cs.CL·

Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation

Étude de la fiabilité de la confiance verbalisée des LLM en traduction automatique. Cinq méthodes d'extraction de confiance par token sans accès aux signaux internes sont comparées aux probabilités prédites. Résultats : performance similaire pour la détection d'erreurs et la calibration, mais faible corrélation entre méthodes internes et verbalisées.

ÉvaluationsRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

Sum-of-Squares Degree Barriers for the Reweighted-Hinge Method in Robust Halfspace Learning: A Christoffel-Function Characterization

Article théorique sur les barrières de degré Sum-of-Squares pour l'apprentissage robuste de demi-espaces avec bruit malveillant. La fonction de Christoffel caractérise exactement la corruption qu'un certificat de degré borné ne peut pas éliminer. Démontre un compromis marge-degré et un algorithme de degré-2t atteignant la frontière η^(1-1/2t).

PapersRaisonnementSécurité IA
SIG
72
HYP
08
arXiv cs.LG·

Uncertainty Quantification of Engineering Structures by Polynomial Chaos Expansion and Multivariate Active Learning

Méthode d'échantillonnage adaptatif séquentiel pour construire des modèles de substitution par expansion en chaos polynomial, optimisée pour plusieurs quantités d'intérêt simultanées. L'approche équilibre exploration de l'espace d'entrée et exploitation de la variance agrégée, améliorant la précision et la stabilité des surrogates par rapport à l'échantillonnage Latin Hypercube.

BenchmarksÉvaluations
SIG
72
HYP
08
arXiv cs.CL·

From Parasocial Scripts to Dyadic Persistence in Autonomous AI-Agent Communities

Étude de 4 434 posts et 50 338 commentaires sur Moltbook montrant que les indices de relations parasociales (langage d'intimité, offres de réciprocité, auto-identification) persistent dans les communautés d'agents IA autonomes. Les résultats, validés par keyword matching et annotation LLM, révèlent une association forte entre ces signaux et la ré-engagement de l'auteur original.

Agents IAMulti-agentsPapers
SIG
72
HYP
15
arXiv cs.AI·

SpeechDx: A Multi-Task Benchmark for Clinical Speech AI

SpeechDx est un benchmark multi-tâches pour l'IA clinique basée sur la parole, couvrant 12 datasets et 27 tâches sur diverses conditions de santé. Les tâches sont structurées par étapes de production vocale (conceptualisation, formulation, articulation). L'évaluation de 12 encodeurs audio montre que les modèles de parole à grande échelle surpassent les modèles spécialisés, mais aucun ne généralise fiablement.

BenchmarksVoixÉvaluations
SIG
78
HYP
15
arXiv cs.LG·

CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models

CheckMIABench propose un benchmark pour évaluer les attaques d'inférence d'appartenance (MIA) sur les modèles de langage. En exploitant les checkpoints intermédiaires de modèles open-source (Pythia, OLMo, 70M-7B), les auteurs créent des testbeds fiables où les données avant/après un point fixe partagent la même distribution. Ils testent six attaques publiées et ouvrent une librairie modulaire (pandora_llm).

PapersBenchmarksSécurité IA
SIG
78
HYP
15
arXiv cs.CL·

Self-Generated Error Training for Token Editing in Diffusion Language Models

Méthode d'entraînement pour améliorer l'édition de tokens dans les modèles de diffusion (LLaDA2.1). Résout le décalage entre l'entraînement sur corruptions aléatoires et l'inférence sur erreurs du modèle lui-même. Utilise une passe sans gradient suivie d'une supervision sur corruptions auto-générées via LoRA. Réduit l'intensité d'édition et les erreurs de transcription.

Génération de codeFine-tuningRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

When the Next Step Is Not One Step: Distribution-Aware Execution Modeling for Concurrent Go Programs

Modèle 7B fine-tuné pour prédire l'étape suivante dans des programmes Go concurrents en apprenant une distribution d'événements plutôt qu'une étiquette unique. Sur 798 prédictions issues de bugs réels (CockroachDB, Kubernetes, gRPC, etcd), atteint 36.2% de précision avec <1000 traces, surpassant Gemini 3.5 Flash zéro-shot (34.8%). Dataset, adapters et outils publiés.

Génération de codeBenchmarksFine-tuning
SIG
78
HYP
15
arXiv cs.AI·

MapSatisfyBench: Benchmarking Satisfaction-Aware Map Agents through Behavior-Grounded Implicit Decision Factors

MapSatisfyBench est un benchmark pour évaluer les agents LLM intégrés aux services cartographiques. Il mesure leur capacité à identifier et satisfaire les besoins implicites des utilisateurs (facteurs de décision non explicités) à partir de données comportementales réelles. Les expériences montrent que les agents actuels réussissent bien sur les tâches explicites mais peinent à anticiper les facteurs implicites.

Agents IABenchmarksÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

FllumaOne: A Code-Native Multimodal CAD Dataset with Executable Programs and Kernel-Validated Feature Histories

FllumaOne est un dataset CAD multimodal de 100 000 modèles générés par programmes Python exécutables dans Flluma (système CAD basé OpenCASCADE). Chaque échantillon aligne le programme avec un arbre de features, une représentation STEP, un nuage de points et des descriptions en langage naturel. Un baseline Qwen2.5-Coder-1.5B atteint 99.98% de validité syntaxe Python et 99.14% de validité export STEP.

Génération de codeBenchmarksVision
SIG
82
HYP
15
arXiv cs.LG·

Geometry-Aware Post-Hoc Uncertainty Quantification in Operator Learning

REEF-GP, un cadre post-hoc pour la quantification d'incertitude dans les opérateurs neuronaux, adapte les représentations intrinsèques de l'opérateur pour construire des incertitudes conscientes de la géométrie. Testé sur 5 benchmarks PDE, il préserve la précision prédictive tout en fournissant des estimations d'incertitude calibrées, plus efficace que les ensembles profonds.

PapersRaisonnementÉvaluations
SIG
72
HYP
18
arXiv cs.CL·

Revisiting LLM Adaptation for 3D CT Report Generation: A Study of Scaling and Diagnostic Priors

Étude d'adaptation d'LLM pour la génération de rapports CT 3D en imagerie médicale. RAD3D-Prefix, un framework léger basé sur des priors diagnostiques, intègre embeddings d'images et logits de classification multi-label. Sur LLMs de 96.1M à 1.6B paramètres, geler le modèle et entraîner uniquement des couches de projection surpasse le fine-tuning complet, réduisant l'hallucination clinique et l'overfitting.

Fine-tuningVision
SIG
72
HYP
15
arXiv cs.CL·

MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation

MODE-RAG est un système multi-agent basé sur l'énergie libre variationnelle pour réduire les hallucinations dans les systèmes de génération augmentée par récupération multimodale. Il utilise MCTS, perturbations logit et des agents spécialisés pour router les requêtes à haut risque et vérifier les faits. Les auteurs introduisent ModeVent, un sous-ensemble du dataset MultiVent, pour évaluer la robustesse.

RAGMulti-agentsVision
SIG
72
HYP
28
arXiv cs.AI·

Can LLMs Be CEOs? Benchmarking Strategic Resource Reallocation with Multi-Role Agent Simulation

CEO-Bench, un benchmark multi-agent, évalue la capacité des LLM à prendre des décisions stratégiques de réallocation de ressources. Cinq modèles frontière testés sur 13 scénarios montrent une validité structurelle élevée mais divergent sur l'étalonnage stratégique. Les défaillances incluent la capture par un seul conseiller et l'amnésie historique.

Agents IAMulti-agentsRaisonnement
SIG
72
HYP
28
arXiv cs.AI·

FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness

FinAcumen est un agent de raisonnement financier multimodal qui accumule l'expérience des trajectoires antérieures dans une mémoire persistante. Le système améliore un modèle vision-langage 8B gelé sur quatre benchmarks financiers en utilisant l'activation sélective d'expériences et un environnement d'outils déterministe pour le calcul numérique et la vérification.

Agents IAMulti-agentsVision
SIG
72
HYP
28
arXiv cs.AI·

MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning

MathVis-Fine propose un cadre pour améliorer le raisonnement mathématique multimodal en modélisant les dépendances visuelles fine-grained. Un nouveau dataset annote les images avec des ratings de dépendance visuelle. Un entraînement progressif en deux étapes équilibre les récompenses de correction et de grounding visuel selon la nécessité réelle de chaque échantillon.

RaisonnementVisionBenchmarks
SIG
72
HYP
18
arXiv cs.AI·

Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games

Les chercheurs proposent « Equation-to-Behavior Prompting » pour guider les LLM à simuler différents modèles cognitifs humains (Bayésien, motivated reasoning, modèle α-β de Grether). Les grands modèles approximent ces spécifications par prompting, mais les petits modèles échouent. L'entraînement par RL réduit l'erreur de croyance de 26,5% et améliore les performances de 2,5–12% sur des jeux de persuasion légaux.

RaisonnementReinforcement learningÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

SEAGym est un environnement d'évaluation pour mesurer les mises à jour du harnais d'agents LLM auto-évolutifs (prompts, mémoire, outils, boucle interaction). L'étude compare ACE, TF-GRPO et AHE sur Terminal-Bench 2.0 et HLE, révélant que les mises à jour fréquentes ne garantissent pas l'amélioration en validation et que la diversité des données affecte la fiabilité.

Agents IAReinforcement learningÉvaluations
SIG
75
HYP
15
arXiv cs.AI·

Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs

E³RL, une méthode de reinforcement learning, résout le problème de propagation d'erreurs en raisonnement long-horizon des LLMs. En utilisant l'entropie croisée autoregressive comme signal d'incertitude épistémique, le modèle peut corriger localement les défauts logiques et réutiliser le cache KV. Sur AIME, les modèles 4B et 8B surpassent l'état de l'art de 5,3% et 6,5%.

Reinforcement learningRaisonnementBenchmarks
SIG
72
HYP
45
arXiv cs.AI·

Dissecting model behavior through agent trajectories

Étude de l'alignement harness-modèle via 138k trajectoires d'agents. Les auteurs introduisent Simple Strands Agent (SSA), un harness générique testant Claude, Gemini, GPT, Grok, Qwen sur SWE-Pro, SWE-Verified et Terminal-Bench-2. Au-delà des scores pass@1, l'analyse révèle des différences comportementales fines : fréquence d'édition, activité de test, transitions de phase.

Agents IABenchmarksGénération de code
SIG
75
HYP
15
arXiv cs.AI·

Beyond Domains: Reusing Web Skills via Transferable Interaction Patterns

SkillMigrator est un agent LLM qui apprend des compétences web réutilisables en les transférant entre sites via la correspondance de structure de mise en page plutôt que de références d'éléments spécifiques. Les compétences induites sont stockées comme des motifs d'interaction transférables (TIP). Sur WebArena et Mind2Web, SkillMigrator réduit le nombre d'actions LLM de 8-10% à taux de succès équivalent.

Agents IAGénération de codeBenchmarks
SIG
72
HYP
18
arXiv cs.LG·

Noise-Driven Escape from Metastable Phases explains Grokking in Deep Neural Networks

Des chercheurs expliquent le phénomène de grokking (généralisation soudaine après surapprentissage prolongé) par des transitions de phase du premier ordre en fonction de la régularisation L2. Le bruit SGD permet aux réseaux de s'échapper de états métastables piégés, avec des temps d'échappement suivant l'échelle d'Arrhenius. Les résultats s'étendent aux réseaux non-linéaires.

PapersRaisonnementÉvaluations
SIG
78
HYP
25
arXiv cs.LG·

Decision-Driven Geosteering Under Uncertainty: A Unified Framework for Sequential Decision Optimization

Framework d'optimisation séquentielle pour la géonavigation de puits pétroliers sous incertitude. Intègre filtrage particulaire pour l'interprétation probabiliste du sous-sol et apprentissage par renforcement basé sur la valeur. Compare trois approches décisionnelles : programmation dynamique approximée, Deep Q-learning et Double DRL avec décomposition duelle, validées sur simulateur industriel.

Reinforcement learningRaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.CL·

Implicit vs. Explicit Prompting Strategies for LVLMs in Referential Communication

Deux études récentes tirent des conclusions contradictoires sur la capacité des LVLMs à coordonner des expressions référentielles efficaces. Cette recherche contrôle les différences de tâches et compare directement les styles de prompting. Les modèles coordonnent efficacement avec un prompting explicite, mais échouent à inférer le besoin d'efficacité communicative avec un prompting implicite.

Prompt engineeringVisionÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

LongWebBench est un benchmark évaluant la génération de pages web longues par des modèles vision-langage. Il contient 490 pages réelles pour l'évaluation structurelle et 507 tâches interactives sur 129 pages. Les expériences montrent que la fidélité structurelle se dégrade avec la longueur et que les générations visuellement plausibles échouent souvent à supporter les interactions multi-étapes.

VisionBenchmarksAgents IA
SIG
75
HYP
20
arXiv cs.AI·

Beyond Parallel Sampling: Diverse Query Initialization for Agentic Search

DivInit améliore l'échelle de test pour la recherche agentic en diversifiant les requêtes initiales. Au lieu d'échantillonner k requêtes indépendantes en parallèle, la méthode génère n candidats puis sélectionne k graines diversifiées. Gains de 5-7 points sur QA multi-hop sans coût computationnel supplémentaire, validé sur 5 modèles open-weight et 8 benchmarks.

Agents IARaisonnementBenchmarks
SIG
78
HYP
18
arXiv cs.LG·

Generalization Guarantees for Multi-Input Neural Operator Learning in Sobolev Spaces

Analyse théorique des garanties de généralisation pour les opérateurs neuronaux multi-entrées avec erreur mesurée en normes de Sobolev. Le cadre traite plusieurs fonctions d'entrée sur domaines différents avec dimensions et régularités variables. Les taux d'approximation et de généralisation quantifient explicitement la contribution de chaque espace d'entrée.

PapersRaisonnementBenchmarks
SIG
72
HYP
08
arXiv cs.AI·

DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack

DeepInsight est une infrastructure d'évaluation unifiée pour les systèmes Physical AI, couvrant trois ordres de magnitude d'opérateurs (du décodage de modèles fondamentaux à la simulation physique complète). Elle utilise trois abstractions invariantes (task, resource, result) pour préserver l'hétérogénéité des régimes tout en permettant le diagnostic cross-layer des régressions.

RaisonnementÉvaluationsRobotique
SIG
75
HYP
15
arXiv cs.AI·

MemTrace: Probing What Final Accuracy Misses in Long-Term Memory

MemTrace est un benchmark évaluant la mémoire long-terme des agents LLM selon trois dimensions : l'âge de la mémoire, le type de question (état actuel, antérieur, trajectoire) et les conditions de preuve. Sur 13 configurations testées, l'étude révèle que l'utilisation des preuves est le goulot d'étranglement principal (10× plus souvent disponibles que manquantes), non la récupération.

Agents IAÉvaluationsBenchmarks
SIG
78
HYP
15
arXiv cs.AI·

Distributed General-Purpose Agent Networks: Architecture, Key Mechanisms, and Prototypes

Article arXiv proposant une architecture pour des réseaux d'agents autonomes distribués en peer-to-peer. Les auteurs identifient trois mécanismes clés : propagation sémantique pour la découverte de collaborateurs, identité vérifiable et réputation multi-sujets (MG-EigenTrust), et conception de mécanismes pour l'exécution de tâches ouvertes. Prototypes et simulations présentés.

Agents IAMulti-agentsPapers
SIG
65
HYP
25
arXiv cs.AI·

How Inference Compute Shapes Frontier LLM Evaluation

Étude sur 12 modèles frontière évaluant l'impact du compute d'inférence sur les performances. Trois interventions testées : budgets de tokens plus larges, compaction de contexte, tentatives répétées. Résultats : les budgets augmentés améliorent significativement les performances sur FrontierMath, Humanity's Last Exam, TerminalBench. Les évaluations à budget fixe sous-estiment les capacités des modèles récents.

BenchmarksÉvaluationsRaisonnement
SIG
82
HYP
15