Page 33 sur 192

ToutHaut signalRécent
7679 articles
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> microsoft /</span> RD-Agent

Microsoft publie RD-Agent, un système d'IA autonome pour automatiser les processus R&D en data science et ML. L'agent pilote expériences, analyse de données et itérations de modèles sans intervention humaine.

Agents IAMulti-agentsOpen source
SIG
75
HYP
35
arXiv cs.AI·

Dissecting model behavior through agent trajectories

Étude de l'alignement harness-modèle via 138k trajectoires d'agents. Les auteurs introduisent Simple Strands Agent (SSA), un harness générique testant Claude, Gemini, GPT, Grok, Qwen sur SWE-Pro, SWE-Verified et Terminal-Bench-2. Au-delà des scores pass@1, l'analyse révèle des différences comportementales fines : fréquence d'édition, activité de test, transitions de phase.

Agents IABenchmarksGénération de code
SIG
75
HYP
15
arXiv cs.AI·

DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack

DeepInsight est une infrastructure d'évaluation unifiée pour les systèmes Physical AI, couvrant trois ordres de magnitude d'opérateurs (du décodage de modèles fondamentaux à la simulation physique complète). Elle utilise trois abstractions invariantes (task, resource, result) pour préserver l'hétérogénéité des régimes tout en permettant le diagnostic cross-layer des régressions.

RaisonnementÉvaluationsRobotique
SIG
75
HYP
15
arXiv cs.AI·

SkillChain-Gym: A Benchmark for Reskilling-Aware Production-Inventory Control under Disruptions

SkillChain-Gym est un benchmark pour la planification de production intégrant la gestion des compétences des travailleurs. L'environnement simule la dégradation des certifications, la formation et les contraintes de capacité. Évaluation de politiques de production, d'adaptation réactive et d'assurance statique sur 60 périodes avec métriques opérationnelles et de résilience.

BenchmarksReinforcement learningAgents IA
SIG
75
HYP
15
arXiv cs.AI·

DiagFlowBench: Evaluating How Language Models Handle Off-Procedure Inputs in Grounded Diagnostic Dialogue

DiagFlowBench évalue comment les modèles de langage gèrent les requêtes hors-procédure dans le diagnostic industriel. Un dataset de 1 676 conversations multi-tours basées sur 50 flowcharts de diagnostic révèle que les modèles sélectionnent souvent une étape réelle mais inadéquate plutôt que d'halluciner, créant une vulnérabilité : des conseils plausibles mais incorrects.

BenchmarksÉvaluationsRaisonnement
SIG
75
HYP
15
arXiv cs.AI·

LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

LongWebBench est un benchmark évaluant la génération de pages web longues par des modèles vision-langage. Il contient 490 pages réelles pour l'évaluation structurelle et 507 tâches interactives sur 129 pages. Les expériences montrent que la fidélité structurelle se dégrade avec la longueur et que les générations visuellement plausibles échouent souvent à supporter les interactions multi-étapes.

VisionBenchmarksAgents IA
SIG
75
HYP
20
arXiv cs.LG·

Probing, Fusion, and Trustworthiness: A Systematic Evaluation of Foundation Model Representations for Multimodal Cancer Analysis

Évaluation systématique de représentations de modèles de fondation (5 FMs) sur des tâches de pathologie computationnelle utilisant images entières de lames et profils transcriptomiques (cohorts IH-BC, IH-NSCLC). Fusion multimodale améliore les performances quand aucune modalité ne domine. Prédiction conforme montre que le diagnostic correct reste récupérable dans 90% des cas d'erreur.

VisionBenchmarksSécurité IA
SIG
75
HYP
15
arXiv cs.AI·

SEAGym: An Evaluation Environment for Self-Evolving LLM Agents

SEAGym est un environnement d'évaluation pour mesurer les mises à jour du harnais d'agents LLM auto-évolutifs (prompts, mémoire, outils, boucle interaction). L'étude compare ACE, TF-GRPO et AHE sur Terminal-Bench 2.0 et HLE, révélant que les mises à jour fréquentes ne garantissent pas l'amélioration en validation et que la diversité des données affecte la fiabilité.

Agents IAReinforcement learningÉvaluations
SIG
75
HYP
15
arXiv cs.CL·

Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

Étude comparative de modules de mémoire et compétences pour agents web. Sur WebArena et WorkArena, un baseline vanilla avec budget token équivalent égale ou surpasse AWM, ASI et ReasoningBank. Résultats sur Gemini 3 Flash, GPT-4o-mini, Qwen 3.6-27B montrent que les gains apparents disparaissent face à un acteur augmenté du même budget.

Agents IABenchmarksRaisonnement
SIG
75
HYP
15
arXiv cs.CL·

A Practical Evaluation Method for Long-Form Simultaneous Speech-to-Speech Translation

Nouvelle méthode d'évaluation pratique pour la traduction simultanée parole-à-parole (SimulS2ST) sur longs énoncés continus. Utilise ASR, alignement forcé et embeddings de phrases pour récupérer timestamps et aligner texte cible aux phrases source, puis calcule latence et qualité (YAAL, xCOMET) au niveau phrase. Révèle accumulation substantielle de latence sur longs discours.

VoixÉvaluationsBenchmarks
SIG
75
HYP
15
arXiv cs.CL·

Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

Benchmark AgentViSS évalue l'intelligence sociale visuelle d'agents multimodaux dans des simulations sociales. 240 scénarios, 585 rôles, 2340 instances testent si les MLLMs utilisent indices visuels (expressions, posture, regard) pour guider interactions. Sept modèles évalués montrent écart : expression et gestion de conflits proches saturation, régulation d'interaction et résultats visuels restent difficiles.

BenchmarksVisionAgents IA
SIG
75
HYP
25
arXiv cs.AI·

S1-DeepResearch: Beyond Search, Toward Real-World Long-Horizon Research Agents

S1-DeepResearch propose un paradigme unifié de construction de trajectoires pour les agents de recherche profonde, combinant QA fermée et exploration ouverte. Le modèle 32B atteint des performances SOTA parmi les modèles open-source sur 20 benchmarks couvrant raisonnement complexe, synthèse de connaissances, génération de rapports et compréhension de fichiers.

Agents IARaisonnementBenchmarks
SIG
75
HYP
25
arXiv cs.CL·

Context Compression Is Not One Thing: Readable Symbolic Re-expression vs. Coherent Summary at Matched Budget

Telegraph English, un format symbolique lisible, réécrit les passages récupérés en déclarations entité-relation structurées pour la compression de contexte. Sur MuSiQue, TwoWiki et HotpotQA, il surpasse trois baselines à budget égal (suppression, troncature, sous-échantillonnage) de 13-20 points F1, et dépasse les résumés en prose cohérente sur le dataset le plus difficile.

RAGRaisonnementBenchmarks
SIG
75
HYP
15
arXiv cs.LG·

QPILOTS: Efficient Test-Time Q-Steering for Flow Policies

QPILOTS optimise les politiques de flow-matching et diffusion en temps d'inférence via Q-steering. La méthode projette les actions bruitées intermédiaires vers des estimations finales avant d'évaluer le critique, évitant l'instabilité numérique. Résultats : 90% de taux de succès sur 50 tâches offline-to-online, et surpasse les approches existantes sur 6 tâches de manipulation avec modèles VLA gelés.

Reinforcement learningAgents IARaisonnement
SIG
75
HYP
15
arXiv cs.LG·

StarOR: Synergizing Tree Search and Test-Time Reinforcement Learning for Optimization Modeling

StarOR couple la recherche arborescente (MCTS) avec l'apprentissage par renforcement au moment de l'inférence pour la modélisation d'optimisation. Le système décompose le processus en quatre étapes, affine un adaptateur LoRA via GRPO à chaque nœud, et utilise un système de récompense multi-facettes sans labels. Résultats SOTA sur cinq benchmarks avec backbone 4B.

RaisonnementReinforcement learningFine-tuning
SIG
75
HYP
25
arXiv cs.LG·

Exploring Starts Are Not Enough: Counterexamples and a Fix for Monte Carlo Exploring Starts

Étude des propriétés de convergence de Monte Carlo Exploring Starts (MCES) en apprentissage par renforcement tabulaire. Les auteurs construisent des contre-exemples montrant que MCES peut converger vers des solutions sous-optimales, même avec exploration initiale. Une modification basée sur l'ajustement des taux d'apprentissage par fréquence de mise à jour garantit la convergence à l'optimalité.

Reinforcement learningPapersBenchmarks
SIG
75
HYP
15
arXiv cs.CL·

Pepti-Agent: An AI Agent for Peptide Design and Optimization

Pepti-Agent est un framework d'IA pour la conception de peptides thérapeutiques utilisant le Model Context Protocol (MCP). Un contrôleur LLM orchestre des outils indépendants : génération via PeptideGPT, prédiction de propriétés (solubilité, hémolytique, fouling) via ProtBERT, et mutation résidu par résidu. Le système trace chaque décision pour permettre le benchmarking multi-objectif et la validation expérimentale.

Agents IAMCPRaisonnement
SIG
75
HYP
15