Archives

juin 2026

2731 articles

GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> google /</span> skills

Google publie Skills, une collection d'outils et de compétences pour agents IA compatibles avec les produits Google. Le projet fournit des intégrations et des capacités étendues pour les systèmes multi-agents.

Agents IAMulti-agentsDeepMind
SIG
65
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> phuryn /</span> pm-skills

PM Skills Marketplace propose 100+ compétences, commandes et plugins pour agents IA, couvrant découverte, stratégie, exécution, lancement et croissance.

Agents IAOutilsOpen source
SIG
35
HYP
55
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> biomejs /</span> biome

Biome est une chaîne d'outils pour projets web offrant formatage et linting via CLI et LSP. Projet open-source visant à maintenir la qualité du code.

OutilsOpen sourceGénération de code
SIG
45
HYP
15
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> idootop /</span> open-xiaoai

Projet open-source pour donner à la Xiaoai Speaker la capacité d'écoute vocale avancée. Déverrouille des fonctionnalités vocales illimitées sur l'enceinte connectée Xiaomi.

Open sourceVoix
SIG
35
HYP
45
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> 777genius /</span> agent-teams-ai

Framework multi-agents où vous supervisez une équipe d'IA autonomes via un tableau kanban. Intègre 200+ modèles et 75+ fournisseurs LLM (Claude, Codex, OpenCode). Les agents collaborent, se relisent mutuellement et exécutent des tâches sans intervention.

Agents IAMulti-agentsClaude
SIG
45
HYP
65
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> xerrors /</span> Yuxi

Plateforme multi-tenant Agent Harness intégrant base de connaissances LightRAG et graphes de connaissances. Stack : LangChain + Vue + FastAPI, support DeepAgents, MinerU PDF, Neo4j, MCP.

Agents IARAGMCP
SIG
65
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> langchain-ai /</span> deepagents

DeepAgents est un framework d'agents IA clé en main proposé par LangChain. Il fournit une architecture complète pour construire et déployer des agents autonomes avec intégration native des outils et workflows.

Agents IAOpen sourceOutils
SIG
45
HYP
35
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> google /</span> skills

Google publie Skills, une collection d'outils et de ressources pour développer des agents IA compatibles avec les produits Google. Le projet fournit des compétences réutilisables et des intégrations pour construire des systèmes multi-agents.

Agents IAMulti-agentsDeepMind
SIG
65
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> magenta /</span> magenta-realtime

Magenta RealTime 2 est un modèle open-weights de Google pour la génération musicale en temps réel. Il permet de créer de la musique live avec latence minimale, accessible via open-source.

DeepMindOpen source
SIG
75
HYP
25
GitHub Trending·

<svg aria-hidden="true" data-component="Octicon" height="16" viewBox="0 0 16 16" version="1.1" width="16" data-view-component="true" class="octicon octicon-repo mr-1 tmp-mr-1 color-fg-muted"> <path d="M2 2.5A2.5 2.5 0 0 1 4.5 0h8.75a.75.75 0 0 1 .75.75v12.5a.75.75 0 0 1-.75.75h-2.5a.75.75 0 0 1 0-1.5h1.75v-2h-8a1 1 0 0 0-.714 1.7.75.75 0 1 1-1.072 1.05A2.495 2.495 0 0 1 2 11.5Zm10.5-1h-8a1 1 0 0 0-1 1v6.708A2.486 2.486 0 0 1 4.5 9h8ZM5 12.25a.25.25 0 0 1 .25-.25h3.5a.25.25 0 0 1 .25.25v3.25a.25.25 0 0 1-.4.2l-1.45-1.087a.249.249 0 0 0-.3 0L5.4 15.7a.25.25 0 0 1-.4-.2Z"></path> </svg> <span data-view-component="true" class="text-normal"> Andyyyy64 /</span> whichllm

Outil CLI pour identifier le meilleur LLM local sur son matériel. Classement basé sur benchmarks réels et actualisés, pas sur le nombre de paramètres. Exécution instantanée en une commande.

Open sourceOutilsBenchmarks
SIG
65
HYP
35
Reddit r/MachineLearning·

Open image generation models are closer to closed-source quality than this sub thinks [D]

Un chercheur évalue les modèles open-source de génération d'images et constate que l'écart avec les APIs fermées est bien plus petit que supposé. Les derniers checkpoints gèrent les scènes multi-objets et le rendu de texte (70-80% de succès) de manière comparable aux endpoints payants, avec des temps d'inférence de 2 minutes pour 2MP sur GPU grand public.

Génération d'imagesBenchmarksOpen source
SIG
45
HYP
35
arXiv cs.AI·

When Does Multi-Agent Collaboration Help? An Entropy Perspective

Étude empirique de 245 features d'entropie (token, agent, round) sur 6 benchmarks de raisonnement et 2 tâches agentic. Résultat contre-intuitif : agent unique surpasse MAS dans 43,3% des cas. Trois observations clés : préférence pour la certitude, entropie de base déterminante, variation selon la tâche. Algorithme Entropy Judger proposé pour sélectionner solutions MAS.

Multi-agentsAgents IARaisonnement
SIG
78
HYP
15
arXiv cs.AI·

DuMate-DeepResearch: An Auditable Multi-Agent System with Recursive Search and Rubric-Grounded Reasoning

DuMate-DeepResearch est un système multi-agent pour la recherche approfondie construit sur Qianfan Agent Foundry. Il découple planification et exécution, introduit une stratégie de planification dynamique basée graphe, une exécution récursive à deux niveaux, et une optimisation par rubrique au test-time. Résultats SOTA : 58,03% sur DeepResearch Bench et 61,95% sur DeepResearch Bench II.

Multi-agentsAgents IARaisonnement
SIG
78
HYP
25
arXiv cs.AI·

Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization

Méthode HSCHG pour la localisation d'événements audio-visuels en vocabulaire ouvert. Construit un graphe hétérogène hiérarchique en espace euclidien avec nœuds de segments et vidéo, applique une fusion multi-modale sélective et projette les représentations en espace hyperbolique avec régularisation d'implication hiérarchique. Surpasse les méthodes existantes sur le benchmark OV-AVEL.

VisionVoixBenchmarks
SIG
72
HYP
15
arXiv cs.AI·

Quantum-Inspired Trace-Augmented Evidence Selection for Reasoning over Structured Hypothesis Spaces

Les LLM échouent sur les tâches juridiques exigeant une sélection rigoureuse des preuves. EP-HUBO traite la sélection de fragments de raisonnement (CoT) comme un problème d'optimisation combinatoire binaire d'ordre supérieur, pondéré par pertinence/spécificité/distinctivité. Testé sur benchmarks légaux avec recuit simulé et hardware quantique Dirac-3.

RaisonnementBenchmarksPapers
SIG
72
HYP
15
arXiv cs.AI·

Workflow-to-Skill: Skill Creation via Routing-Workflow-Semantics-Attachments Decomposition

Papier arXiv proposant W2S, un framework pour construire automatiquement des Skills (procédures encodées) pour agents LLM à partir de traces d'interaction hétérogènes. Introduit RWSA, une représentation intermédiaire décomposant Skills en structure Workflow, Semantics et Attachments. Sur 70 Skills, W2S améliore la cohérence de rejeu comportemental de 10.5% vs baselines textuelles.

Agents IARaisonnementPapers
SIG
72
HYP
18
arXiv cs.AI·

OpenSkill: Open-World Self-Evolution for LLM Agents

OpenSkill propose un framework pour l'auto-évolution d'agents LLM en environnement ouvert, sans supervision de tâche cible. L'agent acquiert connaissances et signaux de vérification depuis documentation/web, synthétise des compétences transférables, et les affine via des tâches virtuelles auto-construites. Résultats sur 3 benchmarks montrent meilleure performance que baselines avec transfert cross-modèle.

Agents IAReinforcement learningPapers
SIG
72
HYP
28
arXiv cs.AI·

Accelerated Fourier SAT (AFSAT): Fully Realising a GPU-based Symmetric Pseudo-Boolean SAT Solver

AFSAT est un solveur GPU pour la satisfiabilité pseudo-booléenne basé sur la recherche locale continue. Implémenté en JAX, il utilise la composition de fonctions pures, la vectorisation automatique et la compilation JIT pour paralléliser massivement la recherche sur des batches. Améliore stabilité numérique, performance et efficacité mémoire par rapport au prototype FastFourierSAT.

BenchmarksInfrastructurePapers
SIG
72
HYP
15
arXiv cs.AI·

CARVE-Q: Quantum-Proposed, Classically Certified Interactive Driving Repair

CARVE-Q propose une architecture de certification pour réparer les manœuvres de conduite autonome rejetées. Un algorithme quantique (Grover) réduit la recherche dans le treillis de réparation multi-agents de O(M) à O(√M) requêtes, tandis que l'autorité de sécurité reste classique. Validation sur 65 536 assignations avec 100% respect du droit de passage.

RaisonnementRobotiqueSécurité IA
SIG
72
HYP
15
arXiv cs.AI·

CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions

CrowdMath est un dataset de 164 chaînes de discussions annotées du programme MIT PRIMES–Art of Problem Solving (2016-2025), capturant la résolution collaborative de problèmes ouverts. Les posts sont étiquetés par rôle fonctionnel (progrès partiel, erreur, correction). Six modèles frontier atteignent 83-88% en prédiction du post suivant mais seulement 0.42 macro-F1 en classification de rôle.

BenchmarksRaisonnementPapers
SIG
78
HYP
15
arXiv cs.CL·

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

MADE est un moteur d'analyse multilingue basé sur des agents qui décompose l'évaluation post-benchmark en planification, analyse agrégée, inspection d'instances et synthèse de rapports. Évalué sur 33 familles de modèles, 11 benchmarks et 26 langues (8,66M enregistrements), MADE surpasse les baselines de 47% en qualité de diagnostic et est préféré par 87,9% des experts humains.

Agents IAMulti-agentsÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

Tree-of-Experience: A Structured Experience-Management Solution for Self-Evolving Agents under Low-Repetition and Implicit-Reward Environments

Nouvel article sur la gestion structurée d'expérience pour agents LLM en environnements à récompenses implicites. Présente FinEvolveBench, un benchmark de prédiction de sentiment financier avec retours retardés et bruyants, et Tree-of-Experience (ToE), une méthode d'organisation et validation d'expérience qui surpasse les baselines sans mémoire.

Agents IAReinforcement learningBenchmarks
SIG
72
HYP
28
arXiv cs.CL·

EASE-TTT: Evidence-Aligned Selective Test-Time Training for Long-Context Question Answering

EASE-TTT combine la récupération de preuves et l'adaptation au test-time pour améliorer la QA sur long contexte. La méthode convertit les chunks de preuves en supervision d'attention douce, guidant l'adaptation des paramètres d'attention côté requête. Testée sur 6 tâches LongBench avec 3 petits modèles, elle surpasse les baselines de récupération et qTTT.

RAGRaisonnementBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

Are Large Language Models Suitable for Graph Computation? Progress and Prospects

Étude systématique de l'utilisation des LLM pour le calcul sur graphes. Les auteurs proposent une taxonomie basée sur deux paradigmes : LLM comme exécuteur (résolution directe) et LLM comme planificateur (décomposition et invocation d'outils externes). Conclusion : fiables pour tâches simples et petite échelle, peu fiables pour tâches complexes et exigeant de la précision.

RaisonnementAgents IABenchmarks
SIG
72
HYP
15
arXiv cs.CL·

CRAFT: A Unified Counterfactual Reasoning Framework for Tabular Question Answering and Fact Verification

CRAFT est un framework de raisonnement contrefactuel unifié pour le question-answering tabulaire et la vérification de faits. La méthode reformule ces tâches en processus de vérification bidirectionnel, construisant explicitement des énoncés déclaratifs et leurs variantes contrefactuelles. Résultats : améliorations sur WikiTQ et TabFact, réduction des écarts de performance entre LLMs.

RaisonnementBenchmarksPapers
SIG
72
HYP
18
arXiv cs.CL·

TA-RAG: Tone-Aware Retrieval-Augmented Generation for Peer-Support Health Communication

TA-RAG est un framework RAG léger basé sur des prompts qui intègre le contrôle du ton dans les pipelines RAG sans fine-tuning. Il opérationnalise le ton via quatre composants : réécriture sans stigma, ajustement de lisibilité, adaptation au destinataire et reformulation empathique. Évalué sur des données HIV peer-support (HOLA, NAPWHA), il améliore la qualité communicationnelle tout en préservant le contenu.

RAGPrompt engineeringSécurité IA
SIG
72
HYP
18
arXiv cs.CL·

Explain Like I'm 5 or Whatever I Choose: Evaluating the Interactive Potential of Language Model Responses

Étude d'évaluation de LLMs (GPT-5.1, GPT-5 mini, Claude Sonnet 4.5 + Thinking, DeepSeek-V3.1) sur leur capacité à générer plusieurs réponses à une même requête scientifique en variant la complexité du langage. Sur 98 requêtes, Claude Sonnet 4.5 ne maintient une complexité cohérente que 46% du temps. Framework d'évaluation basé sur étude formative avec 16 participants.

ÉvaluationsClaudeGPT
SIG
72
HYP
25
arXiv cs.CL·

Evidence Graph Consistency in Retrieval-Augmented Generation: A Model-Dependent Analysis of Hallucination Detection

Nouvelle méthode Evidence Graph Consistency (EGC) pour détecter les hallucinations dans les systèmes RAG. Testée sur 5,767 réponses de 6 LLMs (Llama-2, GPT-4, GPT-3.5, Mistral-7B), elle révèle que la cohérence structurelle des graphes d'évidence fonctionne inversement selon les familles de modèles, invalidant son usage comme signal universel.

RAGBenchmarksPapers
SIG
72
HYP
18
arXiv cs.CL·

Does Topic Sentiment Cause Perceived Ideology? Comparing Human and LLM Annotations in Political News Articles

Étude comparant annotations humaines et LLM (GPT-4o-mini, Llama-3.3-70B) sur l'idéologie politique d'articles de presse. Double Machine Learning révèle que le fine-tuning de GPT-4o-mini crée un couplage spurieux sentiment-idéologie absent du jugement humain, malgré F1=72.48. Implications pour l'utilisation des annotations LLM comme silver labels.

GPTLlamaÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

What Do People Actually Want From AI? Mapping Preference Plurality

Analyse de 1 500 réponses ouvertes du dataset PRISM (75 pays) sur les préférences humaines envers les IA. Résultat : les valeurs demandées varient fortement entre individus (seule l'exactitude atteint 49%), avec des définitions divergentes du même concept. Les méthodes RLHF actuelles échouent à capturer cette pluralité en l'agrégant dans un modèle de récompense unique.

AlignementReinforcement learningÉvaluations
SIG
78
HYP
25
arXiv cs.CL·

CAF-Gen: A Multi-Agent System for Enriching Argumentation Structures

CAF-Gen est un système multi-agent qui enrichit les structures argumentatives extraites du texte en modèles conformes au Carneades Argumentation Framework (CAF). Un agent créateur génère des structures enrichies validées par un agent critique dans une boucle itérative, améliorant la qualité et la stabilité structurelle par rapport aux modèles génératifs mono-pass.

Multi-agentsRaisonnementPapers
SIG
72
HYP
28
arXiv cs.CL·

How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures

Étude des signatures de défaillance du raisonnement dans les modèles de langage via signaux d'incertitude au niveau des tokens. Deux modes identifiés : défaillance engagée (verrouillage précoce sur un chemin incorrect) et incertitude persistante (accumulation tout au long de la trace). Framework validé sur 23 configurations modèle-dataset avec implications pour l'auto-cohérence.

RaisonnementÉvaluationsPapers
SIG
78
HYP
15
arXiv cs.CL·

Improving Cross-Lingual Factual Recall via Consistency-Driven Reinforcement Learning

PolyFact, un dataset de 100K questions factuelles multilingues sur Wikidata couvrant 12 langues, évalue trois approches pour améliorer la cohérence factuelle cross-lingue dans Qwen-2.5-7B et OLMo-2-1124-7B. GRPO surpasse le fine-tuning supervisé en réduisant la spécialisation linguistique dans les couches MLP et têtes d'attention, favorisant des représentations cross-lingues partagées.

BenchmarksReinforcement learningQwen
SIG
82
HYP
18
arXiv cs.LG·

Performance Variation in Deep Reinforcement Learning

Étude sur la variabilité des performances en apprentissage par renforcement profond. Les auteurs critiquent les méthodes conventionnelles de mesure d'incertitude et proposent des statistiques basées sur les percentiles (min-max IPR). Trois cas d'étude : LayerNorm réduit la variation dans PPO mais pas SAC ; TD-MPC2 montre moins de variation que PPO/SAC ; DQN et Rainbow présentent une variabilité similaire sur Atari.

Reinforcement learningBenchmarksÉvaluations
SIG
72
HYP
15
arXiv cs.LG·

Flatland: The Adventures of Gradient Descent with Large Step Sizes

Article théorique sur la convergence de la descente de gradient avec grands pas d'apprentissage. Les auteurs définissent formellement les « grands » pas en ne requérant que la continuité locale de Lipschitz du gradient, conçoivent des méthodes adaptatives du premier ordre qui opèrent à la limite de stabilité dès le début, et montrent que rechercher la platitude globale trop tôt ralentit la convergence.

Reinforcement learningRaisonnement
SIG
72
HYP
15
arXiv cs.LG·

ShallowBench: Benchmarking Generative Drug Design Models on Shallow-Pocket Targets

ShallowBench est un benchmark de 5 780 cibles protéiques à poches peu profondes extrait de CrossDocked2020, conçu pour évaluer les modèles génératifs de conception de médicaments sur des cibles difficiles comme KRAS et MYC. Les modèles actuels montrent une affinité de liaison prédite plus faible sur ces interfaces à faible concavité, révélant le besoin d'innovations architecturales nouvelles.

BenchmarksGénération de codePapers
SIG
75
HYP
20
arXiv cs.LG·

Explainable Runtime Dependency Tracking for AI-RAN Conflict Monitoring

Article sur le suivi des dépendances runtime dans les réseaux d'accès radio intégrés à l'IA (AI-RAN). Propose un primitif de monitoring léger utilisant une matrice booléenne pour tracker les dépendances paramètre-KPI à partir de télémétrie. Procédure à fenêtre glissante détectant les changements structurels pour diagnostic de conflits et rafraîchissement de modèles.

RaisonnementÉvaluationsSécurité IA
SIG
45
HYP
15
arXiv cs.LG·

FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models

FAIR-Calib propose une méthode de quantification post-entraînement (PTQ) pour les modèles de langage diffusifs (dLLMs). Le framework en deux étapes protège les décisions fragiles à la frontière d'écriture en pondérant les états cachés instables, sans rollouts diffusion coûteux. Résultats sur LLaDA et Dream (W4A4) montrent réduction des erreurs de quantification.

LlamaFine-tuningPapers
SIG
72
HYP
15
arXiv cs.AI·

Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle

AARRI-Bench évalue les agents IA sur des tâches de recherche scientifique granulaires. Même la meilleure configuration (Mini-SWE-Agent + Claude Opus 4.7) atteint 68,3% de succès, révélant des lacunes en jugement nuancé et éthique. Le benchmark cible la capacité à émuler le professionnalisme des chercheurs humains, au-delà de l'exécution macro.

Agents IABenchmarksClaude
SIG
78
HYP
25
arXiv cs.AI·

A Geometric Gaussian Mixture Representation of Plane Curves

Représentation probabiliste de courbes planes via mélange gaussien. Les auteurs proposent une approximation polygonale avec incertitude normale, transformée en modèle de mélange gaussien (GMM) qui préserve la géométrie locale. Applicable aux courbes lisses, fermées, ouvertes et auto-intersectantes, avec applications en CAO incertaine, modélisation d'obstacles robotiques et planification de trajectoires.

PapersRobotiqueRaisonnement
SIG
72
HYP
15
arXiv cs.AI·

Human Adults and LLMs as Scientists: Who Benefits from Active Exploration?

Étude comparative montrant que l'exploration active améliore significativement le raisonnement causal conjonctif chez les adultes humains, contrairement aux paradigmes passifs. Les LLMs modernes atteignent des performances proches des humains en précision d'inférence, mais avec des stratégies d'exploration moins efficaces et des écarts conjonctif-disjonctif similaires.

RaisonnementÉvaluations
SIG
72
HYP
15
arXiv cs.AI·

Trading Engagement for Sustainability: Carbon-Aware Re-ranking for E-commerce Recommendations

Étude sur les systèmes de recommandation e-commerce intégrant l'empreinte carbone des produits. Les chercheurs estiment les PCF manquantes via recherche sémantique et prompting LLM, puis appliquent un re-ranking post-hoc sur BPR, NeuMF et LightGCN. Sur Amazon Reviews (3 catégories), des réductions carbone substantielles sont possibles avec coût d'engagement minimal.

RAGEmbeddings
SIG
72
HYP
18
arXiv cs.AI·

Online Pandora's Box for Contextual LLM Cascading

Papier arXiv proposant un modèle contextuel en ligne pour optimiser les requêtes à plusieurs APIs LLM. Le cadre « Pandora's Box » adapte la sélection d'APIs selon le contexte, avec une phase de requête (coût dépendant de la sortie) et une phase de sélection (récompense observée). L'approche combine estimation GMM des indices de réservation et bornes UCB, atteignant une regret cumulée en Õ(√T).

Agents IARaisonnementBenchmarks
SIG
75
HYP
15
arXiv cs.AI·

Beyond Post-hoc Explanation: Toward Glassbox AI via Probabilistic Mediation

Article proposant une architecture « Glassbox » pour rendre les LLM transparents dans les contextes institutionnels critiques (santé, droit, administration). Au lieu d'explications post-hoc instables, utiliser des réseaux bayésiens comme couches de médiation ante-hoc pour encoder la connaissance de domaine, les hypothèses causales et les dépendances probabilistes avant l'inférence.

RaisonnementSécurité IAAlignement
SIG
72
HYP
25
arXiv cs.AI·

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

PTD-PO, un framework de distillation de politique pour optimiser les modèles vision-langage (2B-8B paramètres) via renforcement. Fournit une supervision dense au niveau des tokens sans exposer la réponse, utilisant des indices structurés (attention spatiale, étapes de raisonnement) et une divergence Jensen-Shannon Top-K pour stabiliser l'apprentissage.

VisionReinforcement learningRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning

TRUST, une méthode de reinforcement learning, améliore les décisions d'appel d'outils des agents LLM en intégrant la quantification d'incertitude dans la conception des récompenses. Testée sur plusieurs benchmarks, elle réduit les invocations d'outils non supportées et les hallucinations tout en maintenant des estimations d'incertitude fiables.

Agents IAReinforcement learningRaisonnement
SIG
72
HYP
18
arXiv cs.AI·

Declarative Skills for AI Agents in Knowledge-Grounded Tool-Use Workflows

Étude comparative de trois paradigmes d'orchestration pour agents IA en workflows de service client : agents déclaratifs (skills en langage naturel), agents impératifs (machines d'état), et baseline non-scaffoldé. Tests sur 5 LLMs et 2 régimes de retrieval. Résultat : la qualité du retrieval est le goulot dominant ; les skills déclaratifs améliorent la précision sur tâches procédurales quand le retrieval est bon.

Agents IARAGPrompt engineering
SIG
72
HYP
18
arXiv cs.AI·

A Geometric Account of Activation Steering through Angle-Norm Decomposition

Étude empirique sur le steering d'activation dans les modèles de langage. Les auteurs décomposent les interventions en composantes angulaires et radiales, montrant que les concepts résident principalement dans la structure angulaire mais que la norme reste importante pour la stabilité. Recommandation : paramétrer le steering par composantes interprétables plutôt que par un coefficient additif unique.

RaisonnementAlignementPapers
SIG
75
HYP
15
arXiv cs.AI·

StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents

StainFlow est un modèle de récompense de processus pour agents GUI basé sur le suivi d'entités (« stain tracking »). Il décompose objectivement les tâches en phases via l'évolution des états d'entités visuelles, et construit dynamiquement des fenêtres de preuve pour évaluer les étapes clés. Résultats : +3,2% de succès RL et +1,8% de précision sur AndroidWorld et OGRBench.

Agents IAReinforcement learningÉvaluations
SIG
72
HYP
18
arXiv cs.AI·

Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics

Article de position argumentant qu'une science rigoureuse de l'IA doit étudier les dynamiques d'entraînement plutôt que d'analyser les modèles post-hoc. Propose d'étendre les lois d'échelle au-delà de la perte pour prédire capacités, biais et comportements de sécurité. Examine progrès en interprétabilité mécaniste, équité et biais de simplicité.

PapersRaisonnementSécurité IA
SIG
72
HYP
18
arXiv cs.AI·

Lean4Agent: Formal Modeling and Verification for Agent Workflow and Trajectory

Lean4Agent est un framework utilisant Lean4 (langage formel à types dépendants) pour modéliser et vérifier formellement les workflows d'agents IA. FormalAgentLib permet de vérifier la cohérence sémantique des workflows, tandis que LeanEvolve les améliore itérativement. Sur SWE-Bench-Verified et ELAIP-Bench, les workflows vérifiés surpassent les autres de 11,94%, avec gains supplémentaires de 7,47% via LeanEvolve.

Agents IARaisonnementBenchmarks
SIG
78
HYP
25
arXiv cs.AI·

SafeGene: Reusable Adapters for Transferable Safety Alignment

SafeGene propose des adaptateurs de sécurité réutilisables pour préserver l'alignement de sécurité lors du fine-tuning de LLMs open-weight. Le module découple la sécurité des mises à jour spécifiques aux tâches via des vecteurs de sécurité transférables et une recalibration par couche. Expériences sur plusieurs familles de modèles montrent réduction des réponses nuisibles sans perte de performance.

Sécurité IAAlignementFine-tuning
SIG
72
HYP
25
arXiv cs.CL·

Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling

Eval-Skill, une méthode d'exploration guidée, synthétise des compétences d'évaluation réutilisables pour la modélisation de récompenses sans rubrique rigide. Entraîné sur 100 cas par domaine, le système génère progressivement des workflows et principes injectés directement dans le contexte du juge. Sur RewardBench 2, gains de +13.44% (Qwen3-8B) et +18.51% (DeepSeek-V4-Flash).

Reinforcement learningÉvaluationsRaisonnement
SIG
78
HYP
25
arXiv cs.CL·

Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition

Méthode de contrastive training pour améliorer la reconnaissance vocale en code-switching (alternance entre langues). Les auteurs identifient les régions critiques, génèrent des contre-exemples acoustiquement plausibles via LLM, puis affinent Whisper-small avec LoRA. Résultats : réduction >2% des erreurs sur CS-FLEURS et ViMedCSS.

VoixFine-tuningReinforcement learning
SIG
72
HYP
18
arXiv cs.CL·

OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios

OpenHalDet est un benchmark unifié pour la détection d'hallucinations dans les LLM. Il standardise l'évaluation (construction de prompts, génération, annotation, scoring) et supporte trois familles de détecteurs : black-box (sorties uniquement), gray-box (signaux probabilistes), white-box (signaux internes). Codebase open-source disponible.

BenchmarksSécurité IAÉvaluations
SIG
78
HYP
18
arXiv cs.AI·

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

Les agents basés sur des modèles de fondation souffrent d'un écart sim-to-réel. Cet article formalise le problème via le cadre MDP (observation, action, transition, récompense) et propose d'adapter les solutions classiques de la robotique (randomisation de domaine). Exemple : l'appel d'outils multilingue révèle des écarts d'espace d'observation causant des actions invalides malgré une intention sémantique correcte.

Agents IARaisonnementSécurité IA
SIG
72
HYP
28
arXiv cs.CL·

ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning

ThinkBooster est un framework unifié pour le scaling du calcul au test-time (TTC) des modèles de raisonnement. Il intègre une librairie Python modulaire, un benchmark évaluant performance et efficacité computationnelle, et un service proxy compatible OpenAI. Résultats sur tâches mathématiques et de codage montrent les trade-offs performance-coût des stratégies TTC.

RaisonnementBenchmarksGénération de code
SIG
78
HYP
25
arXiv cs.CL·

Interpreting Brain Responses to Language with Sparse Features from Language Models

Des chercheurs utilisent des autoencodeurs creux (SAE) issus de modèles de langage pour interpréter les réponses cérébrales au langage via fMRI 7T. Sur 8 participants écoutant 200 phrases, ils identifient des populations de voxels sensibles au contenu lié aux personnes et montrent que les régions frontales s'expliquent par la surprise seule, tandis que le réseau fronto-temporal partage des features communes.

PapersRaisonnementÉvaluations
SIG
78
HYP
15
arXiv cs.CL·

The Dark Regulome: Disentangling Predictability from Regulation in Genomic Foundation Models

Étude des fondations génomiques pour identifier les éléments régulateurs du génome non-codant (dark regulome) dans les gliomes. Les auteurs séparent la prédictibilité de séquence de la régulation réelle via résidualisation-permutation sur trois modèles (Caduceus-Ph, HyenaDNA, Enformer). Résultat : horizon régulateur proximal de 10kb, enrichissement 3.3× en eQTL cérébraux, mais hiérarchie LM non reproductible.

BenchmarksPapersRaisonnement
SIG
72
HYP
15
arXiv cs.CL·

Progress-SQL: Improving Reinforcement Learning for Text-to-SQL via Progressive Rewards

Progress-SQL propose un cadre d'apprentissage par renforcement multi-tour pour la génération Text-to-SQL. La méthode introduit un arbre de diagnostic guidé par oracle (ODT) qui abstrait les requêtes SQL au niveau des clauses et fournit des récompenses progressives mesurant l'amélioration du SQL initial au final. Évaluée sur BIRD, Spider et variantes robustesse.

Reinforcement learningGénération de codeRaisonnement
SIG
72
HYP
18
arXiv cs.CL·

Quantifying Media Representation Dynamics Across 25 Years of News Reporting on Policing-related Deaths

Analyse computationnelle de 4 000 articles canadiens sur les décès liés à la police (25 ans). Le modèle PerspectiveGap révèle que les perspectives de bureaucrates d'État apparaissent 3× plus que celles du public (familles, témoins, avocats). Les comptes rendus officiels sont cliniques ; les discours civils chargés émotionnellement. La représentation civile augmente récemment.

PapersBenchmarks
SIG
72
HYP
15
arXiv cs.CL·

When Better Codebooks Are Not Enough: Predictive Performance and Behavioral Reliability in LLM Political Event Coding

Étude sur le codage d'événements politiques avec LLM : une meilleure précision ne garantit pas la fiabilité comportementale. Des codebooks experts optimisés (définitions claires, exemples, contexte) améliorent les performances, mais les modèles échouent les tests de fiabilité sous variations contrôlées (noms de labels, ordre, mappings). La précision seule ne suffit pas pour les applications en sciences sociales.

ÉvaluationsRaisonnementPrompt engineering
SIG
72
HYP
15
arXiv cs.LG·

The Identity Trap in EEG Foundation Models: A Diagnostic Audit

Étude diagnostique des modèles fondamentaux EEG révélant l'« Identity Trap » : les modèles (LaBraM, CBraMod, REVE) confondent l'identité du sujet avec les biomarqueurs cliniques. FMScope, un protocole de 5 diagnostics, montre que la variance sujet domine 13-89x le hasard et persiste après fine-tuning (+10-63 pp). L'effacement de cet axe améliore le décodage du label (+6-12 pp).

BenchmarksÉvaluationsSécurité IA
SIG
78
HYP
15